TL;DR
이번 기간에는 소형 오픈소스 이족보행 로봇 Microduck의 직접 학습 구조, Kimi Code의 로컬 웹 세션 원격 접속 기능, Wan 3.0의 영상·오디오 통합 생성이 새 기능과 공개 프로젝트로 부상했습니다. Microduck 관련 코드는 머리 무게가 전체의 38%인 조건에서 EMA로 추적 오차를 완화하고, 모터 백래시를 비구동 힌지로 모델링하는 구현을 담았습니다. 문서 처리에서는 LlamaParse가 양식의 필드·체크박스·주석·섹션을 바운딩 박스와 출처 인용으로 구조화해야 downstream agent의 추가 추출 부담을 줄일 수 있다는 실무 관점을 제시했습니다. PRAXIST는 여러 agent가 접근법을 병렬 탐색하고 실험과 실패 공유를 반복하는 연구 루프를 사용해 75개 과제에서 49개 gold medal을 기록했으며, Claude Code의 35개와 비교해 약 3천 달러 대 약 3만8천 달러의 토큰 비용을 기록했습니다. Qwen3.8은 클라우드를 거치지 않는 로컬 copilot, WhatsApp 기반 사업 운영, 창작자가 자리를 비운 동안 작동하는 autonomous agent 사례로 확장됐습니다.
𝕏 실시간 트렌드 토픽
📈 Microduck의 직접 학습 로봇과 보상 모델링포스트 2
25cm 크기의 오픈소스 이족보행 로봇 Microduck이 15개 액추에이터와 카메라·스피커·LiDAR·NFC·Bluetooth·Wi-Fi 센서를 갖추고 직접 학습하는 구조로 공개됐습니다.
세부 내용 보기
- Microduck은 누구나 부품을 출력하고 학습시킬 수 있는 25cm 오픈소스 이족보행 로봇으로, 15개의 액추에이터와 카메라·스피커·LiDAR·NFC·Bluetooth·Wi-Fi 센서를 한 몸체에 담아 행동과 센서 입력을 함께 다루는 구성을 취합니다. 공개된 구현은 로봇을 직접 훈련하려는 개발자가 하드웨어와 학습 코드를 함께 확인할 수 있다는 점에 의미가 있습니다.
- microduck_rl의 보상 모델은 머리 추적 오차를 그대로 강하게 벌점화하지 않고 EMA로 평활화해 직류 편향만 주로 벌점으로 남깁니다. 머리 무게가 오리 전체의 38%라 추적을 지나치게 조이면 보행이 손상되고 자연스러운 진동이 생긴다는 물리 조건을 보상 설계에 반영한 방식입니다.
- 모터의 기어 유격은 모터와 직렬로 매우 작은 범위의 비구동 힌지를 추가해 모델링합니다. 센서·구동기·물리적 오차를 학습 루프에 함께 넣으면 시뮬레이션과 실제 보행 사이의 차이를 줄이는 데 필요한 구체적인 구현 근거가 됩니다.
원문 트윗 2개 보기
Directive Creator
So your telling me it's Open Source and I can print STL parts for it? Take my money. … https://gr illz-microduck-simulator.onrender.com
We have a huge news to share today! Today we are unveiling the first truly accessible RL robot - welcome Microduck A 25 cm tiny open-source biped with 15 actuators and packed with sensors (camera, speaker, LiDAR, NFC, bluetooth, wifi, etc) that you train yourself with
Binh
just had a quick look at microduck_rl the codebase is very elegant, i’d recommend reading the agent.md since it contains quite a few fun quirks for reward modeling like head tracking too tight impairs walking cause the head is 38% of the duck’s weight, so it naturally oscillates -> to solve this, smooth the head tracking error using ema, essentially penalizing only the dc bias also a few other quirks as you dig deeper into the codebase like how they model the backlash of the motor by adding an unactuated hinge (with very small range) in series with the motor gg @antoinepirrone
📈 Kimi Code의 로컬 웹 세션 원격 제어포스트 1
Kimi Code 0.39.0이 실험 기능으로 로컬 웹 세션을 원격에서 접속하는 Remote Control을 추가했습니다.
세부 내용 보기
- Kimi Code 0.39.0은 로컬에서 실행 중인 웹 세션을 다른 위치에서 접속할 수 있는 Remote Control을 실험 기능으로 추가했습니다. 기능의 핵심은 기존 세션을 새로 만드는 대신 원격 제어용 접속 경로를 열어 작업 환경을 이어가는 데 있습니다.
- 사용자는 KIMI_CODE_EXPERIMENTAL_REMOTE_CONTROL=1 환경 변수를 켠 뒤 kimi rc, kimi web --remote-control 또는 웹 세션의 /remote-control 명령으로 기능을 시작합니다. 기능 활성화와 세션 실행 명령이 분리되어 있어 실험 기능을 명시적으로 켜는 흐름입니다.
- 이 변경은 Kimi Code 사용 범위를 로컬 터미널 앞에 앉아 있는 상황에서 원격 웹 접속이 가능한 작업 방식으로 넓힙니다. 다만 원문은 실험 기능이라는 점만 밝히며 안정성이나 보안 성능 수치는 제시하지 않았습니다.
📈 Wan 3.0의 30초 영상·오디오 통합 생성포스트 2
Wan 3.0이 DeepInfra와 PixelDojo에서 제공되며, 하나의 모델로 영상과 오디오를 함께 생성하고 멀티모달 참조를 사용할 수 있게 됐습니다.
세부 내용 보기
- Wan 3.0은 영상과 오디오를 하나의 모델에서 처리하며 30초 길이의 클립을 생성하는 서비스로 공개됐습니다. DeepInfra 게시물은 1080P 출력, 이미지·파일·웹 페이지를 포함한 멀티모달 참조, 동일 캐릭터 유지 기능을 함께 제시했습니다.
- 생성 입력은 텍스트에 한정되지 않고 이미지·파일·웹 페이지까지 참조 자료로 들어가며, 출력은 영상과 사운드를 결합한 클립으로 이어집니다. DeepInfra에서는 초당 0.20달러로 안내됐고, PixelDojo에서는 30초 사운드 영상과 prompting guide를 제공했습니다.
- 참조 입력과 캐릭터 일관성, 오디오 결합을 한 흐름에 묶으면 별도 영상·음향 도구를 이어 붙이는 작업을 줄일 수 있습니다. 원문에 나온 제공 채널과 가격은 DeepInfra의 안내에 한정되며 PixelDojo 게시물에는 별도 가격이 제시되지 않았습니다.
원문 트윗 2개 보기
Wan
Wan 3.0 is now on @DeepInfra ! Video + audio in one model, with 30-second generation and multimodal references. Now available on DeepInfra.
Video and audio, from one model. Wan3.0-Video from @Alibaba_Wan is now on DeepInfra: 30-second clips at 1080P, omni-modal reference (images, files, even web pages), and characters that stay the same character. $0.20/sec → https:// deepinfra.com/Wan-AI/Wan3.0- Video …
Wan
Wan 3.0 is now live on @PixelDojoAI ! Check out the guide and start creating.
WAN 3.0 is live at Pixel Dojo. Thirty seconds with sound. Fast mode. Prompting guide so you stop guessing. https:// pixeldojo.ai/wan-3-0-video https:// pixeldojo.ai/guides/wan-3-0 -prompting-guide …
➖ PDF 파싱에서 구조화 메타데이터와 출처 인용포스트 1
LlamaParse 관련 실무 경험이 문서 유형별 바운딩 박스·신뢰도·도메인 주석을 먼저 구축해야 downstream agent의 재추출 부담을 줄일 수 있다고 짚었습니다.
세부 내용 보기
- 기업 PDF는 문서 유형마다 형식이 달라 단순히 Markdown으로 변환하는 것만으로는 양식의 의미를 보존하기 어렵습니다. LlamaParse는 필드·체크박스·주석·섹션을 감지하고 위치 정보를 붙여 양식이 작성됐는지까지 구조화된 정보로 출력하는 방향을 취합니다.
- 처리 과정은 문서 요소를 유형별로 찾고, 각 요소의 정밀한 바운딩 박스와 신뢰도·도메인별 주석을 생성한 뒤 downstream agent가 사용할 메타데이터와 출처 인용으로 연결하는 방식입니다. 차트와 손글씨 같은 시각 형식은 디지털 정보로 변환하기 어렵고, 위치 정보가 부정확하면 인용도 정밀해지기 어렵습니다.
- 이 접근은 agent가 매번 원문을 다시 읽고 별도 LLM 추출을 수행하는 부담을 앞단의 파싱 단계로 옮깁니다. 원문은 문서 하위 유형별로 모델과 harness를 조정하면 frontier model보다 정확도와 비용의 조합을 경쟁력 있게 만들 수 있다고 설명하지만 구체적인 수치는 제시하지 않았습니다.
📈 PRAXIST의 병렬 실험형 자율 연구포스트 1
PRAXIST가 측정 가능한 목표와 평가자를 입력으로 받아 여러 agent가 병렬로 접근법을 탐색하고, 실험·실패 공유·반복 학습을 거쳐 해법과 근거를 산출하는 구조로 소개됐습니다.
세부 내용 보기
- PRAXIST는 목표·제약·성공 조건을 정하면 여러 Research Peer가 서로 다른 접근법을 병렬로 탐색하는 자율 연구 팀 구조입니다. 각 agent는 실험을 실행하고 결과를 평가하며 실패에서 얻은 정보를 공유해 다음 라운드의 접근법에 반영합니다.
- 공개 비교에서 PRAXIST는 75개 과제 중 49개 gold medal을 기록했고 Claude Code + Opus 4.8은 35개를 기록했습니다. 토큰 비용은 PRAXIST 약 3천 달러, Claude Code 약 3만8천 달러로 제시됐으며, 최종 결과와 함께 해당 결과에 도달한 근거도 산출합니다.
- 성공 여부를 사람이 매번 판단하는 대신 측정 가능한 기술 목표와 evaluator를 먼저 지정하면 탐색·검증·학습의 반복을 자동화할 수 있습니다. 따라서 단순 코드 작성보다 실험 결과와 증거가 필요한 연구형 과제에 초점을 둔 agent 구조로 읽힙니다.
📈 Qwen3.8의 로컬 copilot·WhatsApp 사업·자율 agent 사례포스트 1
Qwen3.8 관련 행사 안내가 클라우드에 연결하지 않는 로컬 AI copilot, WhatsApp 기반 사업 운영, 창작자가 자리를 비운 동안 작동하는 autonomous agent 사례를 예고했습니다.
세부 내용 보기
- Qwen3.8 Show & Tell은 Qwen3.8을 실제 업무 흐름에 연결하는 세 가지 사례를 예고했습니다. 로컬 AI copilot은 클라우드에 접속하지 않는 방식이며, 또 다른 사례는 Qwen3.8-27B로 WhatsApp에서 사업 전체를 운영하는 구조입니다.
- 세 번째 사례는 제작자가 잠든 동안에도 작업을 진행하는 autonomous agent로 제시됐습니다. 원문은 행사에서 시연될 사용 사례의 제목과 일정만 제공하며, 각 시스템의 내부 처리 단계나 성능 수치는 밝히지 않았습니다.
- 로컬 실행·메시징 기반 업무·자율 실행이라는 서로 다른 배치 환경을 한 행사에 묶으면서 Qwen3.8의 활용 범위를 제시합니다. 행사는 9월 1일 17:00 GMT+8에 예정됐다고 안내됐습니다.
용어 해설
- 강화학습(Reinforcement Learning)
- — 환경에서 행동을 선택하고 보상 신호를 받는 과정을 반복하며 정책을 학습하는 방법입니다. Microduck에서는 로봇의 움직임과 보상 설계를 직접 조정하는 방식으로 활용됩니다.
- 액추에이터(Actuator)
- — 전기 신호를 실제 움직임으로 바꾸는 구동 장치입니다. Microduck은 15개의 액추에이터를 사용해 두 발로 걷는 동작을 구현합니다.
- 지수 이동 평균(EMA)
- — 최근 오차에 더 큰 가중치를 두면서 값의 급격한 변화를 완화하는 계산 방식입니다. Microduck의 머리 추적 오차를 매끄럽게 만들어 보행을 방해하는 진동을 줄이는 데 쓰입니다.
- 기어 백래시(Backlash)
- — 모터와 기어가 움직임을 바꿀 때 생기는 유격이나 반응 지연입니다. microduck_rl은 모터와 직렬로 작은 범위의 비구동 힌지를 추가해 이 특성을 모델링합니다.
- 바운딩 박스(Bounding Box)
- — 문서나 이미지 안에서 특정 요소가 차지하는 위치를 사각형 좌표로 표시하는 정보입니다. PDF 파싱에서는 필드와 주석의 위치를 정확히 잡아 구조화된 결과와 출처 인용에 연결합니다.
- 멀티모달 참조(Multimodal Reference)
- — 이미지·파일·웹 페이지처럼 서로 다른 형식의 입력을 생성 과정의 참고 자료로 사용하는 방식입니다. Wan 3.0은 이런 참조를 받아 30초 길이의 영상과 오디오를 한 모델에서 생성합니다.
- 실험형 연구 루프(Research Loop)
- — 목표와 성공 조건을 정한 뒤 여러 접근법을 병렬로 실행하고, 결과를 평가하며 다음 시도에 실패 정보를 반영하는 반복 과정입니다. PRAXIST는 이 구조로 최종 해법과 근거를 함께 산출합니다.
AI 요약 · 북마크 · 개인 피드 설정 — 무료
출처 · 인용 안내
인용 시 "요약 출처: AI Trends (aitrends.kr)"를 표기하고, 사실 확인은 원문 보기 기준으로 진행해 주세요. 자세한 기준은 운영 정책을 참고해 주세요.

