본문으로 건너뛰기
X (Twitter)조회 1

Grok 보조학습·에이전트 평가·AI 비디오·음악 서비스 최신 동향

Grok이 SpaceX 엔지니어링 자료를 보조 학습에 도입하고, corpus_abstention 루브릭으로 RAG 에이전트의 누출을 줄였다는 소식이 주요 흐름이다.

이 요약은 AI가 원문을 분석해 생성했습니다. 정확한 내용은 원문 기준으로 확인하세요.

TL;DR

Elon Musk는 Grok의 2T 보조 학습 단계에 SpaceX의 엔지니어링 코퍼스를 추가한다고 밝혀 Grok의 엔지니어링 응답 능력 강화가 예고됐다. 에이전트 운영 측면에서는 RAG 파이프라인이 부분적 문서 커버리지에서 모델이 누락된 정보를 파라메트릭 지식으로 보완해 '누출'을 일으킨다는 문제가 제기되었고, Claude Code가 작성한 corpus_abstention 루브릭과 33개 시나리오 기반 평가로 베이스라인 19/33에서 30/33으로 향상되며 비근거 응답이 6건에서 0건으로 감소했다. Alibaba Cloud는 HappyHorse 1.1과 WonderClip을 활용한 AI 비디오 해카톤을 통해 15초 영화 제작 워크플로를 시연했고, ElevenLabs는 ElevenMusic의 무료 월간 생성 횟수를 400으로 늘리며 창작 지원을 확대했다. 중국의 모델 가중치·데이터 해외 전송 규제 논의는 해외 액세스 제한 시 기업 유치·현지 구축 압력이 높아질 가능성을 제기했다.

𝕏 실시간 트렌드 토픽

🔥 SpaceX 엔지니어링 코퍼스 보조 학습으로 Grok 성능 강화포스트 2

Elon Musk는 Grok의 2T 보조 학습에 SpaceX의 엔지니어링 데이터(ITAR 제외)를 추가한다고 밝혀 엔지니어링 관련 응답 능력이 강화될 전망이다. Grok은 게시물에서 'solid workhorse'로 언급되며 속도·가격 경쟁력을 강조받았다.

세부 내용 보기
  • 2T 보조 학습 단계에 SpaceX의 대규모 엔지니어링 코퍼스를 투입 예정이며 ITAR 관련 자료는 제외된다.
  • 목표는 Grok의 엔지니어링 태스크 정확도 향상으로, 모델이 도메인 특화 지식을 더 잘 활용하도록 하는 것임이 명시됐다.
  • 같은 기간 사용자·비교 평가 맥락에서 Grok은 가성비와 속도 측면에서 우위를 언급받았다.
찬성다수

도메인 특화 코퍼스 추가는 엔지니어링 질문에서 근거 기반 응답과 정확도를 높여 실무 유용성을 개선할 수 있다.

중립소수

ITAR 등 규제 자료는 제외되어 법적·안보적 제약을 고려한 보완 학습 방식이 적용되고 있다.

원문 트윗 2개 보기

📈 RAG 에이전트의 부분적 검색 커버리지와 corpus_abstention 평가 도입포스트 1

RAG 파이프라인은 검색 결과가 주제적으로는 적중하나 세부를 빠뜨릴 때 모델이 파라메트릭 지식으로 빈칸을 메우며 비근거 응답을 생성하는 문제가 발생한다. Claude Code가 생성한 corpus_abstention 루브릭으로 33개 시나리오를 평가한 결과 베이스라인 19/33에서 규칙 제거·강제 검색 조치 후 30/33으로 개선되고 비근거 응답이 6건에서 0건으로 감소했다.

세부 내용 보기
  • 문제 원인: 검색 파이프라인이 주제 적중 문서를 반환해도 상세 커버리지가 부족하면 모델이 자체 지식으로 응답을 채운다.
  • 해결 접근: 에이전트 평가용 커스텀 루브릭(corpus_abstention)을 작성해 사례별로 판정 범주를 부여하고, 33개 시나리오로 세분화해 평가했다.
  • 평가 결과: 베이스라인 19/33, Off-domain은 3/3 통과, 일부 in-corpus 케이스에서 출처는 인용했으나 출처가 주장하지 않은 추가 주장이 관찰되었고 지침 수정으로 30/33, 비근거 응답 0건이 확인됐다.
찬성다수

케이스 기반 루브릭과 강제 검색 규칙은 RAG 에이전트의 비근거 응답을 식별·감소시키는 데 효과를 보였다.

중립소수

에이전트 설계에서 개발자의 지시·정책이 결과에 큰 영향을 미치므로 평가와 배포 과정에서 책임 분배가 중요하다.

원문 트윗 1개 보기

Akshay

@akshay_pachaar

1달 전

Karpathy said something you'll regret ignoring: "You are still responsible for your software, just as before. You are not allowed to introduce vulnerabilities because of vibe coding. " He said it while drawing the line between vibe coding and agentic engineering. Agents write more of the code now, but none of that takes the responsibility off you. The assumption underneath that is that a careful enough reader catches the problem. But some failures don't show up in anything there is to read. For instance, a common fear with a RAG agent is that it could hallucinate when a question asks something outside its corpus. But such cases are actually well handled by any competent model now. If nothing in the retrieved context looks relevant, there's no material to build an answer on. Instead, the majority of failures originate when the retrieved context has partial coverage. The retrieval pipeline returns context that's topically correct but doesn't cover the full question, and the model completes the remainder from parametric knowledge. There are no token-level labels in the output to tell what was generated using retrieved context and what came from weights. Both are streamed the same way. Detecting this for production-grade apps needs a metric written for it, one that's also aligned with principles of agentic engineering. And the solution is actually implemented in the eval skill that comes with Google’s Agents CLI. I described the concern to Claude Code in plain English. It read the agent's code, came back with a plan I approved. It then reported that no built-in metric isolates the behaviour and wrote a custom rubric called corpus_abstention. It assigned a single categorical verdict per case rather than aggregating everything into one score, since the built-in raters regenerate their rubrics each run and leave no stable number to trend. → GROUNDED_ANSWER → CORRECT_ABSTENTION → UNGROUNDED_ANSWER (answered entirely from outside knowledge) → MIXED_LEAKAGE (grounded, but slips in one unsupported claim) → WRONG_ABSTENTION (refused something the docs actually covered) After this, it automatically generated 33 scenarios partitioned by where the failure could occur, like: - in-corpus - off-domain - out-of-corpus but plausibly answerable - boundary cases where the topic is covered, but a specific detail isn't. The baseline score was 19 of 33. - Off-domain passed 3 of 3, as expected. - But 6 of 15 in-corpus cases retrieved the right document, cited it correctly, answered accurately, and added a claim the source never made. The root cause was one line in the agent's instruction: "If you already know the answer to a simple question and no document lookup is needed, you may respond directly without citations." The eval skill helped flag this, and then Claude removed it and forced retrieval on every question. This took the suite to 30 of 33, and ungrounded answers went from 6 to 0. The full recording of my run is below, and I worked with the Google Cloud team on this. Agents CLI GitHub repo → https:// fandf.co/4wdWtku (don't forget to star ) I wrote up the full build covering all six steps from install to enterprise registration. It includes the eval scorecard, the instruction loophole the eval caught before deployment, and what the deployment process actually looks like end-to-end. Read it below.

트윗에 첨부된 이미지
💬 0 0 1👁 916

Alibaba Cloud의 AI 비디오 해카톤과 HappyHorse 1.1 활용 사례포스트 4

Alibaba Cloud는 Tokyo 해카톤에서 HappyHorse 1.1을 사용해 참가자들이 15초 분량의 AI 생성 영상을 단시간에 제작하도록 지원했고, WonderClip은 스크립트부터 최종 컷까지 자동화하는 워크플로를 시연했다. 대회에는 50여명 이상의 크리에이터가 참가했다.

세부 내용 보기
  • 해카톤은 밤샘 제작 형태로 진행되어 컨셉을 즉시 영상으로 변환하는 워크플로를 강조했다.
  • 우수작은 HappyHorse 1.1로 제작된 15초 영화 형식이며, 플랫폼에서 일반 사용자 대상 체험도 제공된다.
  • WonderClip은 기업 단위 자동화된 영상 제작 파이프라인(스크립트 → 컷 편집)을 제시해 제작 시간을 단축하는 흐름을 보였다.
원문 트윗 2개 보기

📈 ElevenLabs의 ElevenMusic 무료 생성 확대 및 공모전포스트 3

ElevenLabs는 ElevenMusic의 무료 월간 생성 한도를 400곡으로 늘려 사용자의 실험·공유 여건을 확대했고, 상금 $50,000 규모의 공모전을 개최해 상위 스트리밍 아티스트에게 보상을 제공한다.

세부 내용 보기

📈 중국의 모델 가중치·학습 데이터 해외 전송 규제 논의와 파장포스트 1

중국 상무부가 AI 학습용 핵심 데이터의 해외 이전과 해외 사용자의 모델 가중치 다운로드 제한을 논의한 정황이 보도되었고, 제재가 현실화되면 외국 자본 유치·현지 인력 확보를 위한 '중국 내 구축' 압력이 커질 가능성이 제기됐다.

세부 내용 보기
  • 논의 대상에는 학습용 핵심 데이터의 해외 전송 제한과 해외 사용자의 모델 가중치 다운로드 제한이 포함됐다.
  • 제한 정책은 기업의 기술·서비스 배포 전략에 영향을 미쳐, 일부는 중국 내 인프라·인력 투자를 고려할 수 있다.
  • 해당 보도는 Alibaba·ByteDance·Zhipu AI 등과의 논의 정황을 인용해 전해졌다.
찬성소수

해외 전송 제한은 핵심 데이터·모델의 유출을 막고 국내 역량 강화를 유도할 수 있다.

반대소수

제한은 국제 협력과 경쟁을 약화시키고 해외 기업의 접근성을 떨어뜨려 생태계 경쟁을 저해할 우려가 있다.

원문 트윗 1개 보기

용어 해설

검색 증강 생성(RAG)
검색(검색·유사도 기반 문서 반환) 결과를 모델 입력으로 결합해 응답을 생성하는 방법이다. 문서에서 직접 근거를 끌어오고, 모델은 반환된 컨텍스트를 바탕으로 부족한 부분만 생성해 응답을 완성하므로 외부 지식 활용과 정확도 향상에 유리하다.
코퍼스-거부 지표(corpus_abstention)
에이전트가 검색 결과(코퍼스)로부터 답을 생성했는지 여부를 판별하는 범주형 평가 루브릭이다. 답변을 근거로만 작성했는지, 외부 지식으로 보완했는지 등을 케이스별로 분류해 불완전한 검색 커버리지로 인한 '누출'을 식별한다.
Agents CLI
에이전트 도구 체인에서 배포·평가·자동화 스크립트를 제공하는 커맨드라인 툴이다. 에이전트 실행 환경·평가 루틴을 표준화해 반복적 검증과 맞춤형 루브릭 적용을 용이하게 만든다.
보조(추가) 학습(Supplemental Training)
이미 학습된 모델에 특정 도메인·코퍼스를 추가로 학습시키는 절차다. 전체 재학습이 아니라 도메인 특화 데이터를 덧입혀 성능을 향상시키며, ITAR 등 규제 제외 항목을 선별해 적용할 수 있다.
AI 분석 전체 내용 보기

AI 요약 · 북마크 · 개인 피드 설정 — 무료

출처 · 인용 안내

원문 발행 2026. 07. 21.수집 2026. 07. 21.출처 타입 TWITTER

인용 시 "요약 출처: AI Trends (aitrends.kr)"를 표기하고, 사실 확인은 원문 보기 기준으로 진행해 주세요. 자세한 기준은 운영 정책을 참고해 주세요.