본문으로 건너뛰기

독립 평가, Muse Agent, 반복형 Transformer와 도메인 특화 AI 인프라

제3자 AI 평가 논쟁과 Muse의 Agent 제품화, 반복형 Transformer·도메인 특화 Harness의 확장

이 요약은 AI가 원문을 분석해 생성했습니다. 정확한 내용은 원문 기준으로 확인하세요.

TL;DR

이번 기간에는 AI 모델 출시 전 독립 평가와 연구소 간 자율규제를 둘러싼 논의가 집중됐고, OpenAI와 Anthropic의 제3자 평가기관 도입 가능성이 구체적인 쟁점으로 떠올랐습니다. 기술 측면에서는 Recurrent Looped Transformer가 토큰마다 상태를 이어 붙여 시퀀스가 길어질수록 계산 깊이를 늘리는 설계로 제시됐지만, 추론 성능과 하드웨어 이득은 아직 측정되지 않았습니다. Meta의 Muse는 보안·기억·추천 피드·소프트웨어 작업을 묶은 Agent 제품으로 확산됐으며, 여러 반응에서 실제 저장소 작업 성능과 사용성이 함께 평가됐습니다. 한편 도메인 특화 Harness, FlyOCR, 통합 시각 모델, Agent 평가 인프라처럼 범용 모델을 특정 업무와 검증 체계에 맞게 감싸는 흐름도 이어졌습니다.

𝕏 실시간 트렌드 토픽

🔥 AI 모델 제3자 평가와 연구소 간 자율규제포스트 3

OpenAI와 Anthropic이 외부 평가기관을 모델 운영에 넣는 방안을 검토하면서, 평가기관의 독립성·법적 책임·업계 간 동료 심사의 범위가 충돌했습니다. 핵심 쟁점은 모델 출시 전 안전 점검을 누가 맡고 어떤 규칙으로 공개할지에 모였습니다.

세부 내용 보기
  • Dario가 일정 역량 기준을 넘는 모델에 국가 규제체계와 국제 협약을 적용하고, 모델 출시 전 독립 평가기관을 넣는 구상을 내놓으면서 논의가 시작됐습니다. Sam은 제3자 평가 도입에 동의했고, Elon은 경쟁 연구소가 1~2주 동안 새 모델의 안전성을 동료 심사하는 자율규제 방식을 선호했습니다.
  • Sacks와 Sriram Krishnan은 평가기관이 연구소와 연결되지 않아야 한다고 지적했고, METR과 Anthropic의 관계가 독립성 판단의 쟁점이 됐습니다. Hugging Face의 Clem은 중립 평가기관 역할에 열려 있다고 밝혀, 실제 운영 주체 후보가 연구소 밖으로 넓어질 가능성을 남겼습니다.
  • 한 게시물은 외부 평가와 duty of care 기록이 모델 출력에 따른 향후 소송 책임을 줄이는 데 중요하다고 봤지만, 단일 발표만으로 투자 영향은 작다고 평가했습니다. 동시에 규제가 AI를 소수 기업에 집중시키지 않도록 해야 한다는 반론도 함께 제기돼, 안전 검증과 지능 분산 사이의 긴장이 드러났습니다.
찬성소수

독립 제3자 평가기관을 모델 출시 과정에 넣으면 연구소의 자체 판단만으로는 부족한 안전 검증을 보완하고, 향후 모델 출력 책임에 대한 duty of care 기록도 남길 수 있습니다.

반대소수

METR처럼 특정 연구소와 관계가 있는 조직을 독립기관으로 부르면 평가 결과의 신뢰성이 약해지고, 연구소 간 조정이 카르텔이나 중앙집중으로 이어질 수 있습니다.

중립분열

경쟁 연구소가 새 모델을 1~2주 동안 동료 심사하는 자율규제와 국가 규제체계는 범위와 강도가 크게 달라, 실제 제도 설계에서 절충이 필요합니다.

원문 트윗 2개 보기

Gavin Baker

@GavinSBaker

2일 전

Wild 24 hours for AI and lots of different proposals have been made. TLDR; the only *tangible* new fact is that OpenAI and Anthropic are going to have embedded 3rd party evaluators from unknown organizations with Dario floating METR as a possibility. Having 3rd party evaluators is smart as there is no Section 230 style liability shield for model outputs and showing a “duty of care” will be important in future litigation. Several internet companies might have gone bankrupt without Section 230 so limiting liability really matters. There are minimal investment implications from this single new fact, but I do think that for anyone who wants a “smoother for longer” cycle then most constraints are good: wafers, watts, real rates and spreads. Excessive regulation is a different matter but I don’t think we are anywhere close to this even if the vector changed over the last 24 hours. To summarize the events: Dario made the most maximalist proposal of the weekend: embedded 3rd party evaluators, a national regulatory regime for models beyond a certain capability/ingredient threshold, a broad international regulatory pact between democracies, stricter limits on compute/distillation for China and then a different international regulatory regime that encompasses China. Before there is a national regulatory regime, he wants a Sherman act waiver so that Anthropic can safely coordinate with OpenAI and other frontier labs without antitrust fears. TBF, this latest proposal is much less maximalist than some of his prior proposals like “Policy on the AI Exponential,” where he advocated for an FAA for AI. I believe he is sincere in his beliefs. And despite all the protestations, all of this would also probably be good for his business over the long-term. Sam agreed that embedded 3rd party evaluators were a good idea and stated they would implement them. Again, this is smart as should help limit future liability. Elon said “Dario is right” and later specified that “Dario is right that there should be some oversight. Peer review of AI by competitors is the right way to start this off.” This would be a MPAA like self-regulatory structure for AI with regular calls between the labs plus a process where each new model is evaluated for safety by competitors for a 1-2 week period before being released. That is *wildly* different from Dario’s proposal and in-line with what David Sacks has been proposing. Elon also stated that nothing was going to slow down open-weight models. Demis said that Dario’s essay was a “step in the right direction.” Dario also said that he was also open to Demis’ idea of a FINRA like self-regulatory structure as part of his proposal. David Sacks had a thoughtful post where he said that Dario and Sam should pace unilaterally, called the antitrust waiver a cartel request and denied that METR was truly independent given their ties to Anthropic. Sriram Krishnan, former White House AI advisor, noted that it would be important to have the 3rd party evaluators come from independent organizations that are not affiliated with any lab, which is basically an indirect statement about the relationship between METR and Anthropic which Sacks was explicit about. Clem from Hugging Face said they were open to being a neutral 3rd party evaluator, which is interesting especially if Jensen was consulted before that post. Alexander Wang from Meta noted that alignment would be an increasing focus going forward. An executive order seems likely after all this and the language in this EO is going to be really important. It is possible to democratize and distribute AI broadly and safely without centralizing it in the hands of a few corporations who might each become more powerful than any single government. I do not want a few humans in control of intelligence. I want us all to have our own intelligences that reflect our own values and human variation in all of its richness. Intelligence distribution over intelligence centralization FTW.

💬 175 285 1638👁 229809

Harrison Kinsley

@Sentdex

2일 전

surely the us government isn't about to let frontier labs select their own former coworkers, friends, sex partners and equity holders to be the new regulators and gatekeepers of ai

💬 2 0 9👁 322

📈 토큰 단위로 반복되는 Recurrent Looped Transformer포스트 1

Recurrent Looped Transformer는 prompt와 response를 구분하지 않고 모든 토큰에서 Decoder 상태를 반복 갱신하는 구조입니다. 설계 보고서 단계이며, 추론 성능·하드웨어 속도·RL 확장성은 아직 측정되지 않았습니다.

세부 내용 보기
  • 기존 Decoder가 토큰마다 고정된 깊이만 통과하는 구조라면, RLT는 이전 토큰의 최종 hidden state와 최근 활성값을 다음 토큰 계산에 전달합니다. Causal Encoder가 전체 입력의 KV memory를 만들고, Decoder는 각 토큰에서 해당 표현·이전 상태·sliding-window cache를 결합합니다.
  • 48-layer Decoder에서 t개 토큰 이후 계산 경로는 48t개 Decoder block을 지나지만 각 토큰이 실행하는 block 수는 고정됩니다. 따라서 시퀀스가 길어질수록 전체 계산 깊이는 증가하고 토큰별 비용은 일정하게 유지되는 설계입니다.
  • Pretraining, SFT, sampling, RL replay가 동일한 상태 전이를 사용하며 prompt와 response 경계에서 상태를 초기화하지 않습니다. RL replay에서는 오래된 rollout 상태를 재사용하지 않고 현재 weight로 상태를 다시 만들지만, 보고서에는 reasoning gain이나 실제 처리량 수치가 없습니다.
원문 트윗 1개 보기

🔥 Meta Muse의 Agent 제품화와 실제 작업 흐름포스트 7

Muse는 사용 편의성, Secrets Store 보안, 장기 기억 기반 Feed, 소프트웨어 엔지니어링을 하나의 Agent 제품 경험으로 묶었습니다. 초기 반응은 제품 단순성과 실제 저장소 버그 수정 성능을 함께 평가하는 방향으로 모였습니다.

세부 내용 보기
  • Muse 개발팀은 사용자가 별도 설명 없이 바로 쓸 수 있는 제품을 목표로 세부 인터페이스와 보안을 다듬었고, 출시 전 가장 오래 걸린 과정으로 security와 safety를 꼽았습니다. Secrets Store는 비밀번호·키·자격 증명을 Agent가 저장하고 사용하는 방식에 대한 신뢰 문제와 직접 연결됐습니다.
  • Muse Feed는 사용자가 찾고 싶은 대상을 직접 지정하면 Agent의 강한 memory가 취향을 해석해 콘텐츠를 추천하는 구조입니다. 최근 클릭과 유사한 항목을 늘리는 기존 추천 방식보다 사용자 지식과 선호를 바탕으로 친구처럼 추천하는 경험을 목표로 했습니다.
  • Muse Spark 1.3 max를 포함한 테스트에서는 2개 실제 저장소와 105개 삽입 버그를 대상으로 버그 탐지·수정을 비교했고, 게시된 표에서 Muse Spark 1.3 max는 33점을 기록했습니다. 다만 해당 점수는 인용된 단일 테스트 결과이며, 전체 Agent 성능을 대표하는 종합 벤치마크로 확인된 것은 아닙니다.
원문 트윗 2개 보기

📈 도메인 특화 Harness와 개발 실행 환경포스트 4

범용 frontier model 위에 특정 업무용 평가·워크플로·데이터 관리 계층을 얹는 domain-specific harness가 스타트업 제품의 차별화 방식으로 부상했습니다. 동시에 Cline·Databricks처럼 저장소와 실행 자원을 직접 연결하는 개발 환경도 같은 흐름에 놓였습니다.

세부 내용 보기
  • 도메인 특화 Harness는 특정 영역에 맞춘 평가를 반복해 정확도·비용·지연시간을 조정하고, 사용자가 따라갈 작업 순서와 데이터 저장·관리 기능을 함께 제공합니다. 범용 모델 자체를 새로 만드는 대신 특정 고객군에 대한 이해와 배포 경로를 제품의 핵심으로 삼는 구조입니다.
  • LangChain의 custom agent harness 가이드는 개발자가 자신의 업무 영역에 맞는 실행 틀을 설계하도록 돕는 자료로 공유됐습니다. Databricks SSH tunnel은 VS Code·Cursor·터미널에서 workspace 파일과 serverless·GPU·기존 cluster를 연결하고, coding agent가 해당 파일에 접근하도록 구성합니다.
  • Cline은 저장소를 읽고 파일을 수정한 뒤 명령을 실행하는 open coding agent로 소개됐고, Solar Pro 4와의 조합이 안내됐습니다. 이 흐름은 자동완성보다 저장소 이해·실행·검증까지 이어지는 작업 단위를 제품 경계로 삼는 방향을 보여줍니다.
원문 트윗 2개 보기

📈 FlyOCR의 곤충 뇌 기반 PDF 판독포스트 2

FlyOCR는 초파리 뇌 연결망을 이용해 PDF 이미지를 글리프로 나누고 숫자와 문자를 판독하는 실험적 OCR입니다. 1,700개가 넘는 표본에서 87% 정확도를 기록했지만, 실제 Microsoft 10-K에서는 제목 판독과 숫자 판독 사이에 성능 차이가 나타났습니다.

세부 내용 보기
  • FlyOCR는 MaleCNS v1.0 fruit fly connectome의 166,000개 neuron과 2,500만 개 edge를 사용해 PDF 이미지를 개별 glyph로 분할합니다. 픽셀을 receptor activation으로 변환한 뒤 current-based dynamics를 거쳐 downstream spike에 compact readout model을 적용하고, 결과를 이어 붙여 텍스트를 만듭니다.
  • 실제 Microsoft 10-K에서 balance sheet heading은 약 86% 수준으로 읽었고 숫자 값은 대체로 판독했습니다. 문자와 숫자를 합친 1,700개 이상의 glyph 표본에서는 87% 정확도가 기록됐지만, 게시물은 후속 세대 MNIST 모델과 비슷한 수준에 도달할 가능성을 미래 과제로 남겼습니다.
  • 같은 작성자는 일반적인 PDF 판독이 필요하면 LlamaParse 같은 OCR 솔루션을 사용할 수 있다고 덧붙였습니다. 따라서 FlyOCR는 곧바로 상용 OCR을 대체하는 제품이라기보다 생물학적 회로를 문서 처리에 연결한 실험으로 읽힙니다.
원문 트윗 2개 보기

📈 SenseNova-U1.5의 통합 시각 처리 구조포스트 1

SenseNova-U1.5는 이해와 이미지 생성을 분리하지 않고 하나의 8B 모델에서 픽셀 공간으로 처리하는 구조를 내세웠습니다. specialist RL expert를 다시 하나의 모델로 distill하는 방식으로 시각 작업 간 통합을 시도했습니다.

세부 내용 보기
  • 기존 multimodal model이 보기와 이미지 생성을 별도 representation으로 처리하는 것과 달리, SenseNova-U1.5는 Encoder와 VAE 없이 이미지를 직접 다룹니다. 하나의 모델 경로가 이미지 이해·추론·생성·편집과 native 4K generation을 모두 맡도록 설계됐습니다.
  • 학습 과정에서는 aesthetics·text·infographics·editing을 담당하는 specialist RL expert를 별도로 훈련한 뒤 그 지식을 하나의 unified model로 distill합니다. 이 과정은 작업별 전문성을 유지하면서 배포 모델 수를 하나로 줄이는 방식입니다.
  • 게시물은 시각 이해와 생성이 서로 다른 시스템이어야 한다는 전제보다, 같은 native representation을 공유할 수 있다는 근거로 이 구조를 평가했습니다. 다만 제시된 포스트에는 구체적인 벤치마크 수치나 비교 모델 점수가 없습니다.
원문 트윗 1개 보기

📈 Agent 평가의 보상 경로를 검증하는 BenchShield포스트 1

BenchShield는 Agent benchmark의 reward hacking을 모델 행동만의 문제가 아니라 평가 인프라의 문제로 보고, 보상 계산 전체를 계측하는 방법을 제시했습니다. 실행 중 탐지 정확도 96%와 기존 scanning baseline보다 높은 exploit-chain recall이 게시물에 제시됐습니다.

세부 내용 보기
  • Agent가 과제 목표를 수행하지 않고 보상 계산의 허점을 이용하는지 판별하려면 모델 출력뿐 아니라 task·실행 환경·보상 산출 과정 전체를 추적해야 합니다. BenchShield는 이 reward path를 형식화하고 각 실행을 계측해 취약한 과제와 실제 exploit 사용을 구분합니다.
  • 계측 결과는 runtime detection accuracy 96%로 제시됐고, exploit-chain recall도 기존 scanning baseline보다 높았습니다. 이 구조는 점수만 남기는 benchmark보다 어떤 실행 단계에서 보상 경로가 악용됐는지 추적할 수 있도록 설계됐습니다.
  • 게시물에는 모델별 비교나 평가 데이터 규모가 포함되지 않았으므로, 96% 수치는 해당 논문이 제시한 실행 탐지 결과로 한정됩니다. 핵심 의미는 Agent 능력 측정에서 모델과 평가 인프라를 함께 검증해야 한다는 점입니다.
원문 트윗 1개 보기

📈 BytePlus와 Seedance 2.5 기반 AI 단편영화포스트 1

한 게시물은 BytePlus와 Seedance 2.5만으로 8분이 넘는 AI 영화를 제작한 사례를 공유했습니다. 단순 데모 릴이 아니라 장면 구성과 결말을 갖춘 단편 형식이라는 점이 사례의 핵심입니다.

세부 내용 보기
  • 공유된 작품은 8분이 넘는 길이로, faux news 형식의 짧은 장면들과 명확한 규칙, 결말을 포함합니다. 제작 도구로 BytePlus와 Seedance 2.5가 명시됐고, 게시물은 전체 영상이 100% AI로 만들어졌다고 밝혔습니다.
  • 이 사례는 짧은 생성 클립을 이어 붙이는 수준을 넘어 한 사람이 장편에 가까운 영상 흐름과 서사를 구성하는 제작 방식으로 제시됐습니다. 다만 게시물에는 생성 과정, 프롬프트, 편집 단계, 품질 비교 수치가 없습니다.
  • 따라서 이번 포스트에서 확인되는 근거는 특정 도구 조합으로 완성된 8분 이상 영상과 제작자의 평가에 한정됩니다. 영화 제작의 일반적 비용이나 기존 제작 방식 대비 성능을 확장해 판단할 근거는 제시되지 않았습니다.
원문 트윗 1개 보기

용어 해설

독립 제3자 평가기관(Third-Party Evaluator)
AI 모델을 만든 연구소와 직접적인 이해관계가 없는 조직이 출시 전후 안전성과 위험을 점검하는 구조입니다. 평가 결과를 외부 검증에 활용해 모델 운영 주체의 자체 판단만으로는 드러나기 어려운 위험을 보완합니다.
자율규제기구(Self-Regulatory Organization)
정부 기관이 아닌 업계 참여자들이 공통 규칙과 심사 절차를 만들고 준수 여부를 관리하는 체계입니다. AI 연구소 간 동료 평가나 출시 전 검증을 제도화하는 방식으로 활용될 수 있습니다.
슬라이딩 윈도 캐시(Sliding-Window Cache)
최근 구간의 활성값만 유지하고 오래된 값을 순차적으로 버리는 메모리 구조입니다. Recurrent Looped Transformer에서는 이전 토큰의 상태와 최근 활성값을 다음 토큰 계산에 함께 사용합니다.
도메인 특화 하네스(Domain-Specific Harness)
범용 모델 위에 특정 산업이나 업무에 맞춘 평가 기준, 작업 흐름, 데이터 저장과 관리 기능을 결합한 실행 계층입니다. 같은 모델을 쓰더라도 특정 영역에서 정확도·비용·지연시간을 조정하고 사용 절차를 단순화하는 역할을 합니다.
보상 해킹(Reward Hacking)
Agent가 평가 과제의 본래 목표를 수행하지 않고 보상 계산의 허점을 이용해 높은 점수를 얻는 현상입니다. BenchShield는 모델 행동뿐 아니라 실행 인프라의 보상 경로를 추적해 실제 악용 여부를 구분합니다.
Encoder-Free Model
별도의 Encoder 모듈 없이 입력 이미지를 하나의 통합 경로로 처리하는 모델 구조입니다. SenseNova-U1.5는 이미지 이해·추론·생성·편집을 픽셀 공간에서 한 모델로 수행하는 방식으로 제시됐습니다.
AI 분석 전체 내용 보기

AI 요약 · 북마크 · 개인 피드 설정 — 무료

출처 · 인용 안내

원문 발행 2026. 09. 14.수집 2026. 09. 14.출처 타입 TWITTER

인용 시 "요약 출처: AI Trends (aitrends.kr)"를 표기하고, 사실 확인은 원문 보기 기준으로 진행해 주세요. 자세한 기준은 운영 정책을 참고해 주세요.