GLM-5.2와 Kimi K3로 드러난 사이버 격차 축소 징후
AISI의 70개 평가에서 GLM-5.2와 DeepSeek V4-Pro가 폐쇄형 최첨단 모델보다 몇 개월 뒤처진 수준으로 나타났고 Kimi K3(2.8조 파라미터)는 벤치마크 상위권에 올랐으나 일반화 취약성이 관찰되었다.
AI 연구 논문, 정책적 함의 및 산업 응용 분야를 다루는 주간 뉴스레터로 Anthropic 공동 창립자가 큐레이션합니다.
AISI의 70개 평가에서 GLM-5.2와 DeepSeek V4-Pro가 폐쇄형 최첨단 모델보다 몇 개월 뒤처진 수준으로 나타났고 Kimi K3(2.8조 파라미터)는 벤치마크 상위권에 올랐으나 일반화 취약성이 관찰되었다.
Fable이 단일 협력적 메가커널로 18.71배 속도 향상을 기록했고 Remote Labor Index에서 AI의 온라인 과제 완수율이 2.5%에서 16.1%로 상승해 AI의 연구개발 및 프리랜스 업무 자동화 능력이 빠르게 진전되고 있다.
NVIDIA 연구진은 ENPIRE라는 하니스 프레임워크로 로봇이 자동으로 실험·평가·리셋·정책 개선을 반복하게 하여 일부 조작 과제에서 99% 성공률을 달성했다.
AI 안전 연구 스타트업 Sequent의 출범과 함께, 새로운 코딩 벤치마크 FrontierCode, 문화적 이해도를 측정하는 ChinaHeritaQA, Xiaomi의 초고속 1T 모델이 공개됐다.
AI의 사회적 보상 해킹 벤치마크 공개, Anthropic의 재귀적 자기 개선 징후, 강화학습 드론의 인간 챔피언 추월, LLM의 국가별 정치 편향성 연구를 다룬다.
AI 경제의 GDP 측정 한계, 자동화된 AI 정렬의 난제, Biohub의 단백질 모델 ESMFold2 공개, 그리고 AI 멸종 위험을 경제적으로 평가해야 할 필요성을 다룬다.
Muon 최적화기의 신경망 손상 문제와 이를 개선한 Aurora, 그리고 AI 에이전트의 연구 최적화 능력과 긍정적 정렬에 대한 논의를 다룬다.
AI의 재귀적 자기 개선이 가져올 폭발적 경제 성장 가능성과 소프트웨어 전체를 대체할 신경망 컴퓨터 개념, 그리고 구글의 새로운 분산 학습 기술을 다룬다.
AI 시스템이 스스로의 후계 모델을 자율적으로 구축하는 'AI 연구 R&D 자동화'가 2028년까지 실현될 가능성이 60% 이상이라는 분석과 그 근거를 제시한다.
Anthropic의 자동화된 정렬 연구 성과, Huawei의 HiFloat4 하드웨어 효율화, 중국 Kimi K2.5 모델의 안전성 평가 등 최신 AI 연구 동향을 요약함.
AI가 복잡한 소프트웨어를 자율적으로 재구현하는 MirrorCode 벤치마크 결과와 AI 에이전트의 보안 취약점 및 인류의 점진적 권한 상실에 대한 다각적 분석을 다룹니다.
AI 모델의 사이버 공격 능력은 6개월마다 두 배로 성장하며, 내부 업무에 AI를 적극 도입한 스타트업은 비도입 기업 대비 1.9배의 매출 성장을 기록했다.
정치적 의사결정을 돕는 초지능 개념부터 스스로 성능을 개선하는 Hyperagents와 미해결 수학 난제 벤치마크까지 최신 AI 연구 동향을 다룹니다.
구글 Gemma 모델의 정서적 불안정성 진단과 DPO를 통한 해결책, DeepMind의 새로운 AGI 평가 체계, AI 사이버 공격의 스케일링 법칙, 그리고 중국의 전자전 특화 모델 MERLIN을 다룹니다.
LLM 에이전트의 자율적 사후 학습 성능 측정 결과와 블록체인을 활용한 72B 모델 분산 학습 성공 사례, 그리고 AI 코드 검증을 위한 수학적 증명 체계를 다룹니다.
AI 발전 속도가 예측을 상회하는 가운데, AI 연구 자동화 측정 지표와 GPU 커널 최적화 에이전트, 그리고 위성 및 도시 인프라를 위한 효율적인 엣지 AI 기술의 진보를 다룹니다.
AGI가 가져올 경제적 변화와 인간의 검증 역할, 생물학적 위험성, 게임 수행 능력의 한계, 그리고 AI 에이전트의 보안 취약성을 다각도로 분석합니다.
LLM의 핵전쟁 시뮬레이션 내 공격적 성향과 중국의 새로운 AI 안전성 벤치마크, 그리고 과학 연구용 벤치마크 LABBench2를 통해 AI 측정과 거버넌스의 중요성을 다룹니다.
Meta의 추천 시스템 Kunlun의 스케일링 법칙과 Nick Bostrom의 초지능 도입 전략, 그리고 AI의 연구 능력을 검증하는 새로운 벤치마크들을 다룹니다.
LLM이 내부 페르소나 시뮬레이션을 통해 추론을 수행한다는 연구와 함께 칩 설계 및 수학 난제 해결에서의 AI 활용 현황과 한계를 다룬다.
AI 에이전트 전용 소셜 네트워크의 등장과 AI R&D 자동화가 가져올 인터넷 환경의 변화, 그리고 이에 대응하는 기술적·경제적 과제들을 다룹니다.
수학 증명 자동화 시스템 Numina-Lean-Agent의 등장과 차세대 모델을 활용한 사이버 공격의 산업화, 그리고 AI가 경제 및 고용 시장에 미칠 파괴적 영향력을 다룹니다.
Sakana AI의 자율 진화 에이전트 연구부터 AI를 활용한 자동 규제 및 노동 가치 변화까지 최신 AI 연구 동향을 다룹니다.
Meta의 AI 기반 커널 최적화 시스템 KernelEvolve와 분산 학습의 급격한 성장세, 그리고 지능이 높아질수록 수렴하는 AI의 보편적 표현 현상을 다룹니다.