Astra가 10개의 수학 증명과 lean certificates·CoT 워크스루를 공개
Astra가 10건의 증명과 보조자료를 공개했고, QM과 DeepSeek가 실무 논의를 촉발
총 75건
Astra가 10건의 증명과 보조자료를 공개했고, QM과 DeepSeek가 실무 논의를 촉발
Astra 증명 공개·무중단 개선 기법·GLM 5.2 전환 사례가 동시에 관찰됨
llmfit은 로컬 LLM 실행 전 하드웨어 사양을 분석해 호환 가능한 모델을 즉시 추천하는 무료 터미널 도구이다.
AI 디자인 워크플로우를 활용해 시안을 생성하고, 인간의 평가와 랭킹 시스템을 통해 최적의 결과물을 선별하는 과정을 다룬다.
Kimi K3, Claude Fable 5, GPT-5.6 Sol을 대상으로 코딩 및 디자인 과제를 수행하여 성능과 비용 효율성을 비교했다.
LLM은 숫자를 수치가 아닌 텍스트 토큰으로 처리하고 패턴을 매칭하기 때문에, 자릿수 개념이 필요한 연산에서 체계적인 오류를 범한다.
LLM의 해킹 능력을 평가할 때 기존 벤치마크의 한계를 극복하기 위해 결정론적 채점 환경을 도입하고 V8 엔진에서 제로데이 취약점을 발견한 사례를 다룬다.
코드 에이전트가 Blender 스크립트를 합성해 결정적 드래프트를 만들고, 드래프트 조건 편집기로 실사 동영상을 생성하는 이중 엔진 체계입니다.
이산 물리 언어로 상태 전이를 모델링해 물리적 일관성을 높인 reason-then-render 월드 모델
단일 이미지로 실시간 프레임 단위 아바타를 생성해 SIGGRAPH Real-Time Live!에서 무대 데모를 선보였다.
그룹 크기·헤드 차원·시퀀스 길이가 프리필과 디코드의 병목을 다르게 만들며, NVIDIA는 G를 키우고 Hsz를 128/256으로 맞추며 KV 상태를 줄이고 KH에 맞춰 병렬화를 권장한다.
Qwen 임베딩·BM25·RRF·교차 재랭킹과 Qwen3.6-27B를 결합해 근거 기반 초안을 로컬에서 자동 생성함
Fireworks AI의 서버리스 트레이닝을 사용하여 별도의 인프라 없이 Qwen 3.5 모델을 파인튜닝하고 프롬프트 라우팅 분류기의 정확도를 높이는 과정이 진행된다.
Raspberry Pi·RTSP 휴대폰·Roboflow로 수영장 수위를 로컬 분류하는 튜토리얼
펜실베이니아 사립학교가 AI로 생성된 동급생 누드 관련 소송에서 보고를 이행했다고 주장하며 기각을 요청했다.
AgentCore Observability와 CloudWatch로 에이전트의 지연 원인과 메모리 누적을 추적하여 선제적으로 대응하는 방법을 설명한다
AV1 계층 참조, 매크로블록 통계 노출, CUarray 제로카피와 Docker 개발 환경을 추가한 Video Codec SDK 13.1
파이프라인을 스트리밍 음성 인식, 턴 감지, 스트리밍 생성, 중단 처리, 도구 호출로 나누고 각 모듈의 책임을 정리한다.
지리적 탄력성과 장기 인과 효과를 결합해 선반 공간 배치를 최적화해 리모델링 매출 7.5% 상승을 보고했다.
Grok Build 기능 추가·ChatGPT Work 한도 초기화·MiniMax H3 오픈 웨이트
DeepSeek V4 Flash 0731은 304B·167GB·저비용 구조로 가성비가 뛰어나다고 평가됨
Grok의 1080p 텍스트→비디오·스크린샷→도구 연결과 DeepSeek의 로컬 실행 옵션이 주목받음
기업용 모델이 실시간 상호작용을 통해 지속적으로 학습하는 강화학습 파이프라인 구축 방법과 기술적 한계를 분석한다.
데이터 품질을 컴퓨팅 승수로 활용하여 학습 효율과 모델 성능을 동시에 높이는 데이터 큐레이션 전략을 다룬다.
RLHF가 초래하는 모델의 과잉 친절 문제를 지적하고, AI 자동화를 위해 검증 가능한 보상(RLVR)으로의 전환이 필요함을 역설한다.
OpenMLE은 실행 기반 피드백과 연산자 학습을 결합해 MLE에서 RSI를 연구할 수 있는 공개 풀스택이며 Frontis-MA1(35B)와의 조합으로 제한된 자원 환경에서도 벤치마크 성능을 크게 향상시켰습니다.
Metis는 하이퍼·로컬 메모리 블록을 통해 고정 크기 파라미트릭 메모리를 유지하고 포워드만으로 기억·망각·갱신을 수행하는 memory foundation model입니다.
실기기 모바일 런타임과 하이브리드 GUI+CLI로 장기·교차 플랫폼 작업을 실세계에서 수행하는 대형 GUI 에이전트
주장 단위 색인과 증거 그래프를 통해 화학 문헌의 교차-논문 합성과 DOI 근거성을 개선했다.
Scientific American 기사가 AI의 도움으로 동일 암호학 문제에 대해 서로 다른 두 증명이 생성된 사례를 보도한다.
입력 100k·출력 20k 기준으로 18개 모델 토큰 비용을 비교한 결과 Gemini 2.5 Flash‑Lite가 가장 저렴했고 Claude Fable 5가 가장 비쌌다.
저자는 LLM을 대규모 데이터의 손실 압축으로 보고 bits per token과 손실을 핵심 지표로 삼아야 한다고 주장함.
베이스 모델이 단순히 인터넷 데이터를 모방하던 시대는 지났으며, 이제는 합성 데이터와 강화학습을 고려한 사전 학습 설계가 필수적이다.
Emulated는 실제 인프라 환경을 고충실도로 시뮬레이션하여 AI 에이전트가 복잡한 프로덕션 소프트웨어 엔지니어링 작업을 수행하도록 훈련한다.
Bespoke Labs의 Mahesh Sathiamoorthy가 모델의 신뢰성을 높이는 데이터 큐레이션 스택과 OpenThoughts 데이터셋의 설계 원리를 정리했다.
Luna 가격 80% 인하, PyTorch FlexAttention과 AgentRadio가 추론·에이전트 설계의 비용·성능 변곡을 만들고 있습니다
AI 모델이 주관적 영역에서 평균적인 결과물만 내놓는 문제를 해결하기 위해, 작업을 요소별로 분해하고 인간의 취향을 고품질 선호 데이터로 구조화하여 학습시키는 방법론.
LatchBio는 공간 생물학의 방대한 데이터를 활용해 AI 에이전트의 과학적 추론 능력을 검증하는 벤치마크 `SpatialBench`를 구축하고, 이를 통해 모델의 실질적인 생물학적 분석 역량을 개선한다.
Meta, Google DeepMind 등 주요 AI 연구소 소속 전문가들이 머신러닝 커리어 진입 경로와 채용 기준, 실무 적응 전략을 논의한다.
프롬프트로 Google Earth 이미지를 합성해 허위 장면을 만들 수 있고 Google은 SynthID로 검증 가능하다고 밝혔다
Snapchat이 Spotlight 추천에서 AI 생성 영상을 제외해 사람 제작 콘텐츠만 노출한다.
Karpathy는 소프트웨어가 규칙→가중치→프롬프트로 진화했으며 컨텍스트 설계가 새 핵심 역량이라고 말했다.
Claude(Fable5)가 Codex56이 생성한 엔진을 상대로 cutechess에서 10-0으로 승리했다.
유니버설·소니·워너 등 주요 레이블이 AI 생성·보조 음악을 국제 차트에서 제외하는 규칙을 내놓았습니다.
Khan Academy가 AI 튜터 Khanmigo의 품질을 측정하고 개선하기 위해 활용하는 오프라인 평가 및 라이브 실험 방법론을 공유한다.
모호한 지시와 잘못된 검증 로직으로 인해 코딩 벤치마크가 모델의 실제 성능을 왜곡하는 문제를 지적하고, 신뢰할 수 있는 평가를 위한 원칙을 제시한다.
DeepSeek 성능·배포와 MiniMax H3의 멀티모달 흐름, 탐색 기반 전훈련이 이번 기간 주요 흐름
Google DeepMind의 AGI 안전·정렬 팀이 연구자와 엔지니어를 대상으로 여러 직무를 공개 모집한다.
정답이 없는 도메인에서 강화학습을 수행하기 위해 환경을 앵커로 삼고, 역방향 트릭과 자동화된 판별기를 통해 보상 신호를 생성하는 방법론이다.
n8n과 Langgraph, FalkorDB를 연결해 지식 그래프를 에이전트 워크플로에 통합하는 데모 영상 링크.
Descope와 OAuth로 보호된 MCP 서버에 LangChain과 Ollama 로컬 모델 에이전트를 연결하는 튜토리얼 영상
Claude Opus 5의 코딩 능력과 에이전트 기반 협업 플랫폼, 그리고 물리적 조작이 가능한 Gemini Robotics ER 2 등 최신 AI 기술 동향을 분석한다.