본문으로 건너뛰기

2026년 8월 1일 AI 뉴스

75

관심 태그 추가
실시간 트렌드트윗 911일 전

Astra가 10개의 수학 증명과 lean certificates·CoT 워크스루를 공개

Astra가 10건의 증명과 보조자료를 공개했고, QM과 DeepSeek가 실무 논의를 촉발

LoRA의 결함은 언제나 용량 탓이 아니다

학습 데이터의 범위, 학습률 튜닝, 어댑터 랭크가 FullFT 우위의 핵심 레버로 작용한다.

인공지능이 경제적 가치를 자동화할 때

AI가 인지 노동을 대체하면 일자리와 경제·정치 구조가 근본적으로 뒤바뀔 수 있다.

실시간 트렌드트윗 711일 전

모델이 증명을 만들고, 모델이 자신을 고치는 흐름

Astra 증명 공개·무중단 개선 기법·GLM 5.2 전환 사례가 동시에 관찰됨

OpenAI 기사 링크

OpenAI 웹페이지 'Ten Advances in Mathematics'로 연결되는 외부 링크만 포함된 게시물

다운로드 전 내 PC에 딱 맞는 LLM 찾는 법.

llmfit은 로컬 LLM 실행 전 하드웨어 사양을 분석해 호환 가능한 모델을 즉시 추천하는 무료 터미널 도구이다.

AI로 6라운드 반복하며 찾은 '좋은 디자인' 선별법

AI 디자인 워크플로우를 활용해 시안을 생성하고, 인간의 평가와 랭킹 시스템을 통해 최적의 결과물을 선별하는 과정을 다룬다.

5시간 45분 만에 완성한 우주 게임, Kimi K3의 코딩 실력.

Kimi K3, Claude Fable 5, GPT-5.6 Sol을 대상으로 코딩 및 디자인 과제를 수행하여 성능과 비용 효율성을 비교했다.

Vizuara11일 전

LLM이 수학을 못하는 진짜 이유, 토큰화의 함정

LLM은 숫자를 수치가 아닌 텍스트 토큰으로 처리하고 패턴을 매칭하기 때문에, 자릿수 개념이 필요한 연산에서 체계적인 오류를 범한다.

캐시 히트도 청구 대상이라는 전제로 설계된 구현

캐시 적중을 비용 이벤트로 취급하고 멱등성·정규화·파리티 테스트로 정합성을 지킨 LLM 프록시 구현 공개

벤치마크 점수 대신 실제 취약점을 찾는 AI 해킹 모델의 조건

LLM의 해킹 능력을 평가할 때 기존 벤치마크의 한계를 극복하기 위해 결정론적 채점 환경을 도입하고 V8 엔진에서 제로데이 취약점을 발견한 사례를 다룬다.

HF Daily Papers11일 전· 14일 전 발행

블렌더 코드로 장면의 시간 흐름을 직접 실행

코드 에이전트가 Blender 스크립트를 합성해 결정적 드래프트를 만들고, 드래프트 조건 편집기로 실사 동영상을 생성하는 이중 엔진 체계입니다.

한 장의 사진으로 즉시 대화형 아바타를 만든 발표

단일 이미지로 실시간 프레임 단위 아바타를 생성해 SIGGRAPH Real-Time Live!에서 무대 데모를 선보였다.

Fireworks AI11일 전

서버리스 트레이닝으로 LLM 파인튜닝 비용과 시간을 줄이는 법

Fireworks AI의 서버리스 트레이닝을 사용하여 별도의 인프라 없이 Qwen 3.5 모델을 파인튜닝하고 프롬프트 라우팅 분류기의 정확도를 높이는 과정이 진행된다.

LLM을 실무에 투입하는 Deep Agents 구축법

LLM에 인프라와 제어 로직을 결합한 Deep Agents의 개념과 프로덕션 배포 시 고려해야 할 기술적 요구사항을 다룬다.

학교, 보고 경로 근거로 소송 기각 요구

펜실베이니아 사립학교가 AI로 생성된 동급생 누드 관련 소송에서 보고를 이행했다고 주장하며 기각을 요청했다.

제로카피 트랜스코드와 AV1 31 B-프레임 지원

AV1 계층 참조, 매크로블록 통계 노출, CUarray 제로카피와 Docker 개발 환경을 추가한 Video Codec SDK 13.1

KDNugget12일 전

음성으로 에이전트를 제어하는 핵심 모듈

파이프라인을 스트리밍 음성 인식, 턴 감지, 스트리밍 생성, 중단 처리, 도구 호출로 나누고 각 모듈의 책임을 정리한다.

긴 사기 대화에서 AI가 사람을 대체할 가능성

연구에서 생성형 AI 챗봇이 피그 버처링의 신뢰 형성 단계에서 인간보다 더 효과적이었다.

지리정보와 인과모델로 선반 배치를 고도화해 매출을 높임

지리적 탄력성과 장기 인과 효과를 결합해 선반 공간 배치를 최적화해 리모델링 매출 7.5% 상승을 보고했다.

실시간 트렌드트윗 811일 전👁 1

Grok Build에 플러그인·세션 관리·진단 강화

Grok Build 기능 추가·ChatGPT Work 한도 초기화·MiniMax H3 오픈 웨이트

실시간 트렌드트윗 1611일 전

비디오 생성(텍스트·이미지·음성 참조)·로컬 모델 실행·에이전트 미디어 관리가 동시에 움직인다

Grok의 1080p 텍스트→비디오·스크린샷→도구 연결과 DeepSeek의 로컬 실행 옵션이 주목받음

배포 후에도 업무를 배우는 강화학습 모델의 설계와 난제.

기업용 모델이 실시간 상호작용을 통해 지속적으로 학습하는 강화학습 파이프라인 구축 방법과 기술적 한계를 분석한다.

컴퓨팅 자원 대신 고품질 데이터로 모델 성능을 극대화하는 법.

데이터 품질을 컴퓨팅 승수로 활용하여 학습 효율과 모델 성능을 동시에 높이는 데이터 큐레이션 전략을 다룬다.

인간의 비위를 맞추는 AI에서 정답을 찾는 AI로

RLHF가 초래하는 모델의 과잉 친절 문제를 지적하고, AI 자동화를 위해 검증 가능한 보상(RLVR)으로의 전환이 필요함을 역설한다.

벤치마크 점수보다 환경 설계가 중요한 이유

AI 에이전트의 장기 작업 수행 능력을 정확히 측정하기 위한 환경 설계와 검증기 구축 전략을 다룬다.

HF Daily Papers11일 전· 13일 전 발행

AI가 코드와 실험을 반복 개선하는 실행 가능한 테스트베드

OpenMLE은 실행 기반 피드백과 연산자 학습을 결합해 MLE에서 RSI를 연구할 수 있는 공개 풀스택이며 Frontis-MA1(35B)와의 조합으로 제한된 자원 환경에서도 벤치마크 성능을 크게 향상시켰습니다.

HF Daily Papers11일 전· 14일 전 발행

파라메트릭 메모리를 백본에 내장해 읽기·쓰기를 순전파로 처리

Metis는 하이퍼·로컬 메모리 블록을 통해 고정 크기 파라미트릭 메모리를 유지하고 포워드만으로 기억·망각·갱신을 수행하는 memory foundation model입니다.

HF Daily Papers11일 전· 13일 전 발행

논문 대신 근거 있는 '주장'을 검색하는 시스템

주장 단위 색인과 증거 그래프를 통해 화학 문헌의 교차-논문 합성과 DOI 근거성을 개선했다.

r/artificial11일 전

AI가 암호학 증명 산출에 관여한 사례

Scientific American 기사가 AI의 도움으로 동일 암호학 문제에 대해 서로 다른 두 증명이 생성된 사례를 보도한다.

벤치마크 대신 손실 곡선을 보라

저자는 LLM을 대규모 데이터의 손실 압축으로 보고 bits per token과 손실을 핵심 지표로 삼아야 한다고 주장함.

명령행으로 평가 실행·채점·리포트

uvx 명령으로 eval 생성·실행·채점·정적 리포트 생성을 지원하는 소규모 평가 프레임워크다.

웹 텍스트 미러링에서 추론 엔진으로, 베이스 모델의 달라진 임무

베이스 모델이 단순히 인터넷 데이터를 모방하던 시대는 지났으며, 이제는 합성 데이터와 강화학습을 고려한 사전 학습 설계가 필수적이다.

50번의 턴으로 배우는 실제 인프라 장애 대응, AI 에이전트 훈련법.

Emulated는 실제 인프라 환경을 고충실도로 시뮬레이션하여 AI 에이전트가 복잡한 프로덕션 소프트웨어 엔지니어링 작업을 수행하도록 훈련한다.

모델 성능을 결정짓는 데이터 큐레이션의 핵심 전략.

Bespoke Labs의 Mahesh Sathiamoorthy가 모델의 신뢰성을 높이는 데이터 큐레이션 스택과 OpenThoughts 데이터셋의 설계 원리를 정리했다.

실시간 트렌드트윗 1112일 전👁 2

Luna 80% 인하·FlexAttention 성능·AgentRadio 비동기 에이전트

Luna 가격 80% 인하, PyTorch FlexAttention과 AgentRadio가 추론·에이전트 설계의 비용·성능 변곡을 만들고 있습니다

AI의 창의성을 죽이는 '평균으로의 회귀'를 막는 법.

AI 모델이 주관적 영역에서 평균적인 결과물만 내놓는 문제를 해결하기 위해, 작업을 요소별로 분해하고 인간의 취향을 고품질 선호 데이터로 구조화하여 학습시키는 방법론.

생물학 데이터 6TB를 처리하는 AI 에이전트 벤치마킹법.

LatchBio는 공간 생물학의 방대한 데이터를 활용해 AI 에이전트의 과학적 추론 능력을 검증하는 벤치마크 `SpatialBench`를 구축하고, 이를 통해 모델의 실질적인 생물학적 분석 역량을 개선한다.

Cohere12일 전

머신러닝 연구자가 말하는 채용 합격의 핵심과 커리어 생존 전략.

Meta, Google DeepMind 등 주요 AI 연구소 소속 전문가들이 머신러닝 커리어 진입 경로와 채용 기준, 실무 적응 전략을 논의한다.

Nano Banana 이미지에는 SynthID 워터마크가 포함된다

프롬프트로 Google Earth 이미지를 합성해 허위 장면을 만들 수 있고 Google은 SynthID로 검증 가능하다고 밝혔다

중화권에서의 AI 에이전트 신뢰와 수용성

Sumsub 블로그의 중화권 대상 AI 에이전트 신뢰 설문 결과를 공유한 링크 게시물

AI 튜터 Khanmigo가 학습 효과를 측정하고 품질을 높이는 법

Khan Academy가 AI 튜터 Khanmigo의 품질을 측정하고 개선하기 위해 활용하는 오프라인 평가 및 라이브 실험 방법론을 공유한다.

코딩 벤치마크가 모델의 실력을 왜곡하는 이유

모호한 지시와 잘못된 검증 로직으로 인해 코딩 벤치마크가 모델의 실제 성능을 왜곡하는 문제를 지적하고, 신뢰할 수 있는 평가를 위한 원칙을 제시한다.

실시간 트렌드트윗 2112일 전

DeepSeek‑V4‑Flash·MiniMax H3·전훈련 축 변화

DeepSeek 성능·배포와 MiniMax H3의 멀티모달 흐름, 탐색 기반 전훈련이 이번 기간 주요 흐름

Claude Code, 80%의 프롬프트를 삭제해야 성능이 오르는 이유.

Claude Code 창시자가 전하는 에이전트의 자율성을 높이고 비용을 줄이는 최적화 가이드.

정답지 없는 강화학습, '역방향 트릭'으로 보상 신호 만드는 법

정답이 없는 도메인에서 강화학습을 수행하기 위해 환경을 앵커로 삼고, 역방향 트릭과 자동화된 판별기를 통해 보상 신호를 생성하는 방법론이다.

n8n·Langgraph·FalkorDB 연동 데모

n8n과 Langgraph, FalkorDB를 연결해 지식 그래프를 에이전트 워크플로에 통합하는 데모 영상 링크.

라우팅 대신 단일 모델과 캐시를 택한 경험

4개월·7,000명 사용 관찰에서 라우터보다 캐시와 단일 모델이 비용과 일관성에서 유리하다는 결론을 내렸다.

Claude Opus 5로 만든 게임과 AI 에이전트의 협업.

Claude Opus 5의 코딩 능력과 에이전트 기반 협업 플랫폼, 그리고 물리적 조작이 가능한 Gemini Robotics ER 2 등 최신 AI 기술 동향을 분석한다.