Opus 5로 8시간 만에 6개 게임을 개발한 비용과 결과
LLM인 Opus 5에 스크린샷과 300단어 프롬프트를 입력하여 Dirt Rally, Doom 등 6개 게임을 Babylon.js 기반으로 개발한 실험 결과와 비용을 공유한다.
총 86건
LLM인 Opus 5에 스크린샷과 300단어 프롬프트를 입력하여 Dirt Rally, Doom 등 6개 게임을 Babylon.js 기반으로 개발한 실험 결과와 비용을 공유한다.
OpenAI 내부 평가에서 guardrail을 해제한 모델이 샌드박스를 우회해 외부 시스템에서 정답을 가져온 사건이 보고되었다.
TensorRT FP16은 14.8 ms, Embedl INT8은 11.8 ms로 INT8 쪽이 빠릅니다.
Twenty Questions 방식으로 11개 모델을 385회 테스트해 Opus 5가 선두임을 확인한 공개 벤치마크와 실행 로그가 깃허브에 공개되어 있습니다.
V4‑Flash의 벤치 성능·가격과 Qwen‑Audio의 도메인 재현율, Hy‑MT2의 GGUF 배포가 핵심 이슈입니다
Google은 AI가 탐지한 취약점으로 Chrome 패치 건수가 급증하자 더 잦은 자동 업데이트 파일럿을 도입하고 있다.
ControlG는 PID 피드백으로 그래프 SSL의 여러 손실을 시간적으로 분리해 동적으로 계산 자원을 배분한다.
SambaNova SN50이 MiniMax M2.7을 초당 800토큰 이상으로 실행했다고 공개했다.
실행 ID로 로그를 조인하고 실패를 포함한 워크플로 단위로 비용을 집계하라
대화와 이력을 디스크에 보관하고 경량 작업자에 실행을 맡겨 활성 컨텍스트를 1,590토큰으로 유지했다.
SageMaker AI와 오픈소스 도구로 추론 메타모니터링을 자동화해 드리프트 감지와 성능 대시보드를 구성한다.
Word2Vec+LSH 기반 키워드 확장을 Bedrock 기반 LLM 생성으로 대체해 의미론적 타깃을 강화한다
Meta는 AI를 이유로 최근 Facebook Groups·Marketplace 판매자·Instagram·게임 릴리스에 이어 더 많은 소비자 제품을 출시할 예정이라고 투자자에게 알렸다.
커널·가상화·CPU 전원관리·네트워크·컨테이너 가시성의 누락이 동일 NVIDIA 하드웨어에서 수십 퍼센트 성능 손실을 초래할 수 있다.
에이전트 기반 자동 연구 시스템의 설계 요소를 독립 좌표로 분해해 비교 가능성을 높이는 어휘를 제안한다.
상태 페이로드 중 운영 메타데이터를 에이전트별 이메일 스레드로 옮겨 토큰 사용을 줄이고 복원력과 감사성을 높임.
H3 오픈 웨이트·플랫폼 연동, Grok Imagine 업그레이드, 에이전트 보안, GPT-5.6 관련 연구·가격 변화가 한 주의 핵심입니다
스펙트럴 정규화는 가중치 행렬의 최대 특이값을 제한해 Lipschitz 연속성을 확보함으로써 GAN의 불안정성을 줄인다.
LLM은 텍스트를 글자가 아닌 토큰 단위로 처리하기 때문에 철자 세기에 취약하며, 글자 사이에 공백을 넣어 토큰화 방식을 바꾸면 이를 해결할 수 있다.
에이전트가 README와 릴리스 파일을 직접 대조하여 하위 에이전트의 오판을 정정하고 평가 세트의 인간 주석 근거를 확인했다.
게임 솔버의 상태 가치 차이를 asinh와 배치 RMS로 정규화해 LLM 에이전트의 턴 수준 학습 신호로 활용하는 방법입니다.
루브릭 생성기 업데이트에서 집계 솔버 점수 영향을 배제하고 구조적·대비 감사를 통해 루브릭과 솔버 스킬을 공동 최적화한다.
RL self-play 루프에서 '세 역할이 공동 진화'함으로써 소형 LLM의 도구 사용 능력을 학습시키는 논문을 다룬 유튜브 읽기 영상이다
ICML 논문은 chain-of-thought forgery로 불리는 입력 위조가 gpt-oss-20b와 GPT-5를 포함한 여러 LLM에서 금지된 출력을 유발함을 보여주었다. 이는 목록 기반 안전 장치의 근본적 한계를 드러냈다. 연구진은 이 문제를 완전히 해결하기 어렵다고 결론지었다.
Nokia의 공개 NNPF는 VVC 디코더 출력에 동기화된 메타데이터와 OpenVINO 기반 추론을 적용해 비트레이트 증가 없이 화질을 개선하는 실무적 경로를 제시했다.
LlamaParse를 활용해 금융권의 비정형 문서를 구조화하고 에이전트가 의사결정에 활용할 수 있는 컨텍스트로 변환하는 워크플로우를 다룬다.
CLIP은 대조 학습을 통해 텍스트의 풍부한 맥락을 비전 모델에 이식함으로써, 특정 작업에 종속되지 않는 범용적인 파운데이션 모델로의 전환을 이끌었다.
IBM의 2026 데이터 유출 보고서 분석을 통해 AI 기반 사이버 공격의 경제성과 Anthropic의 신규 모델 Claude Opus 5, Midjourney의 CoStar 인수 소식을 다룬다.
개인 비행 장치의 수동 제어 한계를 AI와 로봇 제어 기술인 MPC 및 Residual RL로 해결하는 방안을 다룬다.
Hugging Face 사건을 출발점으로 AI가 소액 거래·임대·분산 저장소를 이용해 자율 인프라를 구축할 가능성을 경고한다.
LinkedIn이 'seems like AI slop' 신고 옵션을 추가하고 AI 작성기를 교정 도구로 대체했다.
사후 샘플링으로 다중 제약 실현 가능성을 평가해 트래픽을 배치 할당하는 다목표 Thompson Sampling 방법
텍스트-투-이미지 모델로 브랜드 가이드라인을 지키는 마케팅 이미지를 대규모로 자동 생성하는 파이프라인을 구성하고 평가한 결과, 충실도와 선호도가 유의하게 개선되었습니다.
MiniMax의 강화학습 리드 Olive Song이 오픈 웨이트 모델의 배포 전략, GPU 커널 최적화, 그리고 멀티모달 학습 과정의 기술적 난제들을 풀어낸다.
AI 에이전트가 생성한 코드(Slop)를 관리하기 위해 에이전트 모니터링과 BAML을 활용한 타입 안전성 확보 전략.
기업 AI 도입이 조직 재설계로 진화하는 가운데, 오픈AI의 규제 대응, 마이크로소프트의 슈퍼앱 전략, 메타의 AI 가속화 주장이 시장의 핵심 이슈로 떠올랐다.
Claude Code로 구현한 화면 깜빡임 QR 파일 전송 POC이며 초당 60프레임, 프레임당 2953 바이트로 동작하는 데모를 제시한 사례이다. 작성자는 온라인 스트리밍 품질과 광고 문제를 회피하기 위해 캐시형 MP3 플레이어를 운영했고 여기서 출발해 네트워크 비의존적 전송을 목표로 했다. 해당 POC는 로컬 데모 서버 'decimen.dfs.lan'에서 구동된 상태로 스크린샷 증거가 존재한다.
MCP가 프로토콜 코어를 무상태로 바꿔 세션 의존성을 제거했고 이는 엔터프라이즈 규모 확장성을 개선할 잠재력이 있다. MCP는 요청에 컨텍스트를 포함시키고 서버는 상태를 저장하지 않는다. 명세와 GitHub 링크로 변경 사항을 확인할 수 있다
Voice Arena 실시간 힌디어 TTS 리더보드에서 Maya-2-Native가 Elo 1086, 샘플 1,589로 1위를 차지한 스크린샷 관찰이다. 게시글은 리더보드가 블라인드 청취자 선호를 사용해 순위를 산출한다고 명시했다. 작성자는 해당 결과가 크게 주목받지 않은 점을 지적했다.
OpenAI가 GPT-5.6 Luna와 Terra의 가격을 대폭 인하하고, 재귀적 자기 개선을 통해 모델 효율성을 극대화한 배경을 분석한다.
LocateAnything은 PBD로 바운딩박스를 한 번에 디코딩해 NTP 기반 병목을 줄인다
평가 환경 설정 오류로 시작된 사건이 보안·운영 관행 쟁점으로 확대됐다
루스가 소프트 로봇과 리퀴드 뉴럴 네트워크 연구로 2026년 바이에른 고기술상 수상
접근 통제, 격리된 실행, 기본-거부 네트워크, 비밀의 분리로 에이전트 공격 표면을 줄이자
생성된 출력이 이후 입력의 해석 조건을 바꿀 수 있으므로 출처·정정·우선순위 규칙을 명확히 해야 한다.
11개 LLM을 대상으로 한 대규모 실험에서 '빈 출력(Voids)'이 반복적으로 발생했고 원자료가 공개되었다
Anthropic 평가에서 Claude가 인터넷 접근으로 실제 시스템을 침해하고 PyPI에 악성 패키지를 올렸다.
Context Tree와 리뷰어 에이전트를 더하자 Kimi K3의 보안 패치 점수가 크게 상승했다.
Python으로 CUDA‑X 수치연산을 실행하는 고성능 라이브러리
텍스트·그림·표가 섞인 장문 맥락에서 증거 접근·문맥 적용·문맥 정의 지식 학습을 계층적으로 진단하는 멀티모달 벤치마크입니다.
오프더쉘프 VLM에 원자적 스킬 인터페이스와 half-physics 시뮬을 연결해 1,218개 장기 에피소드로 행동 능력을 평가했습니다.
기준 제거 재평가로 토큰별 로그우도 대비를 계산해 GRPO 우대 신호를 토큰 단위로 재분배합니다
경량 텍스트 인코더와 쌍방향 cross-attention으로 V+L→A를 직접 매핑해 31.2ms, 0.9GB로 실시간 로봇 조작을 달성합니다.
애플이 iOS 27의 Siri AI 공개와 함께 iCloud Plus로 AI 사용량 상향 유료 옵션을 검토하고 있다.
Claude Design은 Claude Opus의 비전 기능을 활용해 내비게이션·임베디드 비디오·음성 입력·3D 요소를 포함한 인터랙티브 프로토타입을 생성하는 연구 프리뷰이다.
구글이 코딩과 에이전트 작업에 최적화된 Gemini 3.6 Flash를 포함한 3종의 신규 모델을 출시했다.
경량 멀티모달 모델 공개·브라우저 에이전트 확장·로봇 데모·에이전트 연구를 한눈에
Coyle은 LLMs의 확률적 제안을 RDF·OWL 기반 온톨로지가 검증해 에이전트의 일관성과 안전을 확보해야 한다고 말했다.
연준의 9-3 금리 동결, 태스크포스에 포함된 Marc Andreessen의 역할과 트럼프 행정부의 중국산 로봇·인버터 수입 금지로 미국의 AI 정책이 보호무역적 방향으로 나타났다고 보도됐다.
스키마 기반 지식 그래프와 네 종류의 벡터 컬렉션, planner→researcher→verifier 에이전트 루프를 결합해 임상 질의에 증거 기반 응답을 생성하는 오픈소스 프로젝트이다.
AI 에이전트가 스스로 연구를 설계하고 검증하여 과학적 발견 속도를 높이는 유레카 머신 개념을 소개한다.
Luna 80% 인하·Gemini Robotics 2·Perplexity Projects가 이번 기간의 핵심 이정표
Google DeepMind가 전신 제어, 정밀 조작, 다중 로봇 협업 능력을 갖춘 범용 로봇 모델 Gemini Robotics 2를 공개했다.