TL;DR
이번 기간에는 세 축이 겹쳤습니다. 먼저 내부 버전의 GPT-5.6이 수학·이론컴퓨터과학 분야에서 10건의 신규 결과를 산출하고 원문·Lean 인증서·추론 워크스루를 공개해 검증·후속 연구로 이어질 출발점을 만들었습니다(토큰 비용 기준 약 $2,000). 둘째로 음성 대화는 GPT-Live의 음성 스택 재설계로 오디오를 전용 빠른 경로로 흘려보내고 심층 추론은 비동기 처리해 초기 연결지연을 크게 줄였고, 이로 인해 실시간 대화에서의 연속성·도구 사용 경험이 개선될 가능성이 커졌습니다. 셋째로 취약점 공개가 급증해(7월 약 2,500건, 이전 기록의 약 5배) 자동화된 취약점 탐지 능력과 보안 노출 위험이 동시에 부각되었습니다.
𝕏 실시간 트렌드 토픽
🔥 GPT-5.6이 수학·이론컴퓨터과학에서 10건 신규 결과포스트 3
OpenAI 내부 버전 모델이 수학·이론컴퓨터과학의 여러 난제에서 10개의 새로운 결과를 산출했고, 결과 원문·형식적 Lean 인증서·추론 워크스루를 공개해 검증 가능성을 확보했습니다(토큰 비용 약 $2,000 기준).
- 배경과 문제: 수학·이론컴퓨터과학 분야에서는 엄밀한 증명과 검증 가능한 산출물이 핵심이며 인간 연구자가 따라잡기 어려운 계산·조합적 탐색이 병목이 됩니다. 처리 방식: OpenAI 내부 모델은 주어진 문제에 대해 모델 추론으로 후보 해법을 생성하고, 형식적 검증(Lean certificate)과 인간·기계 검사 절차를 병행해 증명의 타당성을 확보했습니다. 근거: 회사 발표는 '10 new results'와 '토큰 비용 약 $2,000 at GPT-5.6 Sol API rates'를 제시했고, 결과 중에는 non-sofic 그룹 존재 증명과 고차원 sphere packing 경계에 대한 지수적 개선이 포함됩니다. 의미: 증명 원문·형식 인증·워크스루 공개는 수학자들이 결과를 재현·확장할 수 있는 기반을 제공해 이론적 진전의 후속 작업을 촉진합니다.
원문 트윗 2개 보기
OpenAI
@OpenAI
An internal version of our next major model produced 10 new results on long-standing open problems in mathematics and theoretical computer science, using roughly $2,000 worth of tokens at GPT-5.6 Sol API rates.
OpenAI
@OpenAI
The results span sphere packing, coding theory, group theory, quantum complexity, lattice cryptography, extremal combinatorics, and more. Among them: establishing the existence of non-sofic groups and exponential improvements to bounds on high dimensional sphere packing.
📈 GPT-Live: 음성 스택을 실시간 흐름으로 재구성포스트 3
GPT-Live는 음성을 모델이 말하는 동안 계속 수신하도록 음성 스택을 재구성해, 오디오 전용 빠른 경로와 비동기적 심층 추론을 결합함으로써 대화 연속성·도구 사용의 중단을 줄였습니다.
- 문제와 맥락: 음성 컨버세이션에서 모델이 말하는 도중에 들어오는 입력을 처리하면 지연과 중단이 발생하기 쉬운데, 기존 스택은 초기 세션 설정에도 여러 네트워크 왕복이 필요했습니다. 처리 방식: 오디오는 전용 빠른 경로로 연속 전달되고, 심층 추론과 도구 호출은 비동기 처리로 분리되며 세션 시작 시 네트워크 왕복 수를 기존 6회에서 1회로 줄였습니다. 근거: OpenAI는 'reduced voice-session startup from six network round trips to one'과 'audio moves through a dedicated fast path, while deeper reasoning and tool use happen asynchronously'를 명시했습니다. 실무적 의미: 초기 응답성 개선과 대화 중 추론·도구 사용의 끊김 감소가 챗봇의 실시간 상호작용 품질을 높여 음성 기반 에이전트의 사용자 경험을 개선할 수 있습니다.
원문 트윗 2개 보기
OpenAI
@OpenAI
GPT-Live can listen while it speaks. To make that feel natural at ChatGPT scale, we rebuilt the voice stack from client to model. This new architecture keeps audio flowing continuously, so deeper reasoning and tool use don't interrupt the conversation.
OpenAI
@OpenAI
Audio moves through a dedicated fast path, while deeper reasoning and tool use happen asynchronously. We also reduced voice-session startup from six network round trips to one.
🔥 취약점 공개 급증과 자동화 탐지의 파급포스트 3
7월 한 달에 21개 주요 조직이 약 2,500건의 고·치명적 CVE를 공개해 이전 월간 기록의 약 5배를 기록했고, Anthropic의 사례는 자동화된 도구가 취약점 탐지를 촉발할 수 있음을 보여줍니다.
- 상황과 문제: 자동화된 검색·검증 도구가 널리 쓰이면 숨겨진 취약점이 더 빠르게 표면화될 가능성이 큰데, 동시에 발견된 취약점이 공격자에게도 노출될 위험이 있습니다. 처리 및 근거: EpochAIResearch는 7월 약 2,500건의 고·치명적 CVE가 공개됐고 그 수치는 Anthropic이 Claude Mythos Preview의 취약점 탐지 능력을 공개하기 전의 월간 기록 대비 약 5배 수준이라고 제시했습니다. 영향: 취약점 탐지 자동화는 보안 태세를 빠르게 개선할 여지를 만들지만, 발견-공개-패치 사이의 시차가 공격 표면을 일시적으로 넓힐 수 있어 방어 체계와 공개 정책 조정이 필요합니다.
원문 트윗 2개 보기
Epoch AI
@EpochAIResearch
Serious cyber vulnerability disclosures keep climbing. In July, 21 major tech organizations published ~2,500 high- and critical-severity CVEs — about 5× the monthly record before Anthropic revealed Claude Mythos Preview could autonomously find software vulnerabilities.

Bloomberg TV
@BloombergTV
. @huggingface CEO @ClementDelangue says the recent OpenAI-linked cyberattack highlights the growing risks posed by rapidly-evolving AI models. Speaking to @edludlow , Delangue says that open-source AI models should be a part of the solution. Watch the full interview here https:// bloom.bg/4wE97K0
➖ 에이전트의 생산성 통합 가속포스트 3
Cursor가 Google Workspace(Gmail·Drive·Calendar·Docs·Sheets)에 직접 읽기·쓰기 권한을 주는 플러그인을 내놓았고, Hermes Agent Herald Release는 음성 채팅·플러그인·Agent2Agent 프로토콜 등 생산성 통합 기능을 확장했습니다.
- 배경과 문제: 문서·메일·캘린더 같은 업무 시스템과 에이전트를 연결하지 못하면 자동화된 워크플로가 제한됩니다. 동작 방식: Cursor의 플러그인은 에이전트가 Gmail·Drive·Calendar·Docs·Sheets에 직접 액세스해 읽기·작성·행동을 수행하도록 권한을 부여하고, Hermes Agent는 음성 입력·플러그인·아웃바운드 웹훅 등으로 데스크톱·서버 간 작업을 연결합니다. 근거: Cursor와 Teknium(더불어 Nous Research의 Hermes changelog)이 각각 Google Workspace 통합과 Herald Release 기능 목록을 공지했습니다. 의의: 업무용 에이전트가 생산성 앱에 직접 통합되면 문서 기반 자동화·일정 관리·이메일 처리 등 실무 자동화의 범위와 효율이 즉시 확장됩니다.
📈 오픈 웨이트 모델·하니스가 현장 실행성 확대포스트 4
MiniMax H3(Hailuo 3)는 Picsart에 탑재돼 native 2K·omni-reference·오픈 웨이트를 제공했고, 로컬 RTX 5090으로 생성 가능한 사례가 보고되며 오픈 모델의 현장 실행 가능성이 부각되었습니다. 한편 Cline 하니스는 오픈 웨이트 모델의 검증적 토큰 소비를 허용해 약 20% 성능 이득을 기록했습니다.
- 맥락과 문제: 대형 모델의 현장 실행은 가중치 공개 여부와 효율적 하니스 설계에 좌우되며, 로컬 실행·상업적 통합의 문턱이 존재합니다. 구현과 근거: MiniMax는 Hailuo 3를 Picsart에 배포해 오픈 웨이트·2K 영상 생성·omni-reference를 제공했으며 사용 사례로 RTX 5090에서 로컬 생성 사례가 보고되었습니다. 동시에 Cline은 일부 오픈 웨이트 모델이 검증·재검증에 더 많은 토큰을 쓰도록 학습된 점을 활용해 하니스 설계 변경만으로 벤치마크에서 약 20% 이득을 확인했다고 밝혔습니다. 의미: 가중치 공개와 하니스의 상보적 개선이 로컬 실행·상업적 적용을 빠르게 현실화시키는 경로가 되고 있습니다.
원문 트윗 2개 보기
MiniMax (official)
@MiniMax_AI
H3 just found a much bigger canvas Now live on @Picsart bringing open weights, native 2K, and omni-reference creation to millions of creators around the world. #MiniMaxH3 #OpenWeights
A new model dropped on Picsart and we’re excited to share it! Hailuo 3 by @MiniMax_AI brings omni-reference, commercial-grade generation quality, native 2K resolution, and open weights! Live now! Try it here https:// picsart.com/ai-playground/ ?mode=video&model=hailuo-03 … Learn more here
MiniMax (official)
@MiniMax_AI
This is how much you can do with a single RTX 5090 NOW with MiniMax H3. WE HAVE CROSSED A LINE.
Generated locally with H3 on an RTX 5090 in a few minutes, from nothing but a text prompt. We have crossed a line.
➖ 메모리·포스트트레이닝 연구의 새로운 제안들포스트 3
Zero-Mem은 메모리 단계에서 생성 호출을 제거하고 원본 상호작용 기록을 인덱싱해 조회·정렬하는 구조로, 같은 리더·컨텍스트 예산에서 메모리 연산 시간 비용을 57.6% 절감하면서 장기 QA 정확도를 유지했습니다. 한편 자동화된 포스트트레이닝(Locus)과 에이전트 실패 모드 정형화 연구도 병행되어 연구·생산 적용 축이 확장되고 있습니다.
- 문제와 배경: 기존 프로덕션 메모리 스택은 상호작용을 요약·재생성·재순위하면서 추가 모델 호출을 발생시키고, 이 과정에서 증거가 손실되거나 비용이 증가합니다. 설계와 처리: Zero-Mem은 모든 메모리 단계에서 생성을 배제하고 원본 상호작용을 두 가지 방식으로 인덱싱(엔티티-컨텍스트 그래프와 시간 계층)해 각각을 검색·가중치로 합산한 다음 결정적 교정으로 충돌 증거를 제거해 최종 리더가만 LLM을 호출하게 했습니다. 근거: 논문 발표는 '메모리 운영 시간 비용이 가장 빠른 비교 기준 대비 57.6% 감소'와 '경쟁력 있는 장기 QA 정확도'를 보고했습니다. 영향: 메모리 비용·지연을 낮추면서 증거 추적성을 유지하는 방식은 장기 대화·세션 보존이 중요한 실무 에이전트에 적용 가치를 제공합니다.
원문 트윗 2개 보기
DAIR.AI
@dair_ai
Finally a good paper testing whether agent memory needs an LLM at all. Production memory stacks spend extra model calls on summarizing interactions, writing records, and reranking retrievals. Every one of those calls costs tokens and latency, and the summaries quietly discard the evidence you later need. Zero-Mem removes generation from every memory step. Only the final question-answering reader ever invokes an LLM. It keeps original interaction traces as the record and indexes them two ways. An entity-context graph exposes connections across sessions. A temporal hierarchy preserves conversational locality and session state. For each query it weighs both views, retrieves from both, and follows their structure to recover supporting relations or surrounding context. Deterministic calibration then discards conflicting evidence before the reader answers. At matched reader and context budget, memory-operation time cost drops 57.6% against the fastest compared baseline, with competitive accuracy on long-memory and long-context QA. Paper: https:// arxiv.org/abs/2607.29377 Track more trending AI papers in our academy: https:// academy.dair.ai
elvis
@omarsar0
This is a wild result. Locus, the automated research system from @intology , post-trained Qwen3 base models that beat the official human-tuned Qwen3 1.7B Instruct release. SoTA on PostTrainBench!
The models are improving the models. Locus, our automated AI research system, is SOTA on PostTrainBench and post-trains Qwen3 base models that surpass the human post-trained Qwen3 model. Today, LLMs post-trained end-to-end by Locus are in production to millions.
용어 해설
- KV-캐시(KV-cache)
- — 모델이 긴 문맥을 처리할 때 키(key)·값(value)로 저장해 재사용하는 메모리 구조로, 재계산을 줄여 인퍼런스 지연을 낮춘다. KV-cache 크기는 컨텍스트 확장 시 attention 비용 점유율과 전체 처리량 상한을 결정하는 핵심 요소다.
- 어텐션 메커니즘(Attention mechanism)
- — 입력 시퀀스의 다른 위치들에 가중치를 부여해 모델이 중요한 토큰을 선택적으로 참고하게 하는 연산이다. 컨텍스트 창이 커질수록 연산량이 증가하며, 구조 선택(그룹 크기·헤드 차원 등)이 성능·지연의 상한을 만든다.
- 포스트트레이닝(Post-training)
- — 사전학습(pretraining) 후에 추가로 수행하는 적응 단계로, 인간 튜닝이나 자동화된 시스템(PostTrainBench/Locus 같은)이 모델 행동을 바꾸는 데 쓰인다. 원문은 'post-trained' 방식으로 성능 차이를 기록한 사례가 포함되어 있다.
- 오픈 웨이트(Open weights)
- — 모델의 가중치가 공개되어 누구나 다운로드·로컬 실행·수정할 수 있는 배포 방식으로, 로컬 생성·하니스 튜닝·연구 재현성을 가능하게 한다. 소스에서 MiniMax H3·Hailuo 3 사례가 해당 방식으로 서비스된 예시가 있다.
- 하니스(Harness)
- — 에이전트 형태 애플리케이션에서 모델과 도구·메모리·사용자 사이 상호작용을 중재하는 소프트웨어 레이어로, 호출 전략·검증·재시도 정책이 성능에 큰 영향을 준다. Cline 사례에서 하니스 설계로 20% 수준의 이득이 관찰됐다.
AI 요약 · 북마크 · 개인 피드 설정 — 무료
출처 · 인용 안내
인용 시 "요약 출처: AI Trends (aitrends.kr)"를 표기하고, 사실 확인은 원문 보기 기준으로 진행해 주세요. 자세한 기준은 운영 정책을 참고해 주세요.