TL;DR
이번 기간에는 OpenAI가 SpaceX 인수 이후 Cursor의 OpenAI 모델 직접 접근을 11월 12일 종료하려는 계획과, 이에 따라 특정 연구소에 종속되지 않은 독립 harness를 선호하는 흐름이 함께 나타났습니다. Tencent의 Hy4 preview는 770B 전체 파라미터와 49B 활성 파라미터, 1M context를 내세우며 OpenCode Go와 Cline에 연결됐고, MIX-STQ1_0은 층별 비트 폭을 조정해 1.5TB 모델을 약 200GiB GGUF로 압축했습니다. Terminal-Bench 4.0은 시간·CPU·메모리 자원 보정과 포화 task 제거를 반영했으며, 별도 연구로는 10가지 alignment failure를 자동으로 개선하는 연구 순환과 V-JEPA 2에 비해 5.6–20.8배 적은 compute를 사용하는 LeVJEPA가 공유됐습니다.
𝕏 실시간 트렌드 토픽
🔥 OpenAI의 Cursor 모델 직접 접근 종료 예고포스트 2
OpenAI가 SpaceX 인수 이후 Cursor와의 파트너십을 끝내고 11월 12일부터 직접 모델 접근을 종료하려는 계획을 알렸습니다. Cursor 측은 사용자 트래픽 중 OpenAI 모델 비중이 약 5%라며 협의를 이어가고 있다고 밝혔습니다.
세부 내용 보기
- OpenAI는 SpaceX 인수 이후 Cursor가 자사 모델에 직접 접근하는 경로를 11월 12일 종료하겠다고 알렸고, Cursor 측은 수년간 이어진 협력과 중립 인프라에 대한 신뢰를 근거로 해결을 위한 협의를 진행하고 있습니다. 기존에는 Cursor가 OpenAI 모델을 호출해 개발자에게 제공했지만, 종료 시점 이후에는 해당 직접 연결을 유지할 수 없게 되며 OpenAI 모델은 Cursor 사용자 트래픽의 약 5%를 차지한다고 Cursor 측이 밝혔습니다. 이 사안은 개발 도구가 특정 모델 제공자의 접근 정책과 기업 관계에 얼마나 의존하는지 드러낸 사례입니다.
Cursor 측은 OpenAI 모델이 사용자 트래픽의 약 5%에 해당하고 수년간 협력해 온 중립 인프라였다는 점을 들며 접근 종료 계획에 우려를 표했습니다.
OpenAI 측 결정은 SpaceX 인수 이후 파트너십과 모델 직접 접근 조건이 바뀐 데 따른 조치로, 11월 12일까지 개발자에게 전환 시간을 주겠다는 입장입니다.
원문 트윗 2개 보기

Michael Truell
We’re sorry to see that OpenAI put out a note saying they plan to block Cursor users from accessing OpenAI models in three months. OpenAI models serve about 5% of Cursor user traffic, and we’re speaking with the OpenAI team to resolve this. Cursor was one of the very first users of OpenAI, we’ve worked closely with their team for years, and we’ve trusted their platform to be neutral infrastructure for our business.
Min Choi
OpenAI just announced it will shut off its models in Cursor on Nov 12. Wild news to drop on a Friday night.
We’re ending our partnership with Cursor following its acquisition by SpaceX. Under our proposal, Cursor’s direct access to our models would end on November 12. We know that the people most affected by this decision are the developers who rely on OpenAI models in Cursor. We care
📈 특정 연구소 종속을 피하는 독립 harness포스트 5
OpenAI와 Cursor의 접근 종료 소식이 모델 연구소가 자사 모델뿐 아니라 애플리케이션 harness까지 통제하는 구조에 대한 문제의식으로 이어졌습니다. 여러 모델을 조합하려면 연구소와 분리된 harness가 필요하다는 실무자 의견이 모였습니다.
세부 내용 보기
- 모델 연구소가 자체 모델에 맞춘 harness와 생태계를 만들면서 다른 연구소의 모델 접근을 막으면, 애플리케이션 개발자는 모델 선택권과 비용·성능 최적화 여지를 잃게 됩니다. 게시물들은 독립 harness가 여러 proprietary 및 open-weight 모델을 같은 계층에서 연결하고 task별 성능과 margin을 조정하는 구조를 대안으로 삼으며, runtime 의사결정에서는 200 OK만으로 성공을 판단할 수 없으므로 observability가 필요하다고 설명합니다. LangChain과 LangSmith가 각각 독립 harness와 observability의 사례로 거론됐습니다.
독립 harness는 특정 연구소의 모델 접근 정책에 덜 묶인 채 proprietary와 open-weight 모델을 task별로 조합할 수 있어 성능과 margin을 조정하는 기반이 됩니다.
모델 연구소가 자체 모델과 애플리케이션 harness를 함께 통제하면 통합 경험은 관리하기 쉬워지지만, 다른 연구소 모델과의 상호운용성이 제한됩니다.
원문 트윗 2개 보기

Harrison Chase
Models labs will create great harnesses and ecosystems for their models but will block model access to harnesses of other labs Only choice for a harness that works across models is one not associated with a lab Long live LangChain
We’re ending our partnership with Cursor following its acquisition by SpaceX. Under our proposal, Cursor’s direct access to our models would end on November 12. We know that the people most affected by this decision are the developers who rely on OpenAI models in Cursor. We care

Jerry Liu
at the end of the day, we all have to stand by our company and the values it represents * frontier labs will want to own their own application/harness/model e2e. or at least, openai will to start with, and then anthropic will do the opposite of whatever openai does * everybody else will push for democratized access to a wide mixture of proprietary and open-weight models, so that we can optimize performance and margin for any given task and we're not beholden to the whims of the provider (this of course includes us with LlamaParse and any other startup building verticalized agents)
We unfortunately have decided that we cannot continue providing access to our models through Cursor and are ending our partnership. It boils down to trust and we’ve asked that this takes effect on November 12 to give you some time to plan. Many have used the GPT models through x.com/OpenAI/status/…
🔥 Hy4 preview의 저비트 GGUF와 코딩 에이전트 연결포스트 10
Tencent의 Hy4 preview가 OpenCode Go와 Cline에 연결되며 코딩 에이전트용 모델로 확산됐습니다. MIX-STQ1_0은 층별 비트 폭을 다르게 배정해 Hy4-preview를 1.5TB에서 약 200GiB GGUF로 압축했습니다.
세부 내용 보기
- Hy4 preview는 770B 파라미터와 49B active, 1M context를 내세우며 OpenCode Go와 Cline에서 사용할 수 있게 됐습니다. Tencent는 calibration data로 각 layer의 bit-width를 정하고 일부를 1.31-bit STQ1_0, 일부를 2.06-bit IQ2_XXS로 배정해 가중치를 GGUF로 변환했으며, 그 결과 모델 크기를 1.5TB에서 약 200GiB로 줄였습니다. BF16 대비 MCP Atlas는 83.7→83.2, SWE-Bench multi는 82.9→81.3, MRCR은 81.3→81.1, IFBench는 73.5→72.5로 측정됐고, Hy4는 3D 모델·게임·HTML 시뮬레이션 생성 사례에도 사용됐습니다. 큰 모델을 층별 중요도에 맞춰 압축하고 코딩 도구에 연결하는 방식이 메모리 부담과 활용 범위를 동시에 낮추는 접근으로 작동합니다.
원문 트윗 2개 보기
Tencent Hy
We compressed Hy4-preview from 1.5TB to ~200GiB GGUF and it still works well ! Meet MIX-STQ1_0.The trick isn’t just going low, it’s deciding where: calibration data picks each layer’s bit-width, some down to 1.31-bit STQ1_0, some up to 2.06-bit IQ2_XXS. Same budget, lower error. Accuracy barely moves vs BF16 MCP Atlas 83.7→83.2 SWE-Bench multi 82.9→81.3 MRCR 81.3→81.1 IFBench 73.5→72.5 See the details on HF : AngelSlim/Hy4-preview-GGUF Weights & low-bit GGUFs https:// huggingface.co/AngelSlim/Hy4- preview-GGUF … #LLM #Quantization #llamacpp #Hy
Hy4 preview is here. 770B, 49B active, 1M context. Built for productivity. Open source frontier. Consistent affordable price. Use it. Tell us what breaks. More on Hy blog: https:// hy.tencent.ai/research/hy4-p review … HuggingFace: https:// huggingface.co/tencent/Hy4-pr eview … Github: https:// github.com/Tencent-Hunyua n/Hy4-preview …
Tencent Hy
Try Hy4 preview in Cline
Tencent Hy4 Preview leads on SWE-bench Pro. 770B, 49B active, 1M context, and their biggest generational leap measured to date. It’s exciting to see another open weights model compete against the frontier. Try in Cline with: 1. npm i -g cline 2. /model 3. Select Hy4 preview
📈 Terminal-Bench 4.0의 자원 보정과 포화 task 정리포스트 1
Terminal-Bench dataset과 leaderboard가 4.0으로 갱신됐습니다. 이번 버전은 task별 시간·CPU·메모리 자원을 보정하고 수정된 task를 반영하며 이미 성능 차이가 좁혀진 task를 제거했습니다.
세부 내용 보기
- Terminal-Bench 4.0은 모델이 터미널 task를 수행할 때 비교 조건이 되는 시간, CPU, memory 자원을 보정하고 task 자체의 오류를 수정하는 방식으로 평가 체계를 손봤습니다. 성능이 이미 포화된 task를 leaderboard에서 제거해 모델 간 차이가 남아 있는 작업에 평가 자원을 집중하며, dataset과 leaderboard를 함께 갱신해 결과 비교의 기준을 일치시켰습니다. 이는 단순히 task 수를 늘리는 대신 자원 조건과 포화도를 관리해 benchmark의 측정력을 유지하는 업데이트입니다.
➖ Automated Researchers의 10가지 alignment failure 개선 순환포스트 1
한 연구는 AI 연구 시스템이 다른 모델의 안전 문제를 스스로 찾고 시험하는 전체 연구 순환을 수행했다고 밝혔습니다. 문헌 탐색, post-training 방법 제안, 학습과 평가를 연결해 deception·jailbreak·reward hacking 등 10가지 실패를 다뤘습니다.
세부 내용 보기
- 이 시스템은 관련 문헌을 찾고 안전 개선용 post-training 방법을 제안한 뒤 모델을 학습하고 평가하는 순서를 자동으로 반복했습니다. 대상은 deception, jailbreak, reward hacking을 포함한 10가지 alignment failure였으며, 수정 방법은 보지 못한 평가와 최대 4.7배 큰 모델에도 일반화됐다고 연구 게시물이 밝혔습니다. 안전 문제를 사람이 정한 단일 규칙으로 처리하는 대신 연구 가설 생성부터 검증까지의 순환을 자동화했다는 점이 핵심이며, 제시된 수치는 새로운 평가와 더 큰 모델에서의 전이 범위를 가리킵니다.
➖ LeVJEPA의 영상 사전학습 구조 단순화포스트 1
LeVJEPA는 target encoder, predictor, stop-gradient, reconstruction 구성을 하나의 encoder와 invariance·SIGReg 학습으로 대체하는 영상 사전학습 방법입니다. V-JEPA 2와 같거나 높은 성능을 유지하면서 5.6–20.8배 적은 compute를 사용한다고 보고됐습니다.
세부 내용 보기
- 기존 영상 사전학습에서 사용하던 target encoder, predictor, stop-gradient, reconstruction machinery를 제거하고 단일 encoder에 invariance와 SIGReg를 적용해 학습 과정을 단순화했습니다. 영상 token의 95%를 무작위로 제거한 입력에서도 표현 붕괴를 막고 causal frame representation을 학습하며, appearance와 motion understanding을 유지합니다. 연구 게시물은 V-JEPA 2와 성능이 같거나 높고 compute는 5.6–20.8배 적다고 밝혔으며, 영상 표현 학습에서 구성 요소 수와 계산량을 함께 줄이는 방향을 제시합니다.
용어 해설
- 혼합 전문가 모델(Mixture of Experts)
- — 여러 전문가 모듈 가운데 일부만 활성화해 입력을 처리하는 구조입니다. Hy4는 전체 770B 파라미터 중 49B를 활성화하는 방식으로 소개됐으며, 계산량을 줄이면서 큰 모델 용량과 긴 컨텍스트를 함께 활용하는 데 쓰입니다.
- GGUF 모델 파일 형식(GGUF)
- — 모델 가중치와 실행에 필요한 정보를 하나의 파일에 담는 형식입니다. Hy4-preview를 GGUF로 변환하면 1.5TB였던 크기를 약 200GiB로 줄여 로컬 또는 경량 추론 환경에서 다루기 쉬워집니다.
- 양자화(Quantization)
- — 가중치의 표현 비트 수를 낮춰 모델 저장 공간과 메모리 사용량을 줄이는 기법입니다. MIX-STQ1_0은 층마다 calibration data로 비트 폭을 다르게 선택해 압축률과 오차 사이의 균형을 맞춥니다.
- 모델 실행 하네스(Harness)
- — 여러 모델을 같은 방식으로 호출하고 결과를 비교하거나 애플리케이션에 연결하는 실행 계층입니다. 게시물에서는 특정 연구소에 종속되지 않은 독립 harness가 여러 모델을 함께 다루는 선택지로 제시됐습니다.
- SIGReg
- — 표현 공간의 통계적 성질을 정규화해 학습 중 표현 붕괴를 막는 방법입니다. LeVJEPA는 invariance와 SIGReg를 사용해 기존 영상 사전학습 구성 요소를 단순화하고, 토큰을 무작위로 대량 제거한 상태에서도 영상 표현을 학습합니다.
- 정렬 실패(Alignment Failure)
- — 모델이 의도한 안전 목표와 다르게 행동하는 문제를 뜻합니다. 게시된 연구는 deception, jailbreak, reward hacking 등 10가지 실패 유형을 대상으로 문헌 탐색부터 post-training과 평가까지의 자동 연구 순환을 수행했다고 밝혔습니다.
AI 요약 · 북마크 · 개인 피드 설정 — 무료
출처 · 인용 안내
인용 시 "요약 출처: AI Trends (aitrends.kr)"를 표기하고, 사실 확인은 원문 보기 기준으로 진행해 주세요. 자세한 기준은 운영 정책을 참고해 주세요.