TL;DR
이번 기간에는 큰 모델을 작은 메모리에서 실행하는 방법과 긴 입력을 처리하는 설정이 실무 사례와 함께 부각됐다. GPT-5.6 Sol은 Codex에서 1,000,000토큰 컨텍스트와 900,000토큰 자동 압축 한도로 설정할 수 있고, Qwen3.8은 2B 모델을 1.3GB 수준으로 줄이면서 262k 컨텍스트와 function calling을 유지했다. 단일 RTX 3060 비교에서는 2-bit 대형 모델이 4-bit 소형 모델을 앞섰으며, LlamaExtract Agentic Plus는 장문서에서 94% 이상 정확도와 필드별 위치 정보를 기록했다. 한편 AI가 생산성을 높이는 구간 이후 고용과 수요가 어떻게 바뀌는지를 둘러싼 시각도 이어졌다.
𝕏 실시간 트렌드 토픽
📈 Joule당 지능 향상포스트 1
Amjad Masad가 16개월 동안 Joule당 지능이 18배 향상됐다고 제시한 가운데 Elon Musk가 향상이 계속될 것이라고 답했다.
- Amjad Masad의 인용 내용은 16개월 사이 같은 에너지 단위로 얻는 지능이 18배 높아졌다는 변화에 초점을 맞췄고, Elon Musk는 이를 바탕으로 Joule당 지능 향상이 계속될 것이라고 짧게 답했다. 게시물에는 모델명이나 측정 방법이 추가로 적히지 않아 개선의 입력·평가 절차는 확인되지 않는다.
- 이 사례는 모델 성능을 절대 점수만으로 비교하지 않고 에너지 단위당 산출되는 지능으로 바라보는 관점을 담고 있지만, 원문에 구체적인 벤치마크와 하드웨어 수치가 없어 18배의 범위를 더 세분화할 근거는 없다.
📈 Codex의 1,000,000토큰 컨텍스트 설정포스트 1
Codex에서 GPT-5.6 Sol의 컨텍스트 윈도를 1,000,000토큰으로 늘리는 설정과 900,000토큰 자동 압축 절차가 공유됐다.
- 기본 Codex 설정이 성능과 비용에 맞춰 조정돼 있어도 더 많은 코드와 tool output, conversation history를 유지하려는 수요가 있었고, 게시물은 이를 위해 GPT-5.6 Sol을 선택한 뒤 model_context_window를 1000000으로 지정하는 절차를 제시했다.
- Codex는 기록이 900,000토큰에 가까워지면 이전 내용을 자동 압축해 1,000,000토큰 한도 안에 여유를 남긴다. 설정 파일을 저장한 뒤 클라이언트를 재시작하고 새 세션을 시작해야 하며, 별도 기본값 변경 없이 CLI 옵션으로도 같은 구성을 적용할 수 있다.
- 게시물은 GPT-5.6 Sol의 문서화된 컨텍스트 윈도가 1,050,000토큰이라고 밝혔고, 실제 설정값은 1,000,000토큰으로 제한했다. 긴 코드베이스와 도구 실행 기록을 요약 전까지 보존하려는 Codex 사용 사례와 직접 연결된다.
📈 Hermes Agent Desktop의 Bots Mode포스트 1
Hermes Agent Desktop에 Bots Mode를 출시하기 위한 작업이 진행 중이며, 한 번의 프롬프트로 게임을 만들고 시각 확인과 반복 수정을 수행하는 에이전트 사례가 함께 공유됐다.
- Teknium은 Hermes Agent Desktop용 Bots Mode를 출시 단계로 포장하고 있다고 밝혔고, 인용된 사례에서는 Hermes Agent가 한 번의 프롬프트를 입력으로 받아 게임을 만든 뒤 결과를 vision으로 확인하고 게임 조작과 코드·설정을 반복 수정했다.
- 처리 흐름은 자연어 프롬프트에서 시작해 생성, 시각 점검, 조작 테스트, 작은 수정과 큰 수정의 반복으로 이어진다. 인용 내용은 이 과정이 사용자의 로컬 환경에서 실행되고 있다는 점을 장점으로 짚었지만, 정확도나 처리 시간 수치는 제시하지 않았다.
원문 트윗 2개 보기

Teknium
@Teknium
Packaging up Bots Mode for Hermes Agent Desktop for release right now, stay tuned
the new @NousResearch dashboard with the bots is actually game changing, quick pivot after grokbot dropped. No lab ships faster kudos @Teknium @imbabybrooklyn

Teknium
@Teknium
Hermes sets you free
I must say, seeing Hermes Agent building a game based on one prompt I gave it, iterating over it, checking with vision if it looks right, trying out game controls, making small and big adjustments alike, it’s something else. But the best part, this is all happening on my own
📈 Qwen3.8의 1GB급 로컬 추론포스트 2
Qwen3.8을 2B 규모로 증류해 1.3GB Q4_K_M 파일과 262k 컨텍스트, function calling을 확보했다는 사례가 반복 공유됐다.
- 게시물은 Qwen의 2.4T flagship에서 reasoning curriculum을 가져와 Qwen3.8 2B 모델에 적용하고, LoRA가 아닌 full-parameter SFT와 교사 모델의 실제 reasoning trace를 사용했다고 적었다. 이 과정은 큰 모델의 학습 신호를 작은 모델로 옮기는 입력·학습 구조다.
- 성능 수치는 MMLU CoT가 28.3에서 54.8로, GSM8K가 33에서 64로 올랐다고 기록됐으며, Q4_K_M 파일 크기는 1.3GB다. Native 262k context와 function calling도 함께 유지돼 휴대전화에서 실행할 수 있는 메모리 규모를 목표로 한다.
- 같은 작성자는 모든 답변이 큰 모델에서 나온 실제 <think> 블록으로 시작한다고 덧붙였다. 다만 게시물에는 평가 조건과 휴대전화의 구체적인 실행 시간이나 전력 수치가 없다.
원문 트윗 2개 보기
Md Ismail Šojal
@0x0SojalSec
You can now run Qwen3.8 model in your phones just 1GB. - 262k context with Real reasoning. the full reasoning curriculum from Qwen’s 2.4T flagship - distilled Qwen3.8 2.4 Trillion model into 2B and it actually worked - Full-parameter SFT. Same curriculum as the 9B and 4B. - Not LoRA, Real traces from the teacher. - then Suddenly it scores 28.3 to 54.8 MMLU CoT - & GSM8K: 33 to 64 Native 262k context & function calling. Q4_K_M is only 1.3 GB.
Md Ismail Šojal
@0x0SojalSec
You can Run Qwen3.8 model in your phone in 1GB the full reasoning curriculum from Qwen’s 2.4T flagship, - distilled Qwen3.8 a 2.4 Trillion model into 2B and it actually worked - Full-parameter SFT. Same curriculum as the 9B and 4B. - Not LoRA, Real traces from the teacher. - Suddenly scores 28.3 to 54.8 MMLU CoT - & GSM8K: 33 to 64 Native 262k context & function calling. Q4_K_M is only 1.3 GB.
➖ 12GB VRAM에서 양자화 비트 수와 모델 크기 비교포스트 2
단일 12GB RTX 3060에서 2-bit 대형 모델이 4-bit 소형 모델을 네 가지 벤치마크 모두에서 앞섰다는 비교가 공유됐다.
- 비교 대상은 2-bit Qwen3.8-27B와 Muse Glimmer 30B, 4-bit Gemma 4 12B였으며, 같은 프롬프트와 harness, 모델당 한 번의 repair attempt를 사용했다. 제한된 VRAM에서 더 큰 모델을 낮은 비트로 적재하는 선택과 작은 모델의 높은 정밀도를 비교한 구조다.
- 게시물에 따르면 4-bit 12B 모델은 네 가지 벤치마크 전부에서 패했고, 2-bit 대형 모델의 우세가 근소한 차이가 아니었다. 작성자는 소형 모델의 문제가 지식 부족보다 출력을 반복하며 끝내지 못하는 completion 안정성에 있다고 적었다.
- 추가 결론은 12GB VRAM에서 더 큰 모델을 2-bit로 적재할 수 있다면 4-bit 소형 모델보다 completion rate와 agent stability 측면에서 유리하다는 것이다. 다만 원문은 벤치마크 이름과 세부 점수를 공개하지 않았다.
원문 트윗 2개 보기
Md Ismail Šojal
@0x0SojalSec
Benchmarks : Qwen3.8-27B & Muse Glimmer 30B (both 2-bit) vs Gemma 4 12B (4-bit). Some careful benchmarks from a single 12GB RTX 3060: Same prompts, same harness, one repair attempt. The 12B loses every single benchmark. Bigger model at 2-bit beats smaller model at 4-bit on a single 12GB RTX 3060 and it’s not close. but size clearly wins over higher precision when VRAM is limited. The results surprised me more than I expected. The 4-bit 12B model lost every category. The smaller model’s biggest problem isn’t knowledge it’s that it keeps looping and never finishes.
three models on a single 12GB RTX 3060. Qwen3.8-27B and Muse Glimmer 30B at 2-bit, Gemma 4 12B at 4-bit. four benchmarks, same harness, same prompts, one repair attempt each. (configs below) the 4-bit 12B loses all four. not by a little. between the two 2-bit models it's a
Md Ismail Šojal
@0x0SojalSec
Key takeaway: if a larger model fits at 2-bit, it is almost always the better choice than a smaller model at 4-bit especially if you care about completion rate and agent stability.
➖ LlamaExtract Agentic Plus의 장문서 필드 추출포스트 1
LlamaExtract Agentic Plus가 50쪽이 넘는 문서와 10만 개에 이르는 필드를 94% 이상 정확도로 추출하며 각 결과의 신뢰도와 원문 위치를 기록한다는 사례가 공유됐다.
- 장문서에서 10,000~100,000개 필드를 뽑아야 하는 문제를 위해 전용 harness와 모델 집합을 조정하고, 복잡한 정보 추론과 필드 추출에 맞춘 처리 흐름을 사용했다. 각 필드는 추출값뿐 아니라 confidence score와 출처 위치를 나타내는 bounding box를 함께 반환한다.
- 게시물의 정확도는 94% 이상이며, 일반화된 coding agent harness보다 10~20% 높다고 적혔다. 비교 대상으로 Claude Code Opus 4.8과 Codex GPT-5.6이 언급됐지만, 세부 평가 데이터와 측정 기준은 원문에 없다.
- 인용 사례에서는 114쪽짜리 FTX 채권자 행렬 문서에서 75,000개 필드를 처리했다고 기록됐다. 대량 추출 뒤 사람이 원문 위치와 신뢰도를 기준으로 결과를 확인할 수 있도록 출력 구조를 설계한 점이 핵심이다.
📈 Gemini 3.7 Flash의 URL 기반 웹사이트 생성포스트 1
아이디어나 웹사이트 URL을 입력하면 Gemini 3.7 Flash가 실시간으로 작동하는 인터랙티브 웹사이트를 재구성한다는 사례가 게시됐다.
- 게시물은 사용자가 아이디어를 입력하거나 기존 웹사이트 URL을 넣으면 Gemini 3.7 Flash가 결과물을 생성하는 흐름을 제시했다. 입력된 사이트를 바탕으로 인터랙티브한 웹페이지를 실시간 생성하며, 사용자는 생성 과정을 화면에서 확인한다.
- YouTube clone과 X clone이 예시로 언급됐고, YouTube 재구성에 1분 이내가 걸렸다고 적혔다. 다만 생성된 코드의 품질, 배포 가능성, 원본 사이트와의 기능 일치도에 대한 수치는 없다.
➖ AI 생산성과 고용 전환의 다음 단계포스트 3
AI가 현재 소프트웨어 엔지니어의 생산성을 높이는 동시에 일부 업무를 사람보다 직접 수행하기 시작했다는 관찰을 두고, 고용 감소 전망과 대응책을 둘러싼 시각이 갈렸다.
- 인용된 발언은 AI가 코드 대부분을 작성해도 현재는 소프트웨어 엔지니어의 생산성을 높이는 단계라고 설명하면서, 일부 업무에서는 AI가 사람을 보조하기보다 직접 수행하는 조짐이 나타난다고 했다. 자동화 비율이 높아질수록 남은 업무의 생산성은 오를 수 있지만 결국 다른 수요와 역할을 찾아야 한다는 구조다.
- AI의 장기 고용 효과를 두고는 불확실성이 크다는 입장과, 초급 일자리의 50%가 대체될 수 있다는 전망을 비판적으로 인용한 입장이 함께 나왔다. 전자는 산업 전환에 대비한 token tax, 기업과의 조정, 재훈련, 거시경제 정책을 대응 수단으로 거론했지만 재훈련의 효과에는 회의적이라고 밝혔다.
- Mark Zuckerberg의 6,500단어 서한과 관련된 게시물은 AI가 대부분의 일자리와 인간의 관련성을 없앨 가능성을 믿는다면 왜 그 미래를 서둘러 만들려 하느냐는 질문을 전했다. 같은 논점 안에서 AI 구매가 전환으로부터 사람을 보호한다는 식의 설명에 대한 비판도 나와, 생산성 향상과 고용 충격의 시간차가 쟁점으로 남았다.
AI는 현재 코드 작성과 같은 업무를 자동화하면서도 남은 업무를 수행하는 사람의 생산성을 높이고 있으며, 기업 조정과 정책 대응을 병행하면 전환에 적응할 여지가 있다는 입장이다.
생산성 향상이 영구적이지 않고 AI가 업무 전체를 직접 수행하는 단계로 가까워지면 초급 일자리와 인간의 역할이 크게 줄어들 수 있다는 입장이다.
AI의 장기 고용 효과와 새로운 수요의 규모를 아직 확정하기 어렵고, 현재의 생산성 증가와 향후 대체 가능성을 함께 관찰해야 한다는 입장이다.
원문 트윗 2개 보기
Susan Zhang
@suchenzang
"I've always said, and you know, if you go back to those original clips, they always get like, you know, cut out of context in like the 3 seconds. But like, you know, the real statement was always, 'I don't know what's gonna happen, but this is an order of magnitude for how crazy things could be'. Also, I always talk about all the things we can do in response to this, right? I've talked about token tax and working with enterprises to adjust people. I'm a little skeptical of retraining programs, but like we should throw them in the mix. Macroeconomic policy. Even from the beginning, I always talked about solutions, but you know, somehow there's this tendency in human psychology to clip the 3 seconds of like 'doom is coming'. So my message is just definitely not 'doom is coming'. My message is like, this is something, you know, that we should see coming, that we're worried about, and that we need to actually respond to positively." "You know, I don't know exactly, but I'm still pretty concerned. I'm still the same order of concerned. You know, we are seeing right now that AI is making people more productive, but that's the usual hump. If you go back, you know, to the kind of industrial revolution, you know, I wrote about this in "Adolescence of Technology." You automate 90% of the job, great, people are 10 times more productive in the other 10% 'cause they're 10 times more leveraged. But eventually it gets close to 100%. Now the sequel to that is, well, then you have to find something else for them to do." "I don't know about the long run. I'm truly uncertain about that. But I do think there are types of adaptation. Like one thing I'll talk about is, you know, software engineers within Anthropic. We're going through this transition right now where, you know, right now AI makes the software engineers more productive even though AI writes all the code or almost all the code. But still it makes people more productive. But we're already starting to see the beginning of like, you know, there may be some people that it's, it's not making more productive, that it's better for the AI to just, to just do the thing. So that's one side of it. The other side of it though is what do we need more demand for?"
TechCrunch
@TechCrunch
Mark Zuckerberg dropped a 6,500-word letter detailing his vision for “The Path to a Positive AI Future.” @EquityPod takes a closer look at one of his arguments: If you believe AI could eliminate most jobs and humanity’s relevance, why rush to build that future? http:// spr.ly/6013B1THLx
용어 해설
- 컨텍스트 윈도(Context Window)
- — 모델이 한 요청에서 유지하고 처리할 수 있는 입력 토큰의 범위이다. 범위가 커지면 Codex가 더 많은 코드와 도구 출력, 대화 기록을 요약 전까지 보존할 수 있지만 처리 비용과 성능의 균형이 필요하다.
- 자동 기록 압축(Automatic Compaction)
- — 대화 기록이 정해진 토큰 한도에 가까워질 때 이전 내용을 압축해 새 입력 공간을 확보하는 처리 방식이다. Codex 설정에서는 900,000토큰 부근에서 기록 압축을 시작해 1,000,000토큰 윈도 안에 여유를 둔다.
- 지식 증류(Knowledge Distillation)
- — 큰 교사 모델의 학습 과정이나 출력 흔적을 작은 모델에 전달하는 방식이다. Qwen3.8 사례에서는 2.4T 모델의 reasoning curriculum과 실제 think 블록을 2B 모델 학습에 사용해 작은 저장 용량으로 추론 성능을 높였다.
- 양자화(Quantization)
- — 모델 가중치를 더 적은 비트로 표현해 메모리 사용량을 줄이는 최적화 방식이다. 게시물의 단일 RTX 3060 비교에서는 2-bit로 양자화한 큰 모델이 4-bit 소형 모델보다 네 가지 벤치마크에서 앞섰다.
- 신뢰도 점수(Confidence Score)
- — 문서에서 추출한 각 필드의 결과가 얼마나 확실한지 함께 기록하는 값이다. LlamaExtract Agentic Plus는 추출값마다 신뢰도 점수와 원문 위치를 나타내는 bounding box를 붙여 결과 검증에 필요한 근거를 남긴다.
AI 요약 · 북마크 · 개인 피드 설정 — 무료
출처 · 인용 안내
인용 시 "요약 출처: AI Trends (aitrends.kr)"를 표기하고, 사실 확인은 원문 보기 기준으로 진행해 주세요. 자세한 기준은 운영 정책을 참고해 주세요.

