TL;DR
DeepSeek의 공식 가격 인상에 맞춰 OpenCode Go가 이용 한도를 조정했고, OpenCode는 기존 가격에 가까운 호스팅 비용을 유지할 수 있는 구성을 찾고 있습니다. 여러 제공자가 낮은 가격을 구현했다고 주장했지만 실제 검증에서 조건을 충족하지 못해, OpenCode는 이번 주 여러 설정을 직접 테스트하는 단계입니다. 가격 변화가 모델 API와 이를 중개하는 서비스의 한도·운영비에 곧바로 연결되는 구조가 드러났습니다.
𝕏 실시간 트렌드 토픽
🔥 DeepSeek 가격 인상과 OpenCode Go의 호스팅 비용 재검증포스트 2
DeepSeek의 공식 가격 인상으로 OpenCode Go의 사용 한도가 바뀌었고, OpenCode는 기존 가격에 가까운 호스팅 구성을 다시 찾고 있습니다.
- DeepSeek의 가격 인상이 OpenCode Go의 한도 조정으로 이어지면서, 서비스 운영비와 사용자별 사용량 제한이 함께 움직이는 상황이 됐습니다. OpenCode는 여러 제공자가 낮은 가격을 구현했다고 알렸지만 실제로는 그렇지 않았다고 밝히고, 여러 호스팅 설정을 시험해 비용 구조를 확인하고 있습니다.
원문 트윗 2개 보기

OpenCode
@opencode
DeepSeek has officially increased their prices OpenCode Go's limits have been updated to reflect them We have made progress on operation cheepseek, more info soon

OpenCode
@opencode
we've been working to figure out how to get deepseek hosted at near the previous price this is not easy. there are dozens of providers claiming they've done it but they have not we're running tests on several different setups this week and hopefully they work out x.com/opencode/statu…
➖ 이번 주 AI 논문 목록에 모인 추론·도구 호출·모델 공격 연구포스트 1
주간 논문 목록에 추론 능력 증류, 도구 호출, 추론 흔적 탈취와 모델 기억 문제를 다룬 연구가 함께 포함됐습니다.
- 이번 주 논문 목록은 Skaling, Harness-IF, Mind Viruses, Distilled Reasoning Skills, Stealing Reasoning Traces, Programmatic Tool Calling, Catastrophic Remembering을 한데 묶었습니다. 제목 수준에서 모델의 추론 능력 학습, 에이전트 도구 사용, 추론 과정의 탈취, 학습 후 기억 문제라는 연구 축이 병렬로 나타나지만, 원문에는 각 논문의 방법이나 실험 수치가 제시되지 않았습니다.
➖ Hermes Agent Desktop 세션 로딩 속도 개선포스트 1
Hermes Agent Desktop에서 세션을 불러오는 시간이 줄어드는 업데이트가 공유됐습니다.
- Hermes Agent Desktop의 세션 로딩 경로가 업데이트 대상이 됐고, 변경 후 세션이 훨씬 빠르게 열리는 현상이 보고됐습니다. 원문은 내부 구현이나 지연 시간 수치를 밝히지 않아, 개선 폭과 적용 범위는 확인되지 않았습니다.
➖ Self-Attention과 Cross-Attention을 드래그로 익히는 인터랙티브 도표포스트 1
Self-Attention과 Cross-Attention의 텐서 차이를 직접 조작하며 확인하는 학습 도구가 공유됐습니다.
- Self-Attention과 Cross-Attention에서 입력 X와 E의 길이, Q·K·V의 높이, 토큰 증가에 따른 score 규모를 혼동하기 쉬운 점이 학습 문제로 제시됐습니다. byhand.ai의 인터랙티브 도표는 사용자가 도형을 드래그해 각 조건을 확인하도록 만들었고, 제시된 정답은 T, F, T, F, T입니다.
📈 deepagents의 분리형 백엔드와 코드 실행 선택 구조포스트 2
deepagents는 에이전트 루프와 파일·코드 작업을 담당하는 백엔드를 분리해 로컬·클라우드·비코딩 에이전트에 같은 구조를 적용합니다.
- 에이전트가 반드시 코드 실행을 필요로 하지는 않지만 파일이나 재고 데이터의 읽기·쓰기 작업은 필요할 수 있다는 문제가 배경입니다. deepagents는 에이전트 루프를 실행하는 위치와 read·write·edit·execute를 제공하는 백엔드를 분리하고, 백엔드를 실제 파일시스템·데이터베이스·오브젝트 스토리지 또는 sandbox로 교체합니다. 로컬 TUI에서는 같은 디렉터리의 sandbox를 연결하고, 클라우드 구성에서는 LangSmith deployments와 Modal·Daytona·E2B의 원격 sandbox를 연결하며, 코드 실행이 과한 에이전트에는 fake backend를 사용합니다. LangGraph 기반 구조라 MCP와 A2A 같은 표준 엔드포인트를 붙일 수 있고, Slack과 웹 UI가 같은 백엔드에 연결됩니다.
에이전트의 두뇌와 작업 수단을 분리하면 같은 에이전트 루프를 로컬 TUI, 클라우드 코딩 환경, 비코딩 에이전트에 재사용할 수 있습니다. 코드 실행이 필요하지 않은 경우 fake backend로 파일 상호작용만 남길 수 있어 sandbox 운영 부담을 줄입니다.
📈 Qwen3.8-27B 로컬 실행에서 MTP 설정이 만든 속도 차이포스트 2
24GB M5 MacBook에서 Qwen3.8-27B의 MTP speculative decoding 설정을 조정해 생성 속도와 이미지 처리 시간이 달라졌습니다.
- Qwen3.8-27B를 로컬에서 실행할 때 기본 속도와 draft 모델의 공격성이 성능 병목으로 나타났습니다. llama.cpp에서 MTP speculative decoding의 --spec-draft-p-min 0.8을 설정하자 처리량이 7.16 tok/s에서 10.47 tok/s로 1.46배 증가했고, acceptance rate는 51%에서 87%로 올랐습니다. 반대로 draft 모델을 더 공격적으로 밀면 speculation을 쓰지 않은 기준보다 느려졌으며, temperature 0에서는 출력이 byte-identical로 유지됐습니다. Vision encoder를 GPU로 옮긴 뒤 이미지 처리 시간도 61초에서 35.5초로 줄었습니다.
- Qwen3.8-27B를 로컬에서 4-bit MLX로 구동해 코드와 사무 작업에 쓰는 사례도 함께 제시됐습니다. MacBook Pro M4에서 사람의 추가 개입 없이 Three.js FPS 게임을 3.5시간 만에 완성했다는 사례와 결합되면서, 모델 크기·메모리·추론 설정이 로컬 에이전트 성능을 좌우하는 방식이 부각됐습니다.
speculative decoding의 성능은 draft 모델을 강하게 설정할수록 좋아지는 단순한 관계가 아니며, --spec-draft-p-min 0.8처럼 acceptance rate와 실제 처리량을 함께 측정해야 합니다.
원문 트윗 2개 보기
Md Ismail Šojal
@0x0SojalSec
Run locally Qwen3.8-27B & stuck at 7.16 tok/s on a 24GB M5 MacBook? One flag in llama.cpp quietly unlocked 1.46× more tokens/sec on Qwen3.8-27B. After tuning MTP speculative decoding (especially --spec-draft-p-min 0.8), it jumped to 10.47 tok/s. Biggest unlock: --spec-draft-p-min 0.8 Acceptance rate went from 51% to 87%. Pushing the draft model harder actually made it slower than no speculation at all. Output remained completely lossless at temperature 0. Also moved the vision encoder to GPU then image processing 61s to 35.5s. Surprisingly, being more aggressive with the draft model performed worse than baseline. Everything stayed byte-identical at temperature 0.
Run the new Qwen3.8-27B fully locally on only 17GB RAM, Beats larger models in real agentic coding and office workflows. @UnslothAI Dynamic GGUFs make the strongest model in its size class available to everyone. - Vision, - hybrid reasoning - 256K context all offline. -
Md Ismail Šojal
@0x0SojalSec
What if your laptop could just build games while you sleep? - Local autonomous agent + Qwen3.8-27B-4bit-MLX with macbook pro M4 - Full playable Three.js FPS in 3.5 hours - Zero human intervention after the prompt Neon breach complete with procedural neon arena, shooting, movement and Hud https:// x.com/shi3z/status/2 088822028149371028/video/1 …
📈 Gaussian Splatting 1억 2,100만 점의 브라우저 실시간 렌더링포스트 1
Prague 한 구역을 1억 2,100만 개의 Gaussian Splatting 점으로 구성해 Chrome과 휴대전화에서 둘러볼 수 있는 Web 3D 사례가 공유됐습니다.
- 대규모 3D 장면을 브라우저에서 실시간으로 탐색하려면 점 데이터 처리와 그래픽 API 실행이 병목이 됩니다. 이 사례는 Prague의 한 동네를 121 million points로 구성하고, PlayCanvas와 SuperSplat을 사용해 Chrome과 휴대전화에서 이동 가능한 장면을 만들었으며 WebGL2와 WebGPU 기반 엔진으로 렌더링했습니다.
➖ Watermark 탐지에 필요한 비공개 키와 분포 정보포스트 1
텍스트 Watermark를 탐지하려면 대규모 텍스트·분포 데이터나 비공개 키가 필요하다는 분석이 이어졌습니다.
- Watermark가 적용된 텍스트는 결과 문장과 토큰 선택 분포만으로 비적용 텍스트와 구별하기 어려울 수 있다는 문제가 제기됐습니다. 제시된 접근은 Watermark·비Watermark 텍스트와 분포를 수백만 건 모아 binary black-box classifier를 학습하는 방식이지만, API가 logits·logprobs를 더 이상 노출하지 않는다면 토큰별 난수 시드와 위치를 역추적하기 어렵습니다. 원문은 실제 탐지 성능을 제시하지 않았고, 비공개 secret key를 가진 주체만 탐지할 수 있다는 판단을 덧붙였습니다.
대규모 말뭉치와 토큰 분포를 이용한 분류기 학습은 가능한 탐지 경로로 언급됐지만, 분포 정보와 비공개 키 접근이 없으면 실질적인 검증이 제한됩니다.
원문 트윗 2개 보기
Sebastian Raschka
@rasbt
I don't think you'd be able to detect the watermark even if you had access to the full prompt and logit distributions. That's because the resulting text and distribution choices would still look like one that you can get without watermarking. What you'd need is a very large corpus of texts plus the distributions, and then you can maybe reverse engineer the token-dependent random seed and positions. But the thing is that the API doesn't expose the logits/logprobs (anymore) afaik so that level of reverse engineering is not possible. Also, the short answer to your overall question: you basically need the "secret key" to detect the watermark, i.e., only Anthropic can detect the watermark.
Sebastian Raschka
@rasbt
I think the easiest way to potentially build something here is to collect millions of watermarked and non-watermarked texts and then train a binary blackbox classifier that may or may not be able to tell based on hidden patterns. (Kind of like how AI Text Detectors work)
용어 해설
- DeepSeek
- — 이 글에서는 가격이 인상된 AI 모델 제공자로 등장합니다. OpenCode Go는 DeepSeek의 가격 변경을 반영해 이용 한도를 조정했고, 이전 가격에 가까운 호스팅 비용을 유지할 방법을 여러 제공자와 테스트하고 있습니다.
- OpenCode Go
- — OpenCode가 운영하는 서비스로, DeepSeek 가격 변경에 맞춰 사용 한도를 갱신했습니다. 운영팀은 기존 가격에 가까운 제공 방식을 찾기 위해 여러 호스팅 구성을 시험하고 있습니다.
- 모델 호스팅(model hosting)
- — 모델을 외부 인프라에서 실행해 사용자 요청에 응답하도록 제공하는 방식입니다. 이 사례에서는 제공자별 구성의 비용과 실제 가격 유지 가능성을 비교하는 테스트가 진행되고 있습니다.
AI 요약 · 북마크 · 개인 피드 설정 — 무료
출처 · 인용 안내
인용 시 "요약 출처: AI Trends (aitrends.kr)"를 표기하고, 사실 확인은 원문 보기 기준으로 진행해 주세요. 자세한 기준은 운영 정책을 참고해 주세요.

