요약은 생성됐지만 현재 화면 버전과 데이터 형식이 맞지 않아 렌더링할 수 없습니다.
출처 · 인용 안내
인용 시 "요약 출처: AI Trends (aitrends.kr)"를 표기하고, 사실 확인은 원문 보기 기준으로 진행해 주세요. 자세한 기준은 운영 정책을 참고해 주세요.
요약은 생성됐지만 현재 화면 버전과 데이터 형식이 맞지 않아 렌더링할 수 없습니다.
출처 · 인용 안내
인용 시 "요약 출처: AI Trends (aitrends.kr)"를 표기하고, 사실 확인은 원문 보기 기준으로 진행해 주세요. 자세한 기준은 운영 정책을 참고해 주세요.
아직 관련 토론이 없습니다.
댓글을 작성하려면 로그인이 필요합니다.
이번 기간에는 GLM-5.3 무료 token 배포와 Qwen3.8-27B의 로컬 실행·다운로드 증가가 공개형 모델 활용의 확산으로 묶였다. Agent는 단순한 모델 선택보다 model·harness·context의 소유권, portable memory, evals와 observability를 갖춘 실행 구조가 핵심이라는 관점이 부상했다. GPU 성능은 연산 유닛 수보다 HBM 왕복과 memory bandwidth에 좌우되며, BenchDrift와 ArchAgent v2는 benchmark 문구 민감도와 하드웨어 설계 탐색을 각각 측정·자동화했다. Anthropic의 Watermarking 도입과 Ollama 기반 문체 변환기는 생성물 식별과 가독성 조정이 inference 단계의 별도 처리로 이동하고 있음을 보여줬다.
이번 기간에는 Qwen3.8 계열을 중심으로 12GB·24GB급 로컬 하드웨어에서 추론, 보안 연구, 코드 생성과 에이전트 실행을 시도하는 사례가 이어졌습니다. 에이전트 쪽에서는 Sol과 Luna의 모델 위임, Hermes Bot Mode, sandbox·channel·middleware·evals 같은 실행 구성요소, DeepSeek Harness의 급격한 GitHub 성장과 같은 흐름이 함께 나타났습니다. 추론 단계에서는 Chain of Thought부터 MCTS까지 후보 생성과 선택을 조합하는 8가지 방법이 정리됐고, 선택기의 검증 신호가 탐색 규모보다 먼저 갖춰져야 한다는 결론이 나왔습니다. Watermarking은 EU AI Act 준수와 편집을 통한 제거 가능성, 코드 출력 영향이 쟁점이 됐으며, ExtractBench는 복잡한 기업 문서 추출에서 상용 VLM의 누락·환각 문제를 측정하는 benchmark로 제시됐습니다.
이번 포스트 묶음에서는 모델 자체의 규모보다 추론 효율과 운영 구조를 조정하는 흐름이 두드러졌습니다. DeepSeek-V4-Flash는 Snowflake 내부 ADE Bench에서 74.4%를 기록했고, 별도 게시물에서는 11× 낮은 비용과 자기검증에 따른 79%에서 88%의 정확도 상승이 거론됐습니다. 에이전트 개발은 코드 작성 이후의 배포, 권한 제어, 평가, 공개까지 자연어로 묶는 단계로 이동했으며, 문서 기반 에이전트에는 답변과 원문 위치를 함께 반환하는 visual grounding이 핵심 평가 항목으로 등장했습니다. 동시에 LLM 워터마킹은 출력 문자열을 직접 고치는 방식이 아니라 샘플링 분포의 무작위성을 조정하는 방식이라는 설명이 이어졌습니다. Hugging Face의 300만 모델 돌파와 공개 재현 작업은 모델·데이터셋·실험 결과를 공개적으로 축적하는 생태계의 확장을 나타냈습니다.
이번 기간에는 LLM 생성 설정을 토큰 샘플링, 반복 억제, 종료 제어로 나눠 이해하는 글과, GPU 성능보다 요청 경로와 추론 배치가 첫 토큰 지연을 좌우한다는 사례가 함께 나왔다. 벡터 검색에서는 ACORN이 검색 시점에 필터 단절을 우회하는 반면 Filterable HNSW는 인덱스에 조건별 연결을 추가하며, 1% 필터·100만 벡터 조건에서 각각 67.7%와 99.8% recall이 기록됐다. Alibaba Cloud의 ANOLISA는 운영체제 프록시에서 도구 출력을 정리하고 JSON을 표 형식으로 압축해 Agent의 문맥 효율을 높이는 구조를 공개했다. Kimi Work의 금융 분석 workflow와 Hyra의 수학 난제 결과는 LLM·Agent 활용 범위가 업무 자동화와 연구 계산으로 넓어지는 흐름을 담았다.
이번 기간에는 Qwen3.8의 open weights 공개가 27B 로컬 모델과 2.4T MoE 모델을 여러 추론 서비스로 동시에 확산시키며 가장 많은 포스트를 모았습니다. Qwen3.8-27B는 17GB RAM 실행, 단일 GPU 서빙, 1M context 확장과 함께 vLLM·SGLang·Unsloth 연동으로 배포 경로를 넓혔고, Qwen3.8-2.4T-A95B는 Fireworks·Together AI·DeepInfra 등에서 에이전트와 장시간 코딩용으로 제공됐습니다. Cursor의 SpaceX 편입은 소프트웨어 엔지니어링 도구를 Grok과 연결하고 지식 작업으로 확장하려는 구조 변화로 묶였습니다. 그 밖에 궤도 연산의 필요성, 웹 검색 도구 벤치마크, LLM 심판의 판정 안정성, Gemini watermark 제어가 실무 인프라와 평가 신뢰성의 쟁점으로 떠올랐습니다.