섹션별 상세
기술
- DFlash
- TileRT
- VLM
- LLM
활용 사례
- AI 안전성 검증
- 코드 품질 평가
- 과학 연구 자동화
언급된 리소스
AI 요약 · 북마크 · 개인 피드 설정 — 무료
출처 · 인용 안내
인용 시 "요약 출처: AI Trends (aitrends.kr)"를 표기하고, 사실 확인은 원문 보기 기준으로 진행해 주세요. 자세한 기준은 운영 정책을 참고해 주세요.
AI 안전 연구 스타트업 Sequent의 출범과 함께, 새로운 코딩 벤치마크 FrontierCode, 문화적 이해도를 측정하는 ChinaHeritaQA, Xiaomi의 초고속 1T 모델이 공개됐다.
AI 요약 · 북마크 · 개인 피드 설정 — 무료
출처 · 인용 안내
인용 시 "요약 출처: AI Trends (aitrends.kr)"를 표기하고, 사실 확인은 원문 보기 기준으로 진행해 주세요. 자세한 기준은 운영 정책을 참고해 주세요.
아직 관련 토론이 없습니다.
댓글을 작성하려면 로그인이 필요합니다.
Grok 4.6이 낮은 비용과 에이전트 성능으로 frontier 경쟁에 합류했다
AI 에이전트 침투와 모델 경쟁이 안전 통제의 한계를 드러냈습니다.
이번 포스트 묶음에서는 모델 자체의 규모보다 추론 효율과 운영 구조를 조정하는 흐름이 두드러졌습니다. DeepSeek-V4-Flash는 Snowflake 내부 ADE Bench에서 74.4%를 기록했고, 별도 게시물에서는 11× 낮은 비용과 자기검증에 따른 79%에서 88%의 정확도 상승이 거론됐습니다. 에이전트 개발은 코드 작성 이후의 배포, 권한 제어, 평가, 공개까지 자연어로 묶는 단계로 이동했으며, 문서 기반 에이전트에는 답변과 원문 위치를 함께 반환하는 visual grounding이 핵심 평가 항목으로 등장했습니다. 동시에 LLM 워터마킹은 출력 문자열을 직접 고치는 방식이 아니라 샘플링 분포의 무작위성을 조정하는 방식이라는 설명이 이어졌습니다. Hugging Face의 300만 모델 돌파와 공개 재현 작업은 모델·데이터셋·실험 결과를 공개적으로 축적하는 생태계의 확장을 나타냈습니다.
이번 포스트에서는 로그인된 브라우저와 cloud browser를 통해 예약·구매 같은 웹 작업을 끝까지 수행하는 에이전트 기능이 가장 큰 반응을 얻었다. 과학 영역에서는 Terminal-Bench-Science가 연구 workflow 평가를 70개 task로 확장했고, Claude Team for scientists와 Model Hardware Standard가 연구자·물리 장비로 적용 범위를 넓혔다. MiniMax H3-Max는 독립 평가에서 영상 품질·prompt understanding·aesthetics 1위를 내세우면서 5초 720p 생성을 3보다 짧은 시간에 처리한다고 발표됐다. AgentX, GLM 5.3 Flash, DeepSeek V4 Flash처럼 에이전트형 추론과 모델 성능·비용을 함께 재는 흐름도 이어졌다.
이번 기간에는 PyTorch를 중심으로 분산 학습, GPU 풀링, Kubernetes 기반 추론을 여러 계층에서 연결하는 오픈소스 인프라 흐름이 이어졌습니다. 에이전트 쪽에서는 제한된 프롬프트 예산에 맞춘 메모리 병합·검색 방식과 prompt injection 방어 계층이 구체적인 수치와 함께 공유됐습니다. Perplexity Search의 Hermes 연결, GLM 5.3 Flash의 에이전트 자동화 성능과 저비용 서버리스 추론도 새 기능과 실행 환경의 변화로 묶였습니다. 한편 Astra와 Muse에서는 초기 사용량이 예상치를 크게 웃돌았고, AI가 보안 공격과 인간의 장기적 안전에 미치는 영향에 대한 경계도 함께 나타났습니다.