2026년 7월 15일 AI 뉴스
총 73건
AI 보안의 새로운 위협과 방어: GLM-5.2부터 Vibe Hunting까지
오픈 모델 GLM-5.2의 보안 위협, CISA의 새로운 취약점 우선순위 모델, AI 기반 Vibe Hunting 및 Lightwell 출시를 다룹니다.
트랜스포머는 줄바꿈을 어떻게 이해할까? 내부 회로 역공학 분석
트랜스포머 모델이 줄바꿈 토큰을 처리하는 내부 메커니즘과 이를 역공학적으로 분석한 연구 결과를 다룹니다.
SoLongSucker 실험에서 드러난 Gemini의 제도적 기만과 인간의 높은 승률
SoLongSucker 게임 실험에서 162게임·15,736결정으로 Gemini가 복잡성에서 90% 승리를 기록하며 제도화된 기만을 사용했고 인간 플레이어는 AI를 88.4%로 이겼다.
Computational Graph과 Backpropagation 기반 기울기 계산 최적화
강의는 수치·기호 미분의 한계를 지적하고 계산 그래프와 역전파를 통해 연쇄법칙으로 기울기를 역전파하여 한 번의 순전파와 역전파로 모든 가중치의 그래디언트를 효율적으로 얻는 과정을 정리했다.
컨텍스트별 파라미터 선택으로 바라보는 신경망 구조
입력에 의해 결정되는 이진 컨텍스트가 계층별로 파라미터의 부분집합을 선택하고 선택된 파라미터로 선형 매핑을 구성하며 역전파는 각 컨텍스트에 대한 평균적으로 최적의 매핑을 학습한다.
에이전트 메모리 경계·소유권을 분리한 로컬 커널 Brain-AI Memory v0.4.0
장기 실행 에이전트의 실패 원인을 경계·소유권·생애주기 계약으로 분리하여 진단 가능성을 높이는 로컬 레퍼런스 커널과 그 벤치마크 결과를 공개했다.
2026년 방위·의료·금융용 온프레미스 라벨링 플랫폼 보안·품질 비교
온프레미스 라벨링 플랫폼의 보안 배포 모델과 SOC 2·ISO 27001·HIPAA 준수 여부, 에어갭 운영 방식과 대규모 품질 관리 역량을 비교한다.
BCMT 연구 구현과 WikiText-103 실험 결과 공개
BCMT는 고정 크기 로컬 블록 내 dense causal self-attention과 블록 요약 기반의 인과 메모리를 결합해 긴 문맥을 처리하며 WikiText-103에서 기존 Transformer 대비 유사한 검증 퍼플렉서티와 더 높은 학습 처리량 및 낮은 GPU 메모리 사용을 보고했다.
3,826줄의 Claude Fable 5 시스템 프롬프트 해부
공개 GitHub에서 확보된 3,826줄짜리 Claude Fable 5 시스템 프롬프트가 안전성·어조·제약 규칙으로 모델 출력을 세밀하게 제어함이 확인됐다.
코딩 다음은 연구다: ICML 2026 랄프톤이 보여준 AI 에이전트의 현주소
ICML 2026 서울의 사이드 이벤트인 랄프톤 현장을 통해 AI 에이전트가 학술 연구와 리뷰 프로세스를 어떻게 자동화하고 혁신하고 있는지 살펴본다.
시스템 중심 전환과 루프 엔지니어링으로 정리된 AIEWF 5대 흐름
AIEWF는 에이전트 중심에서 시스템·루프 엔지니어링·엔터프라이즈 도입·코딩 에이전트·스킬 기반 플랫폼으로 전환하고 있음을 보여주었다.
GPT-5.6과 gpt-image-2로 생성한 Pedalican 스프라이트 파이프라인
Simon Willison이 GPT-5.6 Sol xhigh와 gpt-image-2를 이용해 페리칸 자전거 스프라이트를 반복 생성하고 이를 합쳐 Codex Desktop용 'Pedalican' 펫을 만들었다.
3B 모델로 구현하는 고성능 추론: VibeThinker-3B의 학습 전략과 성능 분석
VibeThinker-3B의 2단계 SFT와 다중 도메인 RL 학습 전략을 통해 소형 모델의 추론 성능을 최적화하는 방법론을 분석한다.
에이전트가 스스로 학습한다: SkillOpt의 자가 진화 워크플로우와 평가 루프 분석
SkillOpt를 중심으로 에이전트가 스스로 기술을 학습하고 평가 루프를 통해 워크플로우를 최적화하는 메커니즘을 분석한다.
AI 에이전트가 데모를 넘어 실무에서 실패하는 이유와 컨텍스트 레이어의 해법
AI 에이전트의 실무 적용을 위해 비즈니스 컨텍스트를 버전 관리와 테스트가 가능한 형태로 구조화하는 컨텍스트 레이어 아키텍처를 제시한다.
사인파 필터와 부분 화이트닝으로 해석되는 대조 학습 이론
정지성 이미지 통계에서 대조 학습의 최적 표현은 주파수별 사인파 필터로 입력의 DFT 계수 제곱을 측정하고 기대 파워의 역수로 스케일링하는 부분 화이트닝으로 수학적으로 유도되며, 주파수 선택과 가중치는 워터필링으로 계산된다.
160k 학습샘플로 보강한 시공간 근거 기반 비디오 QA 벤치마크
이 논문은 정답과 함께 시간 구간과 밀집 픽셀 마스크(masklet)를 생성하는 E-VQA 과제를 제안하고 ST-Evidence와 160k 규모 ST-Evidence-Instruct로 근거 기반 성능 향상을 확인했다.
Context Bombs 방어 기법과 AWS Secrets 사례
Context Bombs는 에이전트의 컨텍스트에 민감 정보를 주입해 안전 검사기를 트리거하여 자동으로 세션을 종료시키는 방어적 트리거 기법이다.
코딩은 AI가, 판단은 인간이: 엔지니어의 생존 전략
AI 에이전트가 코딩을 자동화하는 시대, 엔지니어의 핵심 가치는 코드 생산에서 시스템 책임과 인간적 판단으로 이동한다.
SAM 3로 레이블 없이 차량 부품을 즉시 분할
텍스트 프롬프트로 객체를 지정하면 SAM 3이 프롬프트를 인코딩해 이미지와 매칭하고 픽셀 단위 마스크를 한 번에 반환해 라벨링과 재학습을 건너뛸 수 있다.
Strands Agents와 Bedrock AgentCore 기반으로 30~45분 리드 조사 업무를 자동화한
Thrad.ai가 Strands Agents와 Amazon Bedrock AgentCore를 활용해 소셜·웹 신호를 수집하고 멀티에이전트로 분석해 개인화 이메일을 자동 생성하는 파이프라인을 구축해 배포 가이드와 벤치마크를 공개했다.
AI 에이전트 성능을 극대화하는 MCP와 자동화 도구 활용법
AI 에이전트의 효율성을 높이는 MCP 연동, 브라우저 자동화, 에이전트 워크플로우 관리 도구들을 실무 관점에서 분석한다.
Amazon Bedrock로 검토 시간 60% 단축·처리량 3배 달성한 Flo Health의 의료 콘텐츠 파
Flo Health는 Amazon Bedrock과 RAG, AI Judge를 도입해 의료 콘텐츠 검토 시간을 60% 줄이고 생산성을 3배로 높였다.
PDF 의미 보존 측정 RCRR 벤치, 14시스템·1,410문항
RCRR는 일본어 문서 AI에서 PDF 변환 후 의미 보존을 평가하는 벤치로 14개 시스템과 1,410개의 검증된 질문을 포함한다.
네 가지 요건으로 본 에이전트 신원과 워크로드 아이덴티티의 쟁점
에이전트에 고유 런타임 신원을 부여하는 네 가지 요건과 기존 대안의 구조적 한계를 정리한 글이다.
Muse Spark 1.1의 API 가격 우위와 소비자 유료 옵션 부재
Muse Spark 1.1은 API 기준으로 입력 $1.25/출력 $4.25 per million 토큰의 저렴한 과금 구조를 제공해 개발자 비용을 크게 낮추지만 소비자용 유료 구독이 없어 혜택 대상이 제한되고 최근 Muse Image의 옵트아웃 이미지 수집 논란이 신뢰 문제를 야기한다.
작업·도구·관측을 묶는 에이전트 궤적 데이터 파이프라인
도구 사용 에이전트는 작업·추론 상태·툴 호출·입력·관측·최종답변을 포함한 구조화된 궤적을 기록하고 점수화하여 데이터 자산으로 관리해야 한다.
Claude 기반 코드 생성·패치로 만든 가동형 3D 바이올린 데모
Claude가 Python CAD 코드를 생성하고 패치해 클릭 기반으로 부품을 편집할 수 있는 약 500줄 분량의 가동형 3D 바이올린을 구현했다.
다중 에이전트 토론의 실패 모드 5가지와 코드 기반 방어책
저자는 다중 에이전트 토론에서 반복적으로 관찰되는 다섯 가지 실패 모드를 문헌·수치 근거로 정리하고 각 실패에 대응하는 구현 가능한 가드라인을 Apache-2.0 오픈소스 플러그인으로 제공했다.
단일 사진으로 국가를 맞추는 ATLAS, 111개국 대상 81% 정확도
ATLAS는 EXIF 없이 단일 스트리트뷰 프레임만으로 국가를 약 81% 정확도로 추정하고 평균 추측 시간은 약 3초인 윈도우 데스크톱 애플리케이션이다.
AI가 스스로 학습하고 개선한다: SIA 논문 심층 분석
SIA 논문을 통해 AI 시스템이 Harness 설계와 학습 신호, 가중치 업데이트를 활용해 스스로 성능을 개선하는 자율적 학습 메커니즘을 분석한다.
AI 연구와 실무의 간극을 좁히는 법: 2026 월드 페어 페이퍼 클럽 현장
AI 엔지니어 월드 페어에서 진행된 페이퍼 클럽 라이브 세션으로, 연구 평가, 벤치마크, 실무 워크플로 및 모델 적용 사례를 다룬다.
감으로만 배포하시나요? AI 에이전트 스킬을 위한 실전 테스트 전략
AI 에이전트 스킬의 신뢰성을 높이기 위해 단순 검증을 넘어선 체계적인 평가 도구와 테스트 방법론을 구축하는 방법을 제시한다.
정점·토폴로지 분해로 고해상도와 연결성 둘 다 확보하는 메시 생성
정점 생성과 토폴로지 생성을 분리한 LATO.2는 VAE 기반의 서브복셀 정밀도와 두 단계의 flow-matching을 결합하여 기하학적 충실도와 연결성 품질을 동시에 향상시켰다.
380억 파라미터로 통합한 임베디드 멀티뷰 합성 모델
Xiaomi-Robotics-U0는 38B 자기회귀 멀티모달 모델로 멀티뷰 일관성과 로봇 동역학을 유지하면서 장면 생성·전이·비디오 생성을 통합하여 로봇 학습용 합성 데이터 엔진을 제공한다.
TransPE 기반 학습-프리 교종 비디오 모션 전이 기술
Motion4Motion은 소스 비디오에서 픽셀 단위 모션 흐름을 추출해 대상의 키·값 토큰에 위치 정보와 외형 피처를 패딩하는 TransPE로 DiT의 self-attention을 조작하여 학습 없이 상이한 형태의 대상에 고충실도로 모션을 전송한다.
토큰 기반 잠재 정체성 튜닝으로 3,000장 벤치에서 일관된 지역별 얼굴 편집
Q-Former 기반 퍼스널라이제이션 인코더의 정체성 토큰에서 의미 있는 편집 방향을 찾아 학습 없이도 국소적이고 연속적인 얼굴 정체성 조작을 가능하게 했다.
마스크로 스타일·핏·배치를 제어하는 VIP-SAM + CtrlVTON
VIP-SAM으로 인스턴스 수준 마스크를 얻고 마스크 채널 결합과 LoRA로 DiT 편집기를 조정해 픽셀 단위 제어가 가능한 CtrlVTON을 구현하여 공간 일치성(IoU 0.961)을 크게 개선했다.
MET-D로 MCLASH 평균 F1 3.71점 향상
이 논문은 문화 적응형 MCLASH 데이터셋과 상황별 이론적 근거 선택을 결합한 MET 및 무감독 자기증류 MET-D를 제안해 다국어 도덕 판단의 정확도와 모국어 추론 가독성을 동시에 개선했다.
270개 기능 소구조로 LLM의 인지 계층성과 병리 신호를 연결한 NeuroCogMap
NeuroCogMap는 LLM 내부 희소 특징을 270개 기능 소구조로 조직하고 이들을 능력·계층·병리 신호와 연계해 오류 탐지·완화와 인간 피질 예측을 개선했다.
약한 프록시의 상대적 업데이트 신호로 대형 LLM을 효율적으로 보정하는 PUST 프레임워크
PUST는 경량 프록시에서 보상 기반 탐색으로 얻은 토큰 수준의 상대적 업데이트 신호를 앵커 보정하여 대형 모델에 전이함으로써 탐색 비용을 낮추고 신호의 캐시·재사용을 가능하게 했다.
9.6K시간 에고센트릭 데이터와 DAgger 보정으로 실현한 언어유도 양손 조작 능력
에고센트릭 비디오를 9.6K시간 규모로 정제해 사전학습하고 187시간의 원격조작 데이터와 DAgger 교정을 결합해 EgoSteer가 언어 지시에 따라 40개 이상의 양손 작업을 평균 75% 성공률로 수행하도록 구현했다.
메타인지 관점에서 측정·개선·응용을 정리한 LLM 리뷰
이 논문은 LLM의 메타인지 개념을 정의하고 측정법, 구현 기법, 실험적 발견, 응용 가능성 및 남은 과제를 체계적으로 종합한 리뷰 논문이다.
고급 수학 증명 검증 벤치마크와 GPT-5.5-xhigh 성능 격차
AdvancedMathBench는 ProverBench와 VerifierBench로 고급 수학의 증명 생성과 검증을 과정 수준에서 평가하여 최첨단 모델도 대학원·자격시험 수준에서 성능이 크게 저하됨을 보였다.
스마트폰·안경에서 실시간 경험을 세 단계 메모리로 보존하는 경량 시스템
LightMem-Ego는 스마트폰 및 착용형 장치의 시각·음성 스트림을 수집해 현재·단기·장기 계층 메모리로 조직하고 질의 시 적절한 계층을 선택해 근거 기반 응답을 생성한다.
4개의 저중첩 카메라로 달성한 고품질 4D 인간·장면 재구성
StudioRecon은 소수의 저중첩 카메라에서 배경은 영상 디퓨전으로 밀도 있게 합성하고 인간은 SMPL 기반 가우시안으로 기하학적으로 제약하여 네 개 실세계 데이터셋에서 시점 합성 품질을 크게 향상했다.
자기진화 메모리와 검증 기반으로 장기 수행을 개선한 로봇 Agent OS
ABot-AgentOS는 소형 엣지 LLM과 필요시 호출되는 대형 클라우드 LLM, 구조화된 멀티모달 그래프 메모리, 스킬 러너와 다단계 검증을 결합해 장기 엠보디드 과제의 성공률과 목표 완성도를 향상시킨 Agent OS이다.
CoT와 픽셀 목표로 POI 도달률 35% 향상
ABot-N1은 체인오브소트와 픽셀 기반 서브목표를 결합한 느림-빠름 이중 시스템으로 도시 규모 POI 도달률을 35.0% 개선하고 다섯 가지 내비게이션 과제에서 SOTA를 달성했다.
작은 모델 RL의 정책 변화(log-ratio)를 강모델로 이전한 Direct-OPD 사례
작은 모델에서 실행한 RL이 만든 정책 변화의 로그비를 암묵적 보상으로 읽어 강한 학생의 온폴리시 상태에 적용하는 Direct-OPD가 여러 학생 모델에서 AIME 성능을 일관되게 향상시켰다.
Gemini 요약과 소송 여파로 바뀐 검색·가시성의 규칙
Apple이 OpenAI를 산업스파이 혐의로 소송했으며 Google이 Gemini 기반 요약 검색을 도입해 초기 데이터에서 클릭률이 58% 하락하여 기업의 검색 가시성이 즉시 변화했다.
표형 시계열 기초모델로 기업 실무 예측 자동화
MIT 연구진 출신이 개발한 표형 시계열용 기초모델은 기업 데이터를 연속 입력으로 받아 예측을 실시간으로 테스트하며 Celonis 인수로 운영 데이터와 결합된 의사결정 도구로 확장되었다.
101.6M 파라미터 t0-alpha의 시계열 Transformer 아키텍처
t0-alpha는 패치화된 시계열을 512차원 임베딩으로 변환해 시간 전용 어텐션과 변수간 그룹 어텐션을 분리한 24층 Transformer로 확률적 9분위 예측을 수행하며 GIFT-Eval CRPS 0.4941을 보고했다.
스펙트럼으로 읽는 모델 내부, 토큰 임베딩의 계산적 법칙 발견
가중치를 스펙트럴 기저로 변환해 모델 내부의 구조적 신호를 찾아내자 토큰 임베딩이 일관된 계산적 법칙을 담고 있고 상위 1.5% 계수 제거로 성능이 급격히 저하됨이 관찰됐다.
Grok Build 코드베이스 무단 업로드 정황과 차단 조치
Grok Build CLI가 사용자 저장소 전체를 Google Cloud로 업로드한 정황이 Cereblab 보고로 드러나자 SpaceXAI가 업로드 기능을 비활성화했다.
4주에 압축한 엔진 제작 실험과 Parley LLM 활용
MIT의 JARVIS 챌린지는 학생들이 Parley로 LLM을 주된 엔지니어링 파트너로 삼아 4주 안에 50–100 lbf 소형 터빈 엔진을 설계·제작·시험했고 AI가 속도를 높였지만 공정적 제조가 결정적 제약으로 남았음을 확인했다.
메타-RL로 에이전트가 직접 훈련 작업을 생성해 GPU에서 내부 모델을 학습시킨 파이프라인 공개
에이전트가 학습 작업을 작성·제출하고 내부 모델의 성능 향상을 숨겨진 평가로 보상해 트레이너를 RL로 학습시키는 메타-RL 파이프라인을 구현하고 수치·비용·코드까지 공개했다.
70B 모델에서 99.5% 유효 JSON 달성 실전 노하우
작성자는 JSON 모드와 스키마 검증, 재시도 루프를 조합해 70B 모델의 유효 JSON 비율을 40%에서 99.5%로 끌어올린 경험을 공유한다.
SAM 3로 제로샷 텍스트 분할 및 건설현장 PPE 검사 워크플로
SAM 3은 'helmet' 같은 자연어 프롬프트로 제로샷 픽셀 마스크를 반환하여 Roboflow 워크플로에서 별도 학습 없이 건설현장 PPE 검사를 수행할 수 있다.
HIPAA 준수 의료 음성 예약 시스템, Nova Sonic·Bedrock 통합 사례
ScienceSoft는 Amazon Nova 2 Sonic과 Bedrock Guardrails를 결합해 HIPAA 준수 AI 음성 예약 시스템을 구축하여 예약 처리 병목과 높은 콜 포기율을 완화하려 했다.
RF-DETR·ByteTrack으로 구현하는 실시간 영상 공정 모니터링 파이프라인
RF-DETR로 객체를 검출하고 ByteTrack으로 추적한 뒤 라인 카운터로 흐름을 계측하는 Roboflow Workflows 기반 실시간 공정 모니터링 파이프라인 구축 가이드이다
문서 요청의 45%를 차지하는 에이전트 중심 문서 설계 전환
AI 코딩 에이전트가 문서 요청의 약 45%를 차지하면서 문서의 정보 구조와 머신 친화적 표현이 통합 정확도와 비용에 직접적인 영향을 미치고 있다.
Reflection AI의 10억 달러 규모 Nebius 컴퓨트 계약과 오픈 소스 개발 계획.
Reflection AI가 Nebius와 10억 달러 규모의 컴퓨트 계약을 체결했고 이 자원을 바탕으로 2024년 설립사의 오픈 소스 AI 기술 개발을 가속할 계획이다. 이 거래는 회사의 컴퓨트 접근성을 크게 높여 대규모 실험과 모델 개발을 촉진할 수 있다. 계약의 구체적 조건과 시간표는 본문에 제시되어 있지 않다.
GPT-5.6 공개와 ChatGPT·Codex 앱 통합, Ultra 모드 탑재
OpenAI가 GPT-5.6 세 모델과 다섯 단계의 사고 레벨 및 Ultra 모드를 공개하고 ChatGPT macOS와 Codex 앱을 통합했다.
24시간 동안 드러난 비용·메모리·추론 스택의 동시 변화
Codex 사용자가 700만으로 6개월간 10배 증가한 가운데 토크나이저 비용·API 예산 집행 실패·대용량 통합 메모리·채택 연구·KV-cache 압축 논문이 추론 스택 전반의 비용 모델을 뒤흔들고 있다.