TL;DR
OpenAI는 'astra'의 일반 공개를 잠시 연기했으며, 모델의 'cyber capabilities' 때문에 추가 안전 심사가 필요하다고 알림. Anthropic 생태계에서는 Claude Code가 모델 훈련·입력 프로브·의도 분류기를 결합한 auto mode를 기본으로 도입해 간접 프롬프트 인젝션 성공률을 거의 '0.00%' 수준으로 낮췄고 Managed Agents는 세션 예산·리포지토리 기반 스킬 로드·어드바이저 호출을 더해 운영 제어를 강화함. OpenAI는 ChatGPT에 GPT 5.6(Sol/Luna)과 rich formatting, 빠른 Android 카메라, Voice x Files(GPT-Live) 등을 순차 배포해 모델 선택권과 사용성을 넓히고 있음.
𝕏 실시간 트렌드 토픽
🔥 OpenAI 'astra' 공개 연기 — 사이버 능력 점검포스트 3
OpenAI는 astra의 일반 공개 시점을 뒤로 미루고 모델의 'cyber capabilities'에 대한 추가 안전 점검을 진행하겠다고 트윗했으며, 동시에 '강력한 모델을 소수만 보유하는 전략은 바람직하지 않다'는 입장을 표명함.
- 문제: astra가 가진 사이버 관련 능력은 공개 시점과 범위를 결정할 때 위험 요소가 됨; 처리: OpenAI는 추가 내부 점검과 안전 확인을 거쳐 일반 공개 시점을 조정하겠다고 알렸음; 근거: 창업자 트윗과 OpenAI 계정의 동일한 메시지; 의미: 공개 보류는 오용 위험을 줄이고 배포 조건을 명확히 하는 의도.
- 정책적 쟁점: 한편으로는 'powerful models'를 일부만 소유하는 정책은 바람직하지 않다고 명시해 배포 접근성과 안전 사이의 균형 문제가 부각됨; 이것이 공개 시점 결정의 핵심 고려사항임.
모델의 사이버 관련 능력을 추가 점검해 배포 전 리스크를 낮추는 접근은 안전 확보라는 관점에서 타당하다.
'강력한 모델을 소수만 보유'하는 방식은 공평한 접근 관점에서 문제를 일으킬 수 있다는 입장이 병기되어 배포 지연만으로는 해결되지 않는 균형 문제가 존재한다.
원문 트윗 2개 보기
@sama
astra is a powerful model and we are working to make it generally available. we do not think it is a good strategy to keep powerful models to a chosen few. given its cyber capabilities, we need a little big longer to do do this safely. but hopefully not too long!

OpenAI
@OpenAI
astra is a powerful model and we are working to make it generally available. we do not think it is a good strategy to keep powerful models to a chosen few. given its cyber capabilities, we need a little big longer to do do this safely. but hopefully not too long!
📈 Claude Code·Managed Agents의 보안·운영 기능 강화포스트 11
Claude Code는 모델 훈련·입력 프로브·의도 분류기를 층으로 쌓는 방식을 통해 미지 공격에서 간접 프롬프트 인젝션 성공률을 거의 '0.00%'로 낮출 수 있다고 보고했고, Managed Agents는 세션 예산, 리포지토리 기반 스킬 자동 로드, 어드바이저 모델 호출 등 운영 제어를 추가해 예측성과 확장성을 높였음.
- 문제: 브라우저·도구 호출 기반 공격은 모델이 외부 지시를 따르게 만드는 프롬프트 인젝션 위험을 만든다; 처리: Claude Code의 auto mode는 모델 훈련 단계·입력 프로브·의도 분류기를 결합해 입력에서 의도를 판별하고 연속 블록에서 거부된 동작은 건너뛰도록 설계함; 근거: Boris Cherny의 설명과 Claude Code 관련 블로그 링크; 의미: 다층 방어는 미지의 공격률을 현실적으로 낮출 수 있음.
- 운영 개선: Managed Agents는 세션에 예산을 설정하면 예산 도달 시 세션을 일시정지(budget_reached 이벤트)하고 예산 상향으로 재개 가능하며, .claude/skills/에 저장된 스킬을 시작 시 자동 로드하고 한 줄로 어드바이저를 등록하면 mid-session에 강한 모델을 호출해 두 번째 의견을 얻을 수 있음; 근거: 제품 계정의 기능 안내 트윗; 의미: 운영 측면에서 비용 통제·확장성·외부 검토 통합이 쉬워짐.
- 릴리스·체인지로그: Claude Code의 CLI·버전 업데이트는 편집 도구의 정확한 문자열 대체, 게이트웨이 사용 한도 표시 등 실사용 안전성과 투명성 개선을 포함함; 근거: Claude Code changelog 및 GitHub 메타데이터.
모델 훈련·입력 프로브·의도 분류기를 결합한 다층 방어는 미지 공격에 대한 프롬프트 인젝션 성공률을 크게 낮출 수 있다는 실무적 근거가 제시되었다.
세션 예산·스킬 자동 로드·어드바이저 호출 같은 운영 기능은 엔터프라이즈 환경에서 예측 가능한 비용 관리와 확장성 확보에 기여한다.
원문 트윗 2개 보기
Boris Cherny
@bcherny
turns out you can get indirect prompt injection to ~0 on unseen attacks if you stack enough layers (model training + input probes + a classifier checking intent). didn't expect that a year ago. auto mode is default in claude code as of next week https:// claude.com/blog/auto-mode -default-in-claude-code …

ClaudeDevs
@ClaudeDevs
We shipped four updates to Claude Managed Agents this week. First, you can now set a budget for sessions to keep spend predictable. Sessions that hit the limit pause with a budget_reached event, you can raise the budget to resume.
➖ ChatGPT 기능 업데이트와 GPT 5.6 라인업포스트 2
ChatGPT 팀은 rich formatting, 유료 사용자를 위한 GPT 5.6 Sol(사유의 사고 강도 슬라이더 포함), 무료 사용자용 GPT 5.6 Luna의 무제한 문자, 빠른 Android 카메라, Voice x Files(GPT-Live 기반) 등 사용성·접근성을 넓히는 기능을 배포하고 있다고 알림.
- 문제·처리·증거: 이메일·문서 복사·붙여넣기 시 서식을 유지하는 웹 컴포저를 도입해 복사·붙여넣기 흐름에서 형식 손실을 줄였고, 유료 사용자는 GPT 5.6 Sol과 사고 강도(slider)를 통해 응답의 '깊이'를 조절할 수 있게 되었음; 근거: ChatGPT 팀의 기능 공지 트윗.
- 접근성 변화: 무료 사용자에게는 GPT 5.6 Luna가 무제한 문자로 제공되고, 모바일에서 카메라 호출 속도를 개선했으며 Voice x Files는 GPT-Live로 파일 업로드-질의 워크플로를 연결해 음성 기반 상호작용 범위를 확장함; 의미: 모델 선택권과 인터랙션 방식이 다양해져 사용자 경험이 달라질 수 있음.
모델 선택권과 UI 개선은 빠른 작업과 심층 추론을 일관되게 지원하도록 사용자 경험을 조정하는 실무적 변화다.
무제한 문자 제공과 새로운 입력 모드는 접근성을 높이지만 실제 비용·정책 영향은 사용량과 배포 범위에 따라 달라질 수 있다.
📈 Action chunking의 효과와 기전포스트 1
최근 논문은 Action chunking이 대규모 imitation learning에서 필수적이라는 관찰을 바탕으로 그 효과의 원인을 해체하려는 목적을 제시함.
- 문제: 현대 대규모 모방학습에서 action chunking이 없으면 학습이 제대로 작동하지 않는 사례가 많음; 처리: 새 연구는 왜 청킹이 효과적인지 여러 원인을 분해해 실험적으로 검증하려고 함; 근거: 연구자 트윗과 연계된 논문 페이지 링크; 의미: 로봇 제어 같은 분야에서 정책 설계와 데이터 준비가 달라질 수 있음.
Action chunking의 중요성은 경험적으로 반복 관찰되며, 해당 논문은 그 기전을 규명해 응용 설계에 근거를 제공하려 한다.
용어 해설
- 액션 청킹(Action chunking)
- — 연속 행동을 여러 '청크'로 묶어 imitation learning의 학습 안정성과 일반화를 높이는 기법으로, 원-프레임 행동 시퀀스를 청크 단위로 압축·모델링해 정책이 더 안정적인 제어 신호를 출력하도록 만든다.
- 프롬프트 인젝션(Prompt injection)
- — 입력 텍스트에 숨겨진 지시나 악성 패턴을 넣어 모델이 원치 않는 동작을 하게 만드는 공격 유형으로, 입력(공격 문장)→모델 처리(추론)→출력(의도 외 응답) 흐름에서 필터링·의도 분류·훈련 보강 같은 다층 방어를 적용한다.
- Auto mode(Claude Code)(Auto mode)
- — Claude Code의 동작 모드로, 모델 훈련·입력 프로브·의도 분류기를 결합해 연속된 블록에서 안전 필터 거부를 건너뛰며 다음 동작으로 이동하도록 설계되어 미지의 브라우저·도구 공격에 대한 성공률을 낮추는 목적을 가진다.
- Managed Agents
- — 에이전트 운영 환경에서 세션 예산 제한, 리포지토리 기반 스킬 자동 로드, 외부 모델 호출 같은 관리를 통해 세션 예측성과 확장성을 확보하는 운영 패턴으로, 시작 시 스킬을 로드하고 예산에 도달하면 세션을 일시정지하는 흐름을 사용한다.
- 어드바이저 모델(Advisor)
- — 실행 중인 에이전트가 복잡한 판단이나 재확인이 필요할 때 mid-session으로 호출하는 더 강한 모델로, 로스터에 한 줄만 추가하면 해당 에이전트를 보조해 두 번째 의견을 제공하는 역할을 한다.
AI 요약 · 북마크 · 개인 피드 설정 — 무료
출처 · 인용 안내
인용 시 "요약 출처: AI Trends (aitrends.kr)"를 표기하고, 사실 확인은 원문 보기 기준으로 진행해 주세요. 자세한 기준은 운영 정책을 참고해 주세요.
