Simple Strands Agent로 의도-실행 간극 축소와 벤치 성능 향상
Amazon 연구진이 Simple Strands Agent(SSA)라는 경량 하니스를 통해 편집 앵커, diff 피드백, 도구-추론 균형 등 설계 원칙을 적용하여 여러 에이전트 벤치마크에서 일관된 성능 개선을 확인했다.
Amazon Science Blog에서 수집한 AI/ML 콘텐츠를 모아볼 수 있는 전용 피드입니다.
Amazon 연구진이 Simple Strands Agent(SSA)라는 경량 하니스를 통해 편집 앵커, diff 피드백, 도구-추론 균형 등 설계 원칙을 적용하여 여러 에이전트 벤치마크에서 일관된 성능 개선을 확인했다.
Guess2Graph는 전문가 추측을 통계적 검정의 순서 유도로 활용해 검정을 대체하지 않으면서 일관성을 유지하고, PC-Guess와 gPC-Guess 변형으로 유한 표본 상황에서 전문가 정확도에 따라 점진적 이득을 확보한다.
AWS와 Johns Hopkins Gray Lab이 실험 검증된 50개 시드 항체와 4가지 구조 형식을 포함한 대규모 항체 개발 적합성 데이터셋과 벤치마크를 공개하여 AI 기반 항체 설계 모델의 제로샷 성능을 투명하게 비교할 수 있게 했다.
물리법칙 통합, 불확실성 보정, 시뮬레이터 기반 증류 및 형식 검증을 결합해 에이전트형 AI의 실제 환경 신뢰성과 정확도를 개선했다.
Turnstile은 에이전트 하네스와 추론 백엔드 사이에 위치해 모델이 실제 생성한 토큰 IDs, per-token logprob, 손실 마스크, MoE 라우팅 및 처리된 이미지 피처를 실시간으로 기록하여 RL 트레이닝에 정확한 롤아웃 데이터를 제공하는 Rust 기반 프록시이다.
HydroShear는 하이드로엘라스틱 접촉 모델에 경로 의존적 힘 추적을 도입해 GelSight Mini 센서 기반 촉각 전단을 정밀히 재현함으로써 시뮬레이션에서 학습한 강화학습 정책을 Franka 로봇에 무수정 전이해 네 가지 과제 평균 성공률 93%를 달성했다.
Graviton5는 4칩렛·192코어와 칩렛 간 420GB/s 링크, DDR5-8800·PCIe gen6·3nm 공정을 통해 Graviton4 대비 평균 25% 성능 향상을 제공한다.
저자들은 LLM 기반 에이전트를 활용해 하이레벨 스케치로부터 형식적 증명 초안을 빠르게 생성하고 수정해 50페이지 논문을 3주 만에 작성했으나 생성물의 약 25%는 오류를 포함해 검증과 교육·심사 제도의 재설계가 필요하다고 밝혔다.
Q-Synth 모듈로 중간층에 텍스트 조건화된 그라운딩 쿼리를 합성하고 경량 Attention-to-Point Decoder로 어텐션 패턴을 포인트 히트맵으로 변환해 파트 수준 그라운딩 성능을 향상시켰다.
자연어 질의를 시간적 이해, 추론 유형, 시간 민감도, 트렌드성의 네 차원으로 분류해 QA·IR 시스템의 시간 관련 실패 모드를 드러냈다.
에이전트 기반 파이프라인이 Claude Sonnet 4를 사용해 SEG-Y 파일의 메타데이터를 자동 복원·표준화하여 MDIO v1.0으로 변환하며 템플릿 분류 95%, 필드 추출 99.17%, 엔드투엔드 96.83%의 성능을 보고했다.