본문으로 건너뛰기
Ben's Bites조회 1

에이전트 작업 세션 기록

스크린샷과 점진적 검증으로 에이전트에게 Chrome 확장 설치·테스트를 맡긴 경험담

이 요약은 AI가 원문을 분석해 생성했습니다. 정확한 내용은 원문 기준으로 확인하세요.

TL;DR

작성자는 Google Calendar에 드래그로 예약 슬롯을 만들면 자동으로 폼이 갱신되는 Chrome 확장을 에이전트에게 맡겨 개발·테스트한 경험을 기록했습니다. 에이전트는 스크린샷과 검색으로 초깃 컨텍스트를 수집했고 이 과정은 55초와 2회의 웹 검색으로 시작됐지만 반복 루프 중 컨텍스트가 약 250k 토큰 한도에서 세 번 압축되어 비효율이 발생했습니다. 문제 해결을 위해 작성자는 증거를 점진적으로 추가하고 화면 녹화와 Chrome 직접 제어를 결합했으며, 최종적으로 Sol의 High reasoning으로 전환해 13분 내에 동작하는 확장을 얻었습니다. 소결론으로는 초기 미니 플랜 검토, 엔드투엔드 설치·테스트 지시, 컨텍스트 보존 지침을 명확히 하는 것이 에이전트 작업의 시간과 토큰 낭비를 줄이는 핵심입니다.

섹션별 상세

작업 목표는 Google Calendar에서 위크뷰에 드래그로 예약 슬롯을 만들면 예약 폼이 자동으로 갱신되도록 하는 Chrome 확장을 만드는 것이었고, 작성자는 스크린샷과 짧은 프롬프트로 에이전트에게 작업을 맡겼습니다. 에이전트는 먼저 웹 검색 도구를 호출해 관련 정보를 모으고 컨텍스트 창에 읽은 웹사이트들을 누적했으며, 이 과정이 55초와 2회의 웹 검색으로 시작되었다는 점이 기록되어 있습니다. 이 사례는 에이전트에게 작업을 맡길 때 초기 입력(스크린샷·사용자 의도)과 도구 선택이 결과에 직접적 영향을 준다는 점을 보여줍니다.
근거
  • 초기 컨텍스트 수집은 55초와 2회의 웹 검색으로 이루어졌다. 본문: 'For my fantastic prompt, 55 seconds and 2 web searches was enough.'
에이전트는 여러 번의 반복 루프를 돌면서 계획을 세우고 도구로 실행을 시도했으나 작성자는 미리 미니 플랜을 꼼꼼히 검토하지 않아 원하는 동작 사양을 놓쳤습니다. 구체적으로 작성자가 기대한 동작은 드래그로 타일을 그리면 폼이 자동 생성되는 것이었는데, 초기 요청은 수동 동기화 방식으로 구현되어 불일치가 발생했습니다. 이 흐름은 명세를 초기 입력에 포함시키지 않으면 에이전트가 잘못된 구현 결정을 내릴 수 있음을 시사합니다.
디버깅 과정에서 작성자는 단계적으로 증거를 더했는데 텍스트 로그, 스크린샷, 음성 메모, 화면 녹화로 진행해 에이전트의 재현 능력을 강화했습니다. 특히 화면 녹화는 프레임 단위 전사로 버그 위치를 특정하게 했고, 이후 에이전트가 Chrome을 직접 제어해 테스트를 수행하면서 문제 해결이 진전되었습니다. 이 흐름은 복잡한 UI 오류를 잡을 때는 점진적 증거 제출과 실환경 자동 테스트를 조합해야 효율이 높아진다는 교훈을 제공합니다.
컨텍스트 관리 문제로 에이전트가 동일한 정보를 반복 학습하는 비효율이 발생했는데, 세션 컨텍스트 한도 근처에서 압축이 자동으로 일어나며 키 학습 내용 일부가 사라졌고 이로 인해 같은 주제를 여러 차례 다시 처리하게 되었습니다. 작성자는 컨텍스트 용량 한도를 약 250k 토큰으로 언급했으며 압축으로 인해 세 번이나 재학습이 발생한 사례를 기록했습니다. 따라서 장시간 반복 루프가 예상되는 작업에서는 핵심 학습을 파일로 저장해 컨텍스트 압축에서 보존되도록 하는 보완책이 필요합니다.
근거
  • 에이전트가 한 차례의 루프에서 컨텍스트 압축 한도를 세 번 맞닥뜨렸다. 본문: 'the context window hit the limit 3 times in that turn' and 압축 한도 수치 표기.
모델 선택이 루프 성능과 디버깅 효율에 영향을 주었는데, 작성자는 가격이 80% 인하된 Luna Max를 일상 작업·검색에 사용했으나 코드·테스트 반복에는 더 높은 추론 능력을 가진 Sol로 전환해 성공을 얻었습니다. 에이전트가 오래 걸리는 테스트를 Sol의 High reasoning 모드로 수행한 뒤 13분 내에 원하는 동작을 구현해냈다는 점이 사례로 남아 있습니다. 이 경험은 비용-성능 트레이드오프를 고려해 모델을 상황별로 교체하는 전략이 유용하다는 점을 보여줍니다.
근거
  • Luna의 가격이 80% 인하되었다. 본문: 'the price has been cut 80% and people have been saying how great it is to use.'
  • 최종 문제 해결은 Sol 모델의 High reasoning으로 전환한 뒤 13분 만에 완료되었다. 본문 전개: 'This is where I switched models to Sol with High reasoning' 그리고 '13 minutes later it was done.'
작성자는 최종적으로 검증 기준과 작업 지시의 구체화를 체크리스트 형태로 정리했는데, 그 내용에는 미니 플랜 확인, 설치·엔드투엔드 테스트 지시, 대체 모델 사용, 컨텍스트 압축 시 주요 학습 저장, 동일 파일 편집 여부 확인이 포함되어 있습니다. 이 체크리스트는 에이전트에게 단지 ‘빌드해’라고 지시하는 대신 명확한 완료 조건과 테스트 절차를 함께 제공해야 시간을 절약할 수 있음을 강조합니다. 실제로 체크리스트 기반의 재시도가 성공으로 이어졌고 확장은 기대한 방식으로 동작했습니다.

용어 해설

에이전트 루프(agent loop)
에이전트가 목표를 달성하기 위해 반복적으로 계획을 세우고 도구를 호출해 정보를 수집하며 실행을 되풀이하는 과정으로, 각 반복이 쌓여 맥락이 확장되며 최종 결과를 만든다.
컨텍스트 압축(context compaction)
세션의 문맥이 모델의 컨텍스트 한도에 근접하면 요약·압축해 공간을 확보하는 과정으로, 원본 세부가 삭제되어 에이전트가 이전 학습을 재습득해야 하는 상황을 만들 수 있다.
검증 기준(verification criteria)
작업 완료를 판단할 수 있는 구체적 검사 항목들의 집합으로, 웹 UI의 동작·버전 호환성·다중 선택 병합 등 자동화 또는 수동 테스트로 통과 여부를 확인하는 방식이다.
Computer use·Browser use 도구(Computer use / Browser use)
에이전트가 실환경에서 브라우저 조작이나 파일 설치를 수행하게 하는 도구로, 설치·실행·엔드투엔드 테스트까지 직접 수행할 수 있는 권한과 인터페이스를 제공한다.

기술

  • ChatGPT (Codex mode)
  • Luna Max
  • Sol (High reasoning)
  • Claude Cowork
  • Chrome extension
  • Google Calendar

활용 사례

  • Google Calendar 위크뷰에서 드래그로 예약 슬롯을 생성해 예약 폼을 자동으로 업데이트하는 확장 개발
  • 에이전트에게 확장 설치부터 엔드투엔드 테스트까지 맡겨 버그를 재현하고 수정하도록 하는 워크플로우
  • 스크린 녹화와 음성 주석을 이용한 UI 오류 위치 특정 및 디버깅
  • 긴 반복 루프를 요구하는 디버깅 작업에서 모델 전환으로 효율을 높이는 전략
AI 분석 전체 내용 보기

AI 요약 · 북마크 · 개인 피드 설정 — 무료

출처 · 인용 안내

원문 발행 2026. 08. 07.수집 2026. 08. 07.출처 타입 RSS

인용 시 "요약 출처: AI Trends (aitrends.kr)"를 표기하고, 사실 확인은 원문 보기 기준으로 진행해 주세요. 자세한 기준은 운영 정책을 참고해 주세요.