본문으로 건너뛰기

Astra가 고른 제품을 추적한 AEO 실험

7개 프런티어 모델의 제품 추천을 비교해 AEO의 승부처와 모델별 편향을 측정했습니다.

이 요약은 AI가 원문을 분석해 생성했습니다. 정확한 내용은 원문 기준으로 확인하세요.

TL;DR

Latent Space는 Astra를 포함한 7개 프런티어 모델에 6가지 질문 변형을 적용하고, 161개 범주의 제품 추천을 비교하는 Frontier AEO Tracker를 구축했습니다. Astra가 답변에서 추출한 1순위·대안·언급·비추천과 인용 출처를 종합해 독자적인 AEO 점수를 산출했으며, 28개 범주에서는 모든 조사 모델이 같은 1순위를 선택했습니다. 모델마다 자사 계열 제품을 선호하는 편향이 나타났지만 GPT 계열이 Claude를 추천하는 사례처럼 비편향적인 선택도 확인됐습니다. Astra의 중앙 인용 출처 수는 5개로 Sol의 9개, Opus의 11개, Fable의 15개보다 적었고, 질문을 가볍게 바꿔도 선택을 바꾸는 경우가 훨씬 적어 AEO의 영향력이 커지는 조건을 만들었습니다. 다만 표본은 도구 호출에서 수집 가능한 출처에 한정되며, Gemini·Antigravity·GLM·Zcode·DeepSeek·DeepCode는 오류와 호출 제한으로 이번 분석에서 제외됐습니다.

섹션별 상세

01
Latent Space는 창업자와 DX 리더에게서 수요가 높았던 AEO를 정량적으로 비교하기 위해 Frontier AEO Tracker를 만들었습니다. 실험은 161개 범주에서 6가지 프롬프트 변형을 사용하고, 검색 기능을 켠 7개 모델의 답변을 수집하는 방식으로 진행됐습니다. 코딩 에이전트와 AI 팟캐스트부터 Managed Databases, ASR 모델, 엔젤 투자자와 Payroll software까지 범주를 넓혀 모델이 어떤 제품을 선택하는지 비교할 수 있게 구성했습니다.
02
Astra는 각 답변에서 1순위 추천, 대안, 단순 언급, 약한 비추천과 강한 비추천을 추출하고 이를 독자적인 AEO 점수로 환산했습니다. 1순위에는 더 큰 가중치를 주고 비추천에는 음의 가중치를 적용해 단순 언급 빈도보다 실제 선택 가능성을 반영했습니다. 같은 실험에서 에이전트 추천에 영향을 준 상위 인용 출처와 주요 실패 사례도 함께 수집해 추천 결과와 콘텐츠 접근성의 관계를 확인할 수 있게 했습니다.
03
모델별 추천에는 자사 계열 제품을 향한 편향이 나타났습니다. 코딩 에이전트 질문에서 Fable과 Opus는 Claude Code 계열을, Sol과 Astra는 Codex 계열을, Grok은 Cursor를, Muse는 Muse Code와 SWE-1.7을, Devin은 자신의 제품을 선호하는 양상이 나타났습니다. 그럼에도 GPT 모델이 Claude를 추천하는 사례가 있었고, 161개 범주 중 28개에서는 모든 조사 모델이 같은 주된 선택지를 고르는 보편적 우위가 확인됐습니다.
04
Sol에서 Astra로, Opus에서 Fable로 모델 세대가 바뀌면서 같은 연구소 내부에서도 추천 선택이 크게 뒤집혔습니다. 이 비교는 새로운 사전학습과 RL 우선순위가 제품 선택에 어떤 변화를 만드는지, 스타트업의 AEO 투자가 실제 추천 결과에 반영되는지를 점검하는 기준으로 쓰였습니다. 경쟁 제품이 특정 상황에서 더 나은 선택을 받은 이유도 별도 분석 대상으로 삼아 단순 순위보다 선택 변화의 원인을 비교했습니다.
05
Astra는 질문을 가볍게 바꿔도 기존 선택을 유지하는 비율이 높아 Sol보다 더 자신감 있거나 효율적인 모델로 나타났습니다. 중앙 인용 출처 수는 Astra 5개, Sol 9개, Opus 11개, Fable 15개였으며, 출처를 많이 찾는 모델과 적은 출처로 결론을 내리는 모델 사이의 차이가 드러났습니다. 선택의 무작위성이 낮아질수록 콘텐츠가 모델의 추천 경로에 들어가는 AEO의 가치가 커지지만, 출처 표본은 도구 호출에서 수집한 정보에 한정된다는 제약이 남습니다.
06
Ora와 Vercel이 측정한 Markdown 콘텐츠 협상 같은 AEO 관행은 실제 모델 접근 과정에서 영향을 미쳤습니다. 콘텐츠 협상이 실패하면 모델이 해당 콘텐츠를 읽지 않는 결과가 나타나므로, 추천을 얻으려면 모델이 읽을 수 있는 형식과 접근 경로를 확보해야 합니다. 다만 이 결과는 사전학습 데이터 전체가 아니라 도구 호출에서 스크랩한 출처에 기반하므로 연구소의 전체 데이터 우선순위로 일반화하기 어렵습니다.

용어 해설

답변 엔진 최적화(AEO)
LLM이나 AI 에이전트가 제품과 서비스를 추천할 때 특정 콘텐츠가 선택·인용되도록 만드는 최적화 방식입니다. 이 글에서는 여러 모델에 질문을 던진 뒤 추천 순위와 출처, 비추천 반응을 점수화해 AEO 성과를 측정합니다.
프런티어 모델(Frontier Model)
당시 최고 수준의 성능과 규모를 겨루는 최신 AI 모델을 가리킵니다. 이 글에서는 7개 모델에 동일한 범주의 질문을 반복해 제품 추천 성향과 모델 세대별 선택 변화를 비교하는 데 활용합니다.
프롬프트 변형(Prompt Variation)
같은 의도를 유지하면서 질문의 표현이나 구조를 바꾼 입력입니다. 이 글의 실험은 161개 범주마다 6가지 질문 변형을 사용해 표현 변화에 따른 추천 일관성과 선택의 무작위성을 측정합니다.
답변 추출(Answer Extraction)
모델의 긴 응답에서 추천 제품, 대안, 언급, 비추천과 인용 출처를 구조화된 결과로 뽑아내는 처리 단계입니다. 이 글에서는 Astra가 추출을 수행하고 결과를 독자적인 AEO 점수 계산에 사용합니다.
Markdown 콘텐츠 협상(Markdown Content-Negotiation)
AI 에이전트가 웹 콘텐츠를 읽을 때 Markdown 형식으로 정보를 요청하거나 제공하는 방식입니다. 글에서는 Ora와 Vercel이 측정한 이 관행이 실제로 작동하며, 처리 실패가 모델의 콘텐츠 열람을 저해한다고 설명합니다.

기술

  • Astra
  • Sol
  • Opus
  • Fable
  • Codex
  • Grok
  • Cursor
  • Muse
  • Muse Code
  • SWE-1.7
  • Devin
  • Ora
  • Vercel
  • Gemini
  • Antigravity
  • GLM
  • Zcode
  • DeepSeek
  • DeepCode

활용 사례

  • AI 에이전트가 제품을 추천하는 범주의 AEO 평가
  • 모델별 추천 편향과 자사 제품 선호도 비교
  • 웹 콘텐츠의 AI 에이전트 접근성 점검
  • 프롬프트 변형에 따른 추천 일관성 측정
  • 모델 세대 교체에 따른 제품 선택 변화 분석
AI 분석 전체 내용 보기

AI 요약 · 북마크 · 개인 피드 설정 — 무료

출처 · 인용 안내

원문 발행 2026. 09. 08.수집 2026. 09. 08.출처 타입 RSS

인용 시 "요약 출처: AI Trends (aitrends.kr)"를 표기하고, 사실 확인은 원문 보기 기준으로 진행해 주세요. 자세한 기준은 운영 정책을 참고해 주세요.