본문으로 건너뛰기

Macaron-A2UI: 개인 에이전트를 위한 Generative UI 모델

Plain-text 대화는 정보 수집, 옵션 비교, 확인 등 복잡한 상호작용에서 인지 부담과 대화 길이를 증가시킨다. Generative UI는 대화 맥락에서 적합한 UI를 실시간으로 합성해 정보를 수집하고 의사결정을 간소화한다. 본 연구는 A2UI 프로토콜을 기반으로 대규모 Generative UI 코퍼스를 구축하고 벤치마크와 학습 파이프라인을 통해 실행 가능한 UI 생성을 학습한다.

왜 중요한가

Plain-text 대화는 정보 수집, 옵션 비교, 확인 등 복잡한 상호작용에서 인지 부담과 대화 길이를 증가시킨다. Generative UI는 대화 맥락에서 적합한 UI를 실시간으로 합성해 정보를 수집하고 의사결정을 간소화한다. 본 연구는 A2UI 프로토콜을 기반으로 대규모 Generative UI 코퍼스를 구축하고 벤치마크와 학습 파이프라인을 통해 실행 가능한 UI 생성을 학습한다.

핵심 기여

대규모 Generative UI 학습 데이터를 위한 파이프라인

다양한 대화 소스로부터 14,245개의 어시스턴트 턴 샘플로 확장 가능한 Generative UI 상호작용 데이터를 구축하는 파이프라인을 제시하고, 규칙 기반 정제와 LLM 주석을 혼합하여 렌더링 가능한 UI를 학습하도록 구성한다.

A2UI-Bench 벤치마크

프로토콜 유효성, 상호작용 품질, 시각적 지표를 구분하는 3수준 평가 프레임워크를 갖춘 벤치마크를 제시하고, 300개 태스크로 구성된 종합적 평가를 수행한다.

스키마-라이트(Schema-light) SFT와 RL의 두단계 학습 레시피

LoRA 기반 파라미터 효율적 미세조정으로 텍스트-UI를 공동 생성하도록 SFT를 학습시키고, 이후 GRPO를 통해 실행 가능한 UI 상호작용 품질을 강화한다. 최소 프롬프트 설정에서도 UI 생성을 내재화한다.

대규모 Generative UI 코퍼스 및 렌더링 파이프라인 공개

A2UI 코퍼스와 렌더링·평가 프로토콜을 공개하여, 인간-컴퓨터 상호작용에서의 Generative UI 연구와 실무 도입을 촉진한다.

핵심 아이디어 이해하기

단락 1: Generative UI는 대화 맥락에서 실행 가능한 UI를 생성하는 문제로, 고정된 텍스트 응답만으로 이루어진 기존 대화의 한계를 보완한다. A2UI 프로토콜은 렌더러가 신뢰 가능한 컴포넌트 카탈로그를 사용해 UI를 구성하도록 하여 프로토콜 준수와 재현 가능성을 보장한다. 단락 2: 네 가지 소스(MultiWOZ 2.2, SGD, ESConv, AnnoMI)에서 UI 턴을 추출하고 중간 인터랙션 표현으로 매핑한 뒤, 각 구성 요소를 UI 위젯으로 연결한다. 단락 3: Task-oriented 데이터는 규칙 기반 변환으로, 오픈 도메인 데이터는 Editor-Author 두 단계로 UI를 계획하고 구성 요소를 생성한다. 단락 4: 두 단계 학습(SFT + GRPO)은 최소 프롬프트 환경에서 내재화된 UI 생성 능력을 강화하고, L1/L2/L3 상태를 균형 있게 개선한다.

관련 Figure

Figure 1: Plain-text 대화와 Macaron-A2UI 대화의 비교. 다중 선택, 슬라이더, 이미지-텍스트 조합 등 실행 가능한 UI 구성요소를 시연한다.
Diagram

UI가 실제 대화에서 정보 수집과 의사결정을 어떻게 단순화하는지 시각적으로 보여주며, core_intuition 블록의 내용을 보강한다.

Figure 1: Plain-text 대화와 Macaron-A2UI 대화의 비교. 다중 선택, 슬라이더, 이미지-텍스트 조합 등 실행 가능한 UI 구성요소를 시연한다.

방법론

단락 1: 데이터 파이프라인은 네 가지 소스에서 대화 샘플(context, response)을 수집하고, 응답에 UI(payload)를 포함시키는 샘플을 생성한다. 이를 통해 '대화 맥락 → 자연어 응답 + A2UI 명령 시퀀스'를 학습 목표로 설정한다. 단락 2: Task-oriented 데이터는 상태 머신 형식의 UI 창출/갱신/제거를 통해 규칙 기반으로 UI를 구성하고, LLM은 텍스트 표현을 다듬는다. Open-domain 데이터는 Editor(전략 수립)와 Author(로컬 컴포넌트 생성)로 나뉘며, determinisitc post-processing으로 구조적 이슈를 수정한다. 단락 3: 4단계 검사 파이프라인(format, structure, binding, semantic)으로 렌더링 가능성을 보장하고, 29.2%의 augmentation를 통해 길고 드문 구성 요소를 보강한다. 단락 4: 학습은 두 단계로 진행된다. SFT는 y = (text_response, a2ui) 형식의 타깃 응답에 대해 각 턴에서 교차 엔트로피 손실 LSFT를 최소화하도록 학습한다. GRPO는 프롬프트 xi마다 G개의 후보를 샘플링하고, 후보별 보상 Ri,j를 내부 그룹 정규화 Ai,j으로 조정한 후, 각 토큰에 Ai,j를 곱해 로그 우도 손실을 최소화한다. 단락 5: 평가 지표는 L1(프로토콜 정확성), L2(태스크 구성), L3(유저 유용성)와 V1-3의 시각 평가를 함께 사용하며, 패널 방식으로 평가한다. 퍼포먼스는 Minimal-prompt 환경에서의 실무적 실행 가능성과 스키마 의존도에 따른 성능 차이를 함께 분석한다.

관련 Figure

Figure 2: A2UI 코퍼스 구성 파이프라인. 소스 대화가 정규화되어 중간 상호작용 표현으로 매핑되고, 규칙-LLM 혼합 주석/수정이 이루어진다.
Diagram

methodology 블록의 UI 주석/구성 프로세스와 deterministic post-processing 절차를 그림으로 설명한다.

Figure 2: A2UI 코퍼스 구성 파이프라인. 소스 대화가 정규화되어 중간 상호작용 표현으로 매핑되고, 규칙-LLM 혼합 주석/수정이 이루어진다.

Figure 3: 상위 10개 컴포넌트 빈도(Column, Row, Card, Button 등)와 응답 수준의 기초 패턴 분포
Chart

공간 구성과 상호작용 패턴의 분포를 보여주어 데이터의 구조적 다양성과 학습 신호의 근거를 제공한다.

Figure 3: 상위 10개 컴포넌트 빈도(Column, Row, Card, Button 등)와 응답 수준의 기초 패턴 분포

주요 결과

주요 결과로 Macaron-A2UI-Venti가 A2UI-Bench에서 75.6의 종합 언어 측 점수를 달성하며, Schema가 주어졌을 때의 상한보다도 강력한 성능을 보였다. Macaron-A2UI-Grande는 74.2로 GPT-5.4의 74.1을 약간 능가하고, 235B 계열은 74.2 수준의 강력한 성능을 기록한다. 데이터 세트별로 ESConv, AnnoMI에서 Macaron-A2UI-235B가 최상위를 차지했고, MultiWOZ와 SGD에서도 안정적 성능을 보였다. RL을 통한 GRPO 학습은 L1(프로토콜 정확성)을 먼저 크게 향상시키고, L2/L3는 점진적으로 개선되며, 235B 계열에서 특히 안정적으로 상승하는 경향이 나타났다. 30B 계열은 RL 이후 L3의 개선이 상대적으로 더딘 반면, 235B 계열은 L2/L3도 균형 있게 향상된다. 또한 Frontier 모델에 비해 Minimal-prompt 설정에서도 강력한 A2UI 성능을 보여주며, schema hint가 주어지는 경우에는 DeepSeek-GPT-3.5 등의 대규모 모델도 상향될 수 있음을 확인했다. 전체적으로 학습 파이프라인(SFT+RL)으로 프로토콜 정확성과 실행 가능한 UI 생성 능력을 크게 향상시키고, 스키마 의존 없이도 내재화가 가능함을 보인다.

관련 Figure

Figure 4: 학습 파이프라인의 ablation 결과. w/o schema vs w/ schema 프롬프트 환경에서의 비교를 보여준다.
Diagram

training pipeline의 ablation 결과를 시각화하여 Minimal-prompt에서도 강건한 성능을 얻을 수 있음을 보인다.

Figure 4: 학습 파이프라인의 ablation 결과. w/o schema vs w/ schema 프롬프트 환경에서의 비교를 보여준다.

Figure 5: 데이터셋별/태스크별 모델 성능의 레이더 차트. ESConv, SGD, MultiWOZ 등에서 Macaron-A2UI-235B가 우수한 면모를 보인다.
Diagram

다양한 도메인에서의 일반화와 크로스-도메스 성능 강점을 강조하며, 본 연구의 크로스 도메스 안정성을 시각적으로 뒷받침한다.

Figure 5: 데이터셋별/태스크별 모델 성능의 레이더 차트. ESConv, SGD, MultiWOZ 등에서 Macaron-A2UI-235B가 우수한 면모를 보인다.

Figure 6: GRPO 학습 중 보상 트레이스. L1 보상은 가장 먼저 상승하고, L2/L3 보상은 점진적으로 향상된다.
Diagram

GRPO 학습 다이나믹스를 시각화하여 보상 구성의 기대 효과를 뒷받침하고, 모델 규모에 따른 학습 패턴 차이를 보여준다.

Figure 6: GRPO 학습 중 보상 트레이스. L1 보상은 가장 먼저 상승하고, L2/L3 보상은 점진적으로 향상된다.

기술 상세

단락 1: A2UI 기반 Generative UI의 전체 아키텍처는 시스템 명령(context) + 대화 히스토리 + 현재 사용자 메시지를 입력으로 받아 텍스트 응답과 실행 가능 UI 액션 시퀀스를 출력하는 방식이다. 단락 2: 데이터 파이프라인은 4개 소스에서 데이터를 수집하고, 중간 표현(intermediate interaction representation)으로 매핑한 뒤 A2UI 구성요소 군으로 연결한다. Task-oriented 데이터는 상태 머신 스타일의 UI 생성 규칙으로 처리하고, Open-domain 데이터는 Editor-Author 두 단계로 분해한다. 단락 3: Deterministic post-processing을 통해 enum 정규화, 바인딩 정합성, 레이아웃 제약 등을 수정하고, 4단계 렌더링 검사를 거쳐 런타임 렌더링 가능 여부를 보장한다. 단락 4: 학습은 LoRA 기반 SFT로 텍스트-UI 공동 생성 능력을 학습하고, GRPO를 통해 실행 가능한 인터랙션의 질을 향상시키며, L1/L2/L3 보상 구성으로 프로토콜 정확성, 태스크 구성, 사용자 가치의 균형을 맞춘다. 단락 5: 보상 설계는 포맷/구조/데이터 바인딩/행동의 완성도 등 하드 게이트를 먼저 만족시키고, 그 이후 L1-L3의 가중치를 적용한다.

실무 활용

Generative UI를 통해 대화-구현 간의 간극을 줄이고, 사용자가 텍스트 입력을 늘리거나 여러 번의 대화를 거치지 않고도 필요한 정보를 수집하고 의사결정을 수행하도록 돕는다.

  • 정보 수집 및 선호도 추출: 대화 중 즉시 UI를 제시해 사용자의 선택을 빠르게 수집
  • 다목표 계획/확인: 여러 목표를 한 턴에 정리하고, 실행 가능한 액션을 제시
  • 예약/일정 관리: 날짜/시간 입력과 선택지 제공으로 예약 흐름을 간소화
  • 상담/코칭 보조: 선택형 UI와 보완 텍스트를 통해 의사소통 부하를 감소

코드 공개 여부: 미확인

키워드

Generative UI(생성형 UI)A2UILoRAGRPOSFTRLA2UI-Bench개인 에이전트
AI 분석 전체 내용 보기

AI 요약 · 북마크 · 개인 피드 설정 — 무료

출처 · 인용 안내

원문 발행 2026. 05. 24.수집 2026. 05. 27.출처 타입 PAPER

인용 시 "요약 출처: AI Trends (aitrends.kr)"를 표기하고, 사실 확인은 원문 보기 기준으로 진행해 주세요. 자세한 기준은 운영 정책을 참고해 주세요.