왜 중요한가
모델 검색은 태스크 수준에서의 정렬과 비교를 위한 다양성 확보 간의 균형이 필요하다. 순수한 텍스트 유사도만으로는 상호 배타적이고 비차별적인 결과가 많아 다양성 확보에 한계가 있다. 본 연구는 condensed evidence인 구조화된 표를 활용해 태스크 정렬성과 차별화를 동시에 달성하는 테이블 기반 검색 프레임워크를 제시한다.
핵심 기여
테이블 기반 후보 생성 파이프라인
NL2Card2Tab2Card 파이프라인으로 anchor 카드에서 시작해 모델 표를 표 발견 연산자(Keyword, Joinable, Unionable)로 확장하고, 각 표에 매핑된 카드를 Top-1으로 선택해 Top-k 후보를 재랭킹한다.
너깃 기반 평가 체계
6-튜플 너깃 스키마(N = {모델, base 모델, 모델 버전, 데이터셋, 메트릭 이름, 메트릭 값})를 사용해 질의 제약에 맞는 너깃을 매핑하고, 후보 모델 카드 집합의 너깃 커버리지를 Nugget Score로 측정한다.
방향성 인식 통합
전치 여부를 감지하여 필요한 경우 표를 전치하고, Integration 단계에서 중복 없이 서로 다른 증거를 하나의 통합 뷰로 구성한다.
엔드-투-엔드 구현 및 실험 설계
ModelTables 코퍼스(60k 모델 카드의 표)와 LitSearch에서 파생된 597개의 모델 추천 질의를 활용해 구조화 검색과 텍스트 기반 검색의 비교를 수행하고 nugget 커버리지를 비교한다.
핵심 아이디어 이해하기
출발점: 모델 카드는 서사 텍스트와 구조적 표의 혼합으로 구성되며, 표는 핵심 증거를 밀도 있게 담고 있다. 한편 텍스트 기반 검색은 텍스트 유사도에 의존해 동형 결과를 늘릴 수 있다. 해결 원리: Structured Semantic Search는 anchor 카드의 텍스트 검색으로 Task-Alignment를 확보한 뒤, table discovery 연산자(Keyword, Joinable, Unionable)를 통해 표 차원에서 후보를 확장한다. 결과적으로 표 증거를 모델 카드와 연계하고 Top-k를 통해 비교 가능 후보를 생성한다. 달라지는 점: 동일한 질의에 대해 구조화된 증거를 제공하는 검색이 더 다양한 모델과 벤치마크를 포섭하며, 노깃 커버리지를 증가시키고 표 기반의 비교 뷰를 제공한다.
방법론
전반적 접근: NL2Card(Unstructured Semantic Search)로 앵커 카드 검색을 수행하고, Anchor 카드가 하나 이상의 표를 가진 경우에 한해 Structured Semantic Search를 적용한다. 입력: 질의 q, 모델-카드 코퍼스 C, 표 레이크 L, top-k 예산. 출력: Top-k 모델 카드 후보 R.
관련 Figure

질의 의도 분포를 시각화한 차트로, evidence-based 쪽이 우세함을 보여주고, 구조화 검색의 의도 인식에 대한 필요성을 시사한다.
Query Label Distribution

Anchor Card Table, Query2Card Results, Query2Tab2Card Results의 흐름을 보여주는 예시로 구조화 검색의 동작 흐름과 표-카드 매핑을 설명한다.
Structured Semantic Search Example

Unstructured Search와 Structured Search의 비교를 시각화하는 스크린샷으로, 도구 간 차이가 표 기반 증거의 활용에 미치는 효과를 나타낸다.
Query2Card Dense vs Query2Tab2Card Unionable
주요 결과
주요 벤치마크 결과: Six 구조적 검색 연산자 중 Unionable이 상위 반응에서 가장 강력한 구조 인식 후보를 제시하며, Top-1/Top-3/Top-5에서 Nugget 커버리지가 높다. Top-10에서는 방법 간 차이가 축소된다. Table-level 평가: Unstructured Search는 usable한 표가 없는 경우가 많아 다양성이 낮고, Structured Search는 표 기반 증거를 제공해 데이터 과학자가 모델 간 비교를 쉽게 수행하도록 한다. Dataset 및 설정: 60K 모델 카드가 포함된 ModelTables and 약 597 LitSearch 질의에서 비교 실험 수행. 통합 뷰: 상이한 표의 중복 대신 공통 증거를 묶어 통합 표를 생성하고 해마다 업데이트 가능한 증거 기반 비교를 제공한다.
관련 Figure

너깃 기반 평가의 분포와 쿼리 레벨 랭크 결과를 보여준다. Unionable이 Top-k 1/3/5에서 가장 높은 너깃 커버리지를 나타내며, Top-10에서 차이가 감소한다.
Nugget Count Distribution and Query-Level Rank Outcomes by Top-k
기술 상세
아키텍처: Anchor Card → Table Discovery(Keyword/Joinable/Unionable) → MapTableToCards → FinalRerank. 알고리즘 1: NL2Card2Tab2Card Candidate Generation. 입력 q, C, L, top-k → 출력 Top-k model cards. 알고리즘 2: Orientation-aware Integration. 입력 Q, R → I를 구성하며, OverlapMatrix를 이용해 테이블의 방향성(전치 여부)을 확인하고 필요 시 Transpose를 적용한 뒤 Integrate한다. 차별화: Prior Work 대비 구조화 표를 탐색 대상으로 삼아 표 간 연계 및 통합을 통해 다양한 모델 증거를 확보한다. 구현 세부: ModelTables 코퍼스(60k 카드), 표의 크기 제한(<200행, <100열), 카드 간 표 연계 유지. 너깃 추출은 카드의 전체 내용을 프롬프트로 전달해 6-튜플 너깃으로 정규화.
실무 활용
구조화된 표 증거를 이용한 모델 검색은 비교 기반 의사결정을 돕고, 표 기반의 자동 벤치마크 뷰를 제공한다.
- 테이블 기반 증거를 통해 모델 간 비교표를 자동으로 생성
- 벤치마크 차등 증거를 바탕으로 모델 다양성 확보
- 표 증거의 누깃 기반 검증으로 동적 모델 레이크의 품질 관리
코드 공개 여부: 공개
코드 저장소 보기키워드
용어 해설
- 테이블 탐색(Table Discovery)
- — 다양한 표로 구성된 데이터 레이크에서 표의 의미적 정합성, 스키마 유사성, 칼럼 매칭 등을 바탕으로 관련 표를 찾아내는 일련의 탐색 기법. 헤더와 첫 열의 값이 특징인 표를 우선적으로 검색하고, 이후 다른 표와의 연결 가능성까지 확장한다.
- 너깃(Nugget)
- — 모델 카드에 담긴 핵심 증거를 Atomic하게 표현한 6-튜플 아이템(model, base model, model variant, dataset, metric name, metric value)으로 구성된 정보 단위. 질의 제약에 맞춰 누깃을 매핑하고, 후보 세트의 커버리지를 측정하는 단위로 사용된다.
- 방향성 인식 통합(Orientation-aware Integration)
- — 테이블이 전치되었거나 스키마가 다를 때도 서로를 정합적으로 통합하도록 테이블의 방향성을 식별하고 필요 시 전치(transpose)하여 통합하는 기법. 이로써 서로 다른 표에서 얻은 정보를 일관된 뷰로 구성한다.
AI 요약 · 북마크 · 개인 피드 설정 — 무료
출처 · 인용 안내
인용 시 "요약 출처: AI Trends (aitrends.kr)"를 표기하고, 사실 확인은 원문 보기 기준으로 진행해 주세요. 자세한 기준은 운영 정책을 참고해 주세요.