본문으로 건너뛰기

실제 웨어러블 건강 추론을 재는 WearableQA

200명·최대 500일의 실제 웨어러블 기록으로 LLM의 데이터·건강·교차 신호 추론을 평가하는 4,084문항 벤치마크입니다.

용어 해설

종단 시계열(Longitudinal Time Series)
한 사용자의 생체·행동 신호를 여러 날에 걸쳐 반복 측정한 데이터입니다. WearableQA에서는 최대 500일의 일별 웨어러블 기록을 입력으로 사용해 추세, 이상 구간, 회복 시간처럼 시간 축에 의존하는 질문의 정답을 계산합니다.
교차 신호 추론(Cross-Signal Reasoning)
두 개 이상의 생리·행동 신호를 함께 읽어 관계나 건강 의미를 판단하는 추론 방식입니다. 예를 들어 활동량과 안정시 심박수의 결합을 사용자별 기록에서 찾아야 하므로, 단일 신호보다 여러 시계열의 정렬과 통합이 필요합니다.
이중 근거 프레임워크(Dual-Grounding Framework)
질문의 근거를 동료심사 문헌과 대규모 코호트에서 통계적으로 확인한 패턴으로 나누는 구축 방식입니다. 문헌의 생리학적 관계와 실제 사용자 데이터에서 발견한 관계를 각각 결정적 계산으로 개인 기록에 적용해 정답을 만듭니다.
발견 후 라벨링(Discover-Then-Label)
먼저 문헌 또는 코호트에서 추론 목표를 정한 뒤, 각 사용자의 원시 측정값에 실행 가능한 계산을 적용해 답을 부여하는 절차입니다. 동일한 입력에는 동일한 답이 나오므로 질문 생성과 평가를 재현할 수 있습니다.
에이전트 평가(Agentic Evaluation)
모델이 시계열을 직접 읽는 데 그치지 않고 Python 같은 계산 도구를 호출해 통계량을 산출하도록 평가하는 방식입니다. WearableQA에서는 행 단위 입력과 Python 접근을 결합했을 때 GPT-5.4의 전체 정확도가 51.2%에서 71.3%로 상승했습니다.
AI 분석 전체 내용 보기

AI 요약 · 북마크 · 개인 피드 설정 — 무료

출처 · 인용 안내

원문 발행 2026. 09. 04.수집 2026. 09. 11.출처 타입 PAPER

인용 시 "요약 출처: AI Trends (aitrends.kr)"를 표기하고, 사실 확인은 원문 보기 기준으로 진행해 주세요. 자세한 기준은 운영 정책을 참고해 주세요.