용어 해설
- 캘리브레이션(Calibration)
- — 모델이 예측한 확률이나 확신도가 실제 정답률과 얼마나 일치하는지를 나타내는 척도입니다. 모델이 80% 확신한다고 답했을 때 실제로 80%의 정답을 맞힌다면 잘 캘리브레이션된 것으로 간주하며, 이는 실제 연구 환경에서 모델의 답변을 신뢰할 수 있는지 판단하는 핵심 기준이 됩니다.
- 제로샷(Zero-shot)
- — 모델이 특정 작업에 대한 추가 학습이나 예시 제공 없이, 사전 학습된 지식만을 활용하여 즉석에서 문제를 해결하는 방식입니다. 이 논문에서는 LLM이 외부 도구나 검색 없이 순수하게 내부 지식과 추론 능력만으로 과학 실험 결과를 예측할 수 있는지 평가하기 위해 사용되었습니다.
- 데이터 누출(Data Leakage)
- — 모델의 학습 데이터에 평가용 데이터가 포함되어 성능이 비정상적으로 높게 측정되는 현상입니다. SciPredict는 모델의 학습 중단 시점(Cut-off) 이후인 2025년 3월 이후 발표된 논문들에서 문제를 추출하여 이 문제를 원천적으로 차단했습니다.
- 다지선다형 질문(MCQ)
- — 여러 개의 선택지 중 정답을 고르는 평가 방식입니다. LLM 평가에서 가장 흔히 사용되지만, 정답이 눈에 보이기 때문에 모델의 실제 생성 능력이나 깊이 있는 추론 능력을 과대평가할 위험이 있다는 한계가 있습니다.
AI 요약 · 북마크 · 개인 피드 설정 — 무료
출처 · 인용 안내
인용 시 "요약 출처: AI Trends (aitrends.kr)"를 표기하고, 사실 확인은 원문 보기 기준으로 진행해 주세요. 자세한 기준은 운영 정책을 참고해 주세요.



