요약은 생성됐지만 현재 화면 버전과 데이터 형식이 맞지 않아 렌더링할 수 없습니다.
출처 · 인용 안내
원문 발행 2026. 02. 24.수집 2026. 02. 24.출처 타입 REDDIT
인용 시 "요약 출처: AI Trends (aitrends.kr)"를 표기하고, 사실 확인은 원문 보기 기준으로 진행해 주세요. 자세한 기준은 운영 정책을 참고해 주세요.
요약은 생성됐지만 현재 화면 버전과 데이터 형식이 맞지 않아 렌더링할 수 없습니다.
출처 · 인용 안내
인용 시 "요약 출처: AI Trends (aitrends.kr)"를 표기하고, 사실 확인은 원문 보기 기준으로 진행해 주세요. 자세한 기준은 운영 정책을 참고해 주세요.
아직 관련 토론이 없습니다.
댓글을 작성하려면 로그인이 필요합니다.
특정 인간 판단자의 응답을 예측하도록 AI를 평가하는 방식을 통해 주관적·논쟁적 개념적 추론 과제에서 순수한 역량 변화를 추적하는 방안과 그 설계상 제약을 밝힌다.
고정 앵커와 Lowdin 대칭 직교화, 열 단위 Z표준화, 코사인 거리로 서로 다른 차원의 LLM 임베딩을 공통 좌표로 정렬해 모델 간 의미 비교와 선택적 태스크 라우팅을 가능하게 했다.
벙크마크 점수는 작업 선택·하니스·채점·보고 방식 네 가지 선택에 의해 크게 달라지며 일부 감사에서 34.1%·42%의 결함이 확인되었다.
14:18비정형 텍스트에서 그래프를 추출하고 PageRank, 최단 경로 등 알고리즘을 활용해 검색 정확도를 높이는 GraphRAG의 기초를 다룬다.
GPT-4o를 평가자로 8개월 운영한 결과 포맷·명백한 회귀는 잡았지만 모델 업데이트와 순서 편향 등으로 인간 평가를 완전히 대체하기에는 일관성이 부족했다.