고난도 지식·추론
Humanity’s Last Exam
여러 학문 분야의 전문가 문제를 풀어 정확도를 측정합니다.
확인일 2026-10-07 · 점수 단위 %
무엇을 측정하나요?
HLE는 여러 분야의 매우 어려운 질문으로 모델의 지식과 추론 한계를 평가합니다. 객관식과 짧은 답변 문제가 있으며, 이미지가 필요한 문제도 포함합니다. 답을 명확하게 검증할 수 있는 문제에 초점을 맞춥니다.
어떻게 채점하나요?
모델의 최종 답이 기준 정답에 맞는지 판정하고 정확도를 계산합니다. 평가 구현에 따라 답 추출과 정답 판정에 자동 채점기를 사용할 수 있습니다. 전체 평가와 텍스트 전용 부분집합은 서로 다른 평가입니다. DeepSeek 발표의 36.8%는 전체 평가이고, 괄호 안 39.1%는 텍스트 부분집합이므로 이 표에는 전체 평가만 넣었습니다.
도구 사용 여부를 확인하세요
검색이나 코드 실행을 허용하면 모델이 외부 정보를 찾거나 계산할 수 있습니다. 도구 없는 점수와 도구 있는 점수는 별도 조건입니다. 높은 점수가 곧 자율적인 연구 능력이나 AGI의 증명은 아닙니다. 실제 업무에서는 출처 검증과 결과 확인이 계속 필요합니다.
비교 전에 확인할 항목
- 같은 벤치마크 버전과 문제 집합인가요?
- 검색과 코드 실행 같은 도구를 동일하게 제공했나요?
- 추론 강도, 실행 시간, 하네스가 같은가요?
- 정답률, 부분 점수, Elo 중 무엇을 표시하나요?
- 개발사 자체 평가인가요, 독립 평가인가요?