LLM 모델과 벤치마크
주요 AI 회사의 최신 모델과 공식 발표 점수를 확인하세요.
확인일 · 수동 확인 자료
벤치마크별 모델 비교
코드 변경을 추가 수정 없이 병합할 수 있는지 평가합니다.
측정 원리 읽기 →FrontierCode v1.1 · Main set
비교 그래프를 준비하고 있습니다.
세로축은 점수 차이를 보기 위해 확대했습니다. 선은 추론 강도별 측정값을 연결하며 중간 비용의 성능을 보장하지 않습니다.
Anthropic가 공개한 비교 평가입니다. 이전 세대 모델도 포함합니다. 공식 그래프와 평가 조건 ↗
비용·점수 원자료 보기
| 모델 | 추론 강도 | 비용 (USD) | 점수 (%) |
|---|---|---|---|
| Sonnet 5.5 | Low | $0.1940 | 29.3 |
| Sonnet 5.5 | Med | $0.2364 | 36.5 |
| Sonnet 5.5 | High | $0.4175 | 49.4 |
| Sonnet 5.5 | Xhigh | $1.5881 | 52.1 |
| Sonnet 5.5 | Max | $20.7818 | 46.2 |
| Opus 5.5 | Low | $0.4039 | 47.3 |
| Opus 5.5 | Med | $0.8021 | 54.6 |
| Opus 5.5 | High | $1.0901 | 54 |
| Opus 5.5 | Xhigh | $2.2500 | 51.4 |
| Opus 5.5 | Max | $6.1918 | 54.4 |
| Sonnet 5 | Low | $2.3900 | 28.7 |
| Sonnet 5 | Med | $3.8100 | 35.2 |
| Sonnet 5 | High | $6.1000 | 39.4 |
| Sonnet 5 | Xhigh | $10.0700 | 42.7 |
| Sonnet 5 | Max | $17.1200 | 42.4 |
| GPT-6 Sol | Low | $0.4324 | 37.3 |
| GPT-6 Sol | Med | $0.7659 | 45.9 |
| GPT-6 Sol | High | $1.0393 | 47.7 |
| GPT-6 Sol | Xhigh | $1.3250 | 48.4 |
| GPT-6 Sol | Max | $2.0651 | 49.3 |
모델별 벤치마크 한눈에 보기
개발사별 발표 자료 · JSON으로 저장한 자료에 모델과 벤치마크를 추가해 다시 불러올 수 있습니다.
| 벤치마크 | ||||||||||
|---|---|---|---|---|---|---|---|---|---|---|
| 코드 변경 품질FrontierCode v1.1 · Main set | 미확인 | 미확인 | 52.1% | 54.4% (최고 점수) | 미확인 | 미확인 | 미확인 | 미확인 | 미확인 | 미확인 |
| 소프트웨어 개발DeepSWE v1.1 | 미확인 | 74.1% | 미확인 | 미확인 | 미확인 | 71% | 미확인 | 74.2% | 67.5% | 77.9% (최고 점수) |
| 터미널 작업Terminal-Bench 4.0 | 미확인 | 57.9% | 70.6% (최고 점수) | 66.4% | 55.8% | 37.6% | 미확인 | 31.2% | 미확인 | 57.4% |
| 터미널 작업Terminal-Bench 2.1 | 미확인 | 미확인 | 미확인 | 미확인 | 미확인 | 미확인 | 미확인 | 90.6% (최고 점수) | 88.3% | 미확인 |
| 과학 추론GPQA Diamond | 미확인 | 미확인 | 미확인 | 미확인 | 미확인 | 미확인 | 미확인 | 90.9% | 미확인 | 미확인 |
| 고난도 지식·추론HLE · 도구 없음 | 미확인 | 미확인 | 미확인 | 미확인 | 60.9% (최고 점수) | 미확인 | 미확인 | 36.8% | 미확인 | 미확인 |
| 고난도 지식·추론HLE · 도구 사용 | 미확인 | 미확인 | 64.5% | 67.7% (최고 점수) | 65% | 미확인 | 미확인 | 63.9% | 미확인 | 미확인 |
| 실무 결과물GDPval-AA v2 · Elo | 미확인 | 미확인 | 미확인 | 미확인 | 1,853 Elo (최고 점수) | 미확인 | 1,754 Elo | 미확인 | 1,668 Elo | 미확인 |
| 실무 결과물GDPval-AA v2.1 · Elo | 미확인 | 미확인 | 1,844 Elo | 1,846 Elo (최고 점수) | 미확인 | 미확인 | 미확인 | 미확인 | 미확인 | 미확인 |
개발사가 발표한 점수입니다. 평가 조건이 서로 달라 같은 순위로 해석하지 마세요. 파란 칸은 벤치마크별 최고 점수, –는 미확인입니다. 모델명을 선택하면 해당 열을 강조합니다.
모델별 평가 조건과 출처
- OpenAI · GPT-6 Astra
- OpenAI 출시 평가. 벤치별 하네스와 추론 설정은 원문의 각주 참고. 원문 보기 ↗
- Anthropic · Claude Sonnet 5.5
- FrontierCode: xhigh. TB 4.0·GDPval-AA: max. HLE 도구 사용은 발표의 평가 조건 참고. 벤치별 설정은 공식 발표 참고. 원문 보기 ↗
- Anthropic · Claude Opus 5.5
- TB 4.0: xhigh, ±2.6%p. 그 외 max. 안전장치와 일부 과제의 대체 모델 응답 포함. 원문 보기 ↗
- Anthropic · Claude Fable 5.1
- 9월 Fable 출시 평가. 안전장치 작동 시 일부 과제는 Opus로 대체. 원문 보기 ↗
- xAI / SpaceXAI · Grok 4.7
- DeepSWE: high. TB 4.0: xhigh. 회사 출시 평가. 원문 보기 ↗
- Meta · Muse Spark 1.3
- max 추론. 공식 개발자 페이지에서 확인한 GDPval-AA 수치. 원문 보기 ↗
- DeepSeek · DeepSeek-V4.1-Flash
- 9월 10일 공식 업데이트. HLE는 전체 평가. 세부 하네스·추론 설정은 연결 문서 참고. 원문 보기 ↗
- Moonshot AI · Kimi K3
- max, temperature=1, top-p=1. DeepSWE·TB: Kimi Code. GDPval-AA는 AA 결과 인용. 원문 보기 ↗
- Google DeepMind · Gemini 4 Argon
- Google 공식 성능표. 벤치별 평가 방법은 공식 방법론 문서 참고. 원문 보기 ↗
회사별 프론티어 모델
벤치마크 이해하기
코드 변경 품질
FrontierCode
코드 변경을 추가 수정 없이 병합할 수 있는지 평가합니다.
측정 원리 읽기 →소프트웨어 개발
DeepSWE v1.1
실제 코드 저장소에서 긴 개발 작업을 끝내는 능력을 평가합니다.
측정 원리 읽기 →터미널 작업
Terminal-Bench
터미널에서 도구를 사용해 작업을 완료하는 에이전트를 평가합니다.
측정 원리 읽기 →과학 추론
GPQA Diamond
전문가가 만든 어려운 과학 객관식 문제의 정답률입니다.
측정 원리 읽기 →고난도 지식·추론
Humanity’s Last Exam
여러 학문 분야의 전문가 문제를 풀어 정확도를 측정합니다.
측정 원리 읽기 →실무 결과물
GDPval-AA
업무 결과물의 상대적인 품질을 비교하는 평가입니다.
측정 원리 읽기 →