코드 변경 품질
FrontierCode
코드 변경을 추가 수정 없이 병합할 수 있는지 평가합니다.
확인일 2026-10-07 · 점수 단위 %
무엇을 측정하나요?
FrontierCode v1.1의 Main set은 에이전트가 만든 코드 변경이 병합할 만한 품질인지 평가합니다. 테스트를 통과하는지만 보는 평가와 다릅니다. 요구한 작업을 수행하면서 관련 없는 변경을 피하는 능력도 중요합니다.
비용 대비 성능을 읽는 방법
각 점은 특정 모델과 추론 강도의 공식 측정값입니다. 가로축은 작업당 달러 비용이며 로그 척도를 사용합니다. 같은 가로 간격은 같은 비용 차이가 아니라 같은 비용 배수를 뜻합니다. 세로축은 점수입니다. 선은 측정값을 연결하며, 측정하지 않은 중간 비용의 성능을 보장하지 않습니다.
평가 조건을 확인하세요
추론 강도를 높인다고 항상 점수가 오르지는 않습니다. Sonnet 5.5 발표는 max 설정에서 하위 에이전트의 검토가 시간 제한에 걸려 점수가 낮아질 수 있다고 설명합니다. 모델, 추론 강도, 하네스, 시간 제한을 함께 확인하세요. 이 페이지의 비교 곡선은 Anthropic이 공개한 원자료를 사용합니다.
비교 전에 확인할 항목
- 같은 벤치마크 버전과 문제 집합인가요?
- 검색과 코드 실행 같은 도구를 동일하게 제공했나요?
- 추론 강도, 실행 시간, 하네스가 같은가요?
- 정답률, 부분 점수, Elo 중 무엇을 표시하나요?
- 개발사 자체 평가인가요, 독립 평가인가요?