터미널 작업
Terminal-Bench
터미널에서 도구를 사용해 작업을 완료하는 에이전트를 평가합니다.
확인일 2026-10-07 · 점수 단위 %
무엇을 측정하나요?
코드 수정, 환경 구성, 데이터 처리처럼 명령줄 환경에서 여러 단계를 수행해야 하는 작업을 평가합니다. 모델의 답변 문장보다 최종 환경과 결과물이 요구사항을 충족하는지가 중요합니다.
어떻게 채점하나요?
격리된 환경에 과제와 파일을 제공하고 에이전트가 명령을 실행하도록 합니다. 작업별 검증기가 결과를 검사합니다. 일반적인 성공률은 통과한 시도 수를 전체 평가 시도 수로 나눈 값입니다. 4.0은 Harbor 프레임워크를 사용하며, 작업의 에이전트 시간 제한을 8시간으로 설정합니다.
2.1과 4.0을 구분하세요
버전이 바뀌면 문제와 평가 환경이 바뀝니다. 2.1의 90%와 4.0의 60%를 직접 비교해서 성능이 떨어졌다고 판단할 수 없습니다. 같은 버전에서도 하네스, 도구, 자원 제한, 반복 횟수를 확인하세요. 이 사이트는 두 버전의 점수를 별도 열에 표시합니다.
비교 전에 확인할 항목
- 같은 벤치마크 버전과 문제 집합인가요?
- 검색과 코드 실행 같은 도구를 동일하게 제공했나요?
- 추론 강도, 실행 시간, 하네스가 같은가요?
- 정답률, 부분 점수, Elo 중 무엇을 표시하나요?
- 개발사 자체 평가인가요, 독립 평가인가요?