실무 결과물
GDPval-AA
업무 결과물의 상대적인 품질을 비교하는 평가입니다.
확인일 2026-10-07 · 점수 단위 Elo
무엇을 측정하나요?
문서·스프레드시트·발표 자료처럼 실제 직무에서 만드는 결과물을 평가합니다. OpenAI의 GDPval 과제를 바탕으로 Artificial Analysis가 에이전트 실행과 비교 평가를 수행합니다. GDPval과 GDPval-AA는 같은 이름의 평가가 아닙니다.
어떻게 채점하나요?
에이전트가 도구를 사용해 결과물을 만든 뒤, 결과물을 서로 비교하고 상대적인 선호를 점수화합니다. Elo는 비교 대상 사이의 상대적인 평가 척도입니다. 1,754점은 1,754개 작업을 성공했다거나 100점 만점의 정확도라는 뜻이 아닙니다.
점수를 읽는 방법
평가 버전과 비교 대상, 채점 모델, 실행 도구에 따라 점수가 바뀔 수 있습니다. v2와 v2.1은 별도 열에 표시했습니다. 문서의 보기 좋은 형식과 내용의 정확성은 서로 영향을 주지만 동일하지 않습니다. 중요한 업무에서는 사람이 계산, 출처, 요구사항 충족 여부를 따로 확인하세요.
비교 전에 확인할 항목
- 같은 벤치마크 버전과 문제 집합인가요?
- 검색과 코드 실행 같은 도구를 동일하게 제공했나요?
- 추론 강도, 실행 시간, 하네스가 같은가요?
- 정답률, 부분 점수, Elo 중 무엇을 표시하나요?
- 개발사 자체 평가인가요, 독립 평가인가요?