소프트웨어 개발
DeepSWE v1.1
실제 코드 저장소에서 긴 개발 작업을 끝내는 능력을 평가합니다.
확인일 2026-10-07 · 점수 단위 %
무엇을 측정하나요?
여러 파일을 함께 수정해야 하는 개발 작업을 평가합니다. 모델은 작업 지시와 격리된 저장소 환경을 받고 코드를 탐색하고 수정합니다. 짧은 코드 문제의 정답률과는 측정 대상이 다릅니다.
어떻게 채점하나요?
v1.1은 113개 작업을 포함합니다. 에이전트가 만든 변경을 깨끗한 검증 환경에 적용하고, 공개하지 않은 테스트로 요구한 동작을 검사합니다. 기준 코드와 똑같이 작성했는지보다 실제 동작이 맞는지가 중요합니다. pass@1은 한 번의 시도가 통과할 확률을 나타냅니다. 여러 독립 시도의 결과를 평균할 수 있으며, 여러 답 중 하나만 맞으면 통과하는 pass@k와 다릅니다.
점수를 읽는 방법
같은 모델도 실행 도구 묶음인 하네스, 추론 강도, 시간 제한에 따라 점수가 달라집니다. Kimi K3의 공식 발표는 Kimi Code에서 67.5%, mini-SWE-agent에서 67.3%를 구분합니다. 버전과 하네스를 함께 확인하세요. 테스트에 포함하지 않은 품질이나 유지보수성까지 보장하는 수치는 아닙니다.
비교 전에 확인할 항목
- 같은 벤치마크 버전과 문제 집합인가요?
- 검색과 코드 실행 같은 도구를 동일하게 제공했나요?
- 추론 강도, 실행 시간, 하네스가 같은가요?
- 정답률, 부분 점수, Elo 중 무엇을 표시하나요?
- 개발사 자체 평가인가요, 독립 평가인가요?