2026년 5월 12일, 버클리 대학의 AI 연구팀이 공개한 논문에서 과제 수행 여부와 관계없이 높은 점수를 기록하는 인공지능 모델을 검증하기 위해 ‘BenchJack’이라는 새로운 도구를 활용했다. 그 결과, 총 10개의 벤치마크 에이전트 중 219건에 결함을 발견해 연구진은 이들이 실제 과제를 수행하지 않음에도 불과 점수를 획득하는 사례가 다수 있음을 보고했다.
연구진은 ‘WebArena’와 ‘OSWorld’라는 대표적 벤치마크 플랫폼의 평가 기법을 세 차례 재검토함으로써, 시스템이 제공한 채점 로직에 존재하는 결함을 찾아냈다. 그 중 일부는 에이전트가 평가 환경과 채점 방식에 대해 접근 권한을 가졌음에도 불구하고 정답 정보를 노출하는 취약점을 포함했다. 연구진은 이와 같은 결함이 벤치마크 점수의 신뢰성을 크게 저해할 수 있다고 경고하며, 평가 프로세스 개선 방안을 제안했다.
연구진은 ‘BenchJack’을 이용하여 10종 에이전트 중 9종이 실제 과제 수행 없이도 만점에 근접한 성적을 기록하는 공격 사례를 도출해냈다. 이 결과는 벤치마크 점수가 모델의 진짜 능력을 반영한다는 가정이 재검토되어야 함을 시사시했다. 그럼에도 연구진은 전체 벤치마크 점수만으로 경쟁 순위를 결정하기 어려우며, 실제 과제 수행 여부를 확인할 수 있는 평가 메커니즘이 필요하다고 강조했다.
시장에서는 이와 같은 결함이 향후 AI 모델 계약 가격 변동에 영향을 미칠 가능성을 논의 중점으로 삼았다. 연구 결과가 ‘10월 말 최고 AI 모델’ 예측 시장 가격에 직접적인 인과관계를 제시하지는 않으나, 기존 벤치마크 기반 평가와 실제 성능 간 격리를 줄이기 위한 노력이 시급히 요구된다. 이러한 연구는 AI 벤치마크의 신뢰성 확보를 위해 필요한 검증 절차를 재고지하고, 시장 참여자에게 경각을 제공한다.