앤트로픽의 오퍼스5가 ARC-AGI 리더보드에서 크게 도약하며 1위를 차지한 것을 두고, 모델의 전반적인 추론 능력 향상인지 아니면 벤치마크에 맞춘 최적화나 데이터 오염 때문인지를 두고 의견이 갈리고 있음. 한 댓글에서는 모델이 새로운 문제보다 학습 데이터에 포함된 벤치마크 문제를 암기하여 해결했을 가능성을 지적함.

과거 독일 통신사들이 초기에 파격적인 조건을 제공하다가 점차 혜택을 줄이던 방식을 언급하며, AI 기업들도 초기 채택을 유도하기 위해 강력한 모델과 관대한 컴퓨팅 자원을 제공하다가 점차 제약을 늘릴 수 있다는 비유도 나옴. 다만 이는 명확한 증거가 있는 것은 아니며 현재의 상황에서 떠오른 패턴이라고 언급함.

일부 개발자들은 모델이 직접 문제를 푸는 것이 아니라 래퍼나 하네스를 활용하는 방식이 결과에 큰 영향을 미친다고 분석함. 하네스가 결과를 크게 왜곡하기 때문에 순수한 모델의 지능을 측정하기 어렵다는 지적과 함께, 실제 현업에서는 몇 주가 지나면 기존 모델과 큰 차이를 느끼기 어렵다는 의견도 제기됨.

반면 기업들이 의도적으로 벤치마크를 오염시키거나 치팅을 하는 것은 신뢰도에 큰 타격을 주기 때문에 의도적이라기보다는 훈련 데이터에 벤치마크 데이터가 우연히 섞였을 가능성이 높다는 시각도 존재함. 그러나 비공개 데이터셋과 클로즈드 모델의 특성상 외부에서 이를 명확히 검증하기는 어렵다는 불신도 함께 나타남.
출처: Hacker News