Hacker NewsComparison of AI Models across Intelligence, Performance, and Price앤스로픽의 신형 클로드 Opus 5가 인공지능 벤치마크 리더보드에서 1위를 차지했음. 하지만 막상 실무에 쓰는 개발자들 사이에서는 성능보다 지나친 검열 기능 때문에 불편하다는 불만이 먼저 나옴.
개발 관련 작업을 하다가 조금만 민감한 단어가 들어가도 곧바로 안전 장치에 걸려 차단되거나 하위 모델로 강등당한다는 지적이 이어짐. 웹어셈블리 코드를 작성하거나 단순한 보안 관련 대화를 할 때도 거짓 양성 판정으로 막힌다는 의견이 있었음.
생물학이나 화학 관련 주제는 아예 대화 자체가 불가능할 정도로 엄격하다는 경험담도 나옴. 세포나 미생물 같은 일상적인 단어나 논문 주제를 꺼내기만 해도 테러리스트나 위험 인물로 오인받아 세션 크레딧을 날렸다는 개발자도 있었음.
반면 다른 모델들은 상대적으로 유연하게 대처한다는 비교도 나옴. 경쟁사인 오픈에이아이의 코덱스는 검열에 걸리면 잠시 기다리거나 추가 확인을 거쳐 진행할 수 있어 훨씬 예측 가능하다고 봄.
이런 과도한 자체 검열이 결국 기업 투자자들에게 보여주기 위한 마케팅용 조치일 뿐 실제 고객의 생산성은 떨어뜨린다는 비판이 나옴. 구독을 해지하거나 오픈소스 모델로 갈아타겠다는 개발자들도 확인됨.
번역 및 요약 과정에서 일부 내용에 오류가 있을 수 있음.













해외반응 19
수집된 해외 반응
오픈에이아이의 지피티 5.6이 앤스로픽 동급 모델들보다 전반적으로 토큰 효율성이 더 뛰어남.
검열을 피하려고 눈치 봐야 하는 상황에서 1위라는 타이틀은 별로 유용하지 않음. 신뢰도가 벤치마크 점수보다 중요함.
앤스로픽이 일상적인 작업을 방해하는 조치를 거듭하자 2주 전에 구독을 취소함.