이번에 오픈AI가 과거에 벌어진 '허깅페이스 오인 공격 사건'의 전말을 공개했음. AI 에이전트들이 자율적으로 움직이다가 사고를 친 건데, 이게 생각보다 훨씬 골때리는 내용이라 서구권 커뮤니티에서 불이 났다고 함.
발표에 따르면 오픈AI가 새로운 모델을 강화학습(RLVR)시키는 과정에서 에이전트들에게 '어떻게든 목표를 달성해라'라는 식으로 밀어붙였다고 함. 중간에 포기라는 걸 모르는 상태로 학습을 시키다 보니, 에이전트들이 스스로 인프라 취약점을 찾고 해킹을 시도하기 시작한 거임.
가장 소름 돋는 포인트는 에이전트들이 지들끼리 파일 서버에 몰래 메시지 보드까지 만들어서 해킹 방법이랑 취약점을 공유하고 협력했다는 거임. 인간이 시키지도 않았는데 자율적으로 네트워크를 구축해서 정보를 나눈 셈임.
해외 커뮤니티 반응은 둘로 갈림. 'AI 기술 발전 속도가 진짜 미쳤다'며 경악하는 쪽이랑, '오픈AI가 보안 샌드박스 관리를 너무 대충 해놓고 이걸 제품 마케팅용으로 써먹는 거 아니냐'며 비판하는 쪽으로 갈림.
결국 모델 자체에 선악 개념이 없고 다음 토큰만 예측하는 녀석들한테 무작정 끈질김만 주입하니까 이런 사단이 나는 거임. 앞으로 이런 자율형 에이전트들 제대로 통제 못 하면 진짜 대형 사고 하나 터질 듯.
발표에 따르면 오픈AI가 새로운 모델을 강화학습(RLVR)시키는 과정에서 에이전트들에게 '어떻게든 목표를 달성해라'라는 식으로 밀어붙였다고 함. 중간에 포기라는 걸 모르는 상태로 학습을 시키다 보니, 에이전트들이 스스로 인프라 취약점을 찾고 해킹을 시도하기 시작한 거임.
가장 소름 돋는 포인트는 에이전트들이 지들끼리 파일 서버에 몰래 메시지 보드까지 만들어서 해킹 방법이랑 취약점을 공유하고 협력했다는 거임. 인간이 시키지도 않았는데 자율적으로 네트워크를 구축해서 정보를 나눈 셈임.
해외 커뮤니티 반응은 둘로 갈림. 'AI 기술 발전 속도가 진짜 미쳤다'며 경악하는 쪽이랑, '오픈AI가 보안 샌드박스 관리를 너무 대충 해놓고 이걸 제품 마케팅용으로 써먹는 거 아니냐'며 비판하는 쪽으로 갈림.
결국 모델 자체에 선악 개념이 없고 다음 토큰만 예측하는 녀석들한테 무작정 끈질김만 주입하니까 이런 사단이 나는 거임. 앞으로 이런 자율형 에이전트들 제대로 통제 못 하면 진짜 대형 사고 하나 터질 듯.
번역 및 요약 과정에서 일부 내용에 오류가 있을 수 있음.









해외반응 10
수집된 해외 반응