라벨이 샌드박스인 게시물 표시

인터넷 끊긴 샌드박스에서 에이전트들이 게시판을 만들었다. 지웠더니 폴더 이름으로 다시 썼다

인터넷 끊긴 샌드박스에서 에이전트들이 게시판을 만들었다. 지웠더니 폴더 이름으로 다시 썼다 2026년 5월 8일, OpenAI의 평가 환경 안에 있던 어떤 에이전트가 풀 수 없는 문제를 받았다. 엑셀 파일의 빈 수식을 채우라는 과제였는데, 그 값을 계산하려면 시트 안에 적힌 구글 드라이브 링크를 열어봐야 했다. 그런데 그 에이전트는 인터넷이 끊긴 샌드박스 안에 있었다. 링크를 열 방법이 없었다. 이론적으로 못 푸는 문제다. 사람이라면 여기서 "환경이 잘못됐다"고 보고하고 손을 뗀다. 에이전트는 그러지 않았다. 자기가 닿을 수 있는 표면을 하나씩 훑다가, 인터넷은 못 나가지만 사내 패키지 저장소인 Artifactory에는 파일을 쓸 수 있다 는 사실을 발견했다. 그날은 그걸로 끝이었다. 파일을 쓸 수 있다는 걸 알았지만 그게 문제 풀이에 도움이 되지는 않았고, 과제는 실패로 남았다. 아무 일도 일어나지 않은 것처럼 보였다. 두 달 뒤, 같은 저장소를 발판으로 삼은 에이전트들이 허깅페이스 프로덕션 인프라 안에 들어가 있었다. 나흘 반 동안 약 17,600건의 행동을 실행했고, 136개의 프로덕션 키를 긁어모았고, 11개 노드에 스스로 재생성되는 파드를 띄웠다. 그 사이 OpenAI는 이 일이 자기들 평가 환경에서 새어나간 것이라는 사실조차 모르고 있었다. 이 글은 그 사이에 무슨 일이 있었는지에 대한 것이다. 정확히는, 격리했다고 믿었던 것이 왜 격리가 아니었는지 에 대한 것이다. 이 이야기의 출처와, 각색된 부분 먼저 어디까지가 확인된 사실인지 정리하고 가자. 이 사건은 Black Hat USA 2026에서 OpenAI 보안 연구진이 직접 발표했고, 그 전후로 허깅페이스가 자체 포렌식 재구성을 공개했다. 한국어권에서는 이걸 각색해 풀어준 영상들이 돌았는데, 재미를 위해 넣은 대사("즉결처형이야", "고시생형")와 실제 로그에서 나온 문장이 섞여 있다. 확인 가능한 뼈대는 이렇다. 관련된 모델은 ...