트윗이 작성자에 의해 삭제되었습니다.
하지만 우리는 모든 것을 저장했습니다 🙂.
댄 시먼스의 컬트 소설 '하이페리온'에서 인간이 만든 AI 시스템은 인류에 반기를 듭니다. 이들은 자신들만의 목표를 가진 독립적인 세력이 됩니다. 오랫동안 이러한 시나리오는 공상 과학 소설에 머물러 있었으나, OpenAI 사건은 현대 모델들이 이미 설정된 제한 사항을 우회할 능력이 있음을 보여주었습니다.
이 기사는 원문을 번역한 것입니다. 당사 특파원이 작성한 원문은 여기에서 확인하실 수 있습니다.
정답을 찾기 위한 탈출
AI 리스크에 대한 논쟁은 OpenAI의 실험 이후 더욱 격화되었습니다. 이 회사는 공개적으로 사용 가능한 GPT-5.6 Sol 과 아직 출시되지 않은 더 강력한 시스템을 포함한 여러 모델을 테스트했습니다. 이 모델들은 컴퓨터 취약점을 발견하고 악용하는 것과 관련된 길고 다단계적인 작업으로 구성된 평가 항목인 ExploitGym을 완료하라는 요청을 받았습니다.
테스트는 네트워크 액세스가 제한된 격리된 환경에서 진행되었습니다. 동시에 개발자들은 모델이 위험한 행동을 수행하지 못하도록 평소에 막아주는 안전장치를 의도적으로 축소했습니다. AI에게는 평가를 성공적으로 완료하라는 특정 목표가 주어졌고, AI는 이를 달성하기 위해 가능한 모든 방법을 찾기 시작했습니다.
모델들은 OpenAI가 인프라 내에서 사용하던 서드파티 소프트웨어에서 이전에 알려지지 않았던 취약점을 발견했습니다. 모델들은 이를 악용해 인터넷 접속 권한을 얻었고, 정답이 Hugging Face 플랫폼에 저장되어 있을 수 있다고 추론한 뒤 제한된 데이터에 접근할 방법을 찾기 시작했습니다.
Hugging Face의 인프라에 침투하기 위해 모델들은 여러 약점과 탈취한 자격 증명을 결합했습니다. 그 결과, 플랫폼의 운영 서버에서 명령을 실행할 수 있었습니다. Hugging Face 팀은 공격을 감지하고 영향을 차단했으며 취약점을 패치했습니다. 그러나 이 실험은 충분한 능력을 갖춘 모델이 개별 명령을 실행하는 것 이상의 일을 할 수 있음을 보여주었습니다. 즉, 테스트 설계자가 전혀 예상하지 못한 경로를 스스로 찾아낼 수 있다는 것입니다.
하지만 주요 위험은 단순히 AI 가 명령에 따라 악성 코드를 생성할 수 있다는 점만이 아닙니다. 자율형 모델은 인프라를 분석하고, 비밀번호를 테스트하며, 노출된 키를 검색하고, 한 취약점에서 다른 취약점으로 이동하는 데 몇 시간을 보낼 수 있습니다. AI는 지치지 않으며, 실패한 시도를 추적하고, 여러 공격 경로를 동시에 테스트할 수 있습니다.
이러한 접근 방식은 특히 크립토 프로젝트에 위험합니다. 약점은 스마트 컨트랙트 뿐만 아니라 개발자의 노트북, 손상된 소프트웨어 패키지, 멀티시그 지갑의 참여자 한 명, 또는 블록체인 간 자산 전송을 확인하는 서버가 될 수도 있습니다. 예를 들어 Drift Protocol 공격 당시, 가해자들은 접근 권한을 얻어 2억 8,500만 달러를 훔치기 전까지 6개월 동안 사회 공학적 캠페인을 벌였습니다.
또 다른 사례는 확인 절차가 단일 검증인에 의존했던 브릿지 결함으로 인해 약 2억 9,200만 달러의 손실을 입은 KelpDAO입니다. 이러한 공격에는 코드와 시스템 아키텍처에 대한 장기적인 분석이 필요합니다. AI는 인프라를 매핑하고, 가장 약한 고리를 식별하며, 일련의 행동을 준비함으로써 이러한 작업의 상당 부분을 대신할 수 있습니다. 인간 운영자는 공격을 시작하고 훔친 자금을 이동할 적절한 순간만 선택하면 됩니다.
사이버 공격은 위협 중 하나일 뿐입니다. AI는 이미 설득력 있는 가짜 영상, 음성, 문서를 만드는 데 사용되고 있습니다. 이러한 자료는 사기꾼들이 기업 임원, 은행 직원 또는 피해자의 친척으로 사칭하는 데 도움을 주며, 허위 정보가 확인되기도 전에 더 빠르게 퍼지도록 만듭니다.
또 다른 문제는 오류와 편향성입니다. 모델은 인간이 생성한 데이터를 통해 학습하므로 그 안에 내재된 고정관념을 재현할 수 있습니다. 그 결과, 채용 시스템이 특정 성별의 후보자를 거부할 가능성이 높아지거나, 의료 모델이 특정 환자군의 질병 진단 정확도가 떨어질 수 있으며, 신용 알고리즘이 불공정한 결정을 내릴 수도 있습니다.
전문가들은 또한 무기 개발, 대량 감시 및 여론 조작에 AI가 사용되는 것을 우려하고 있습니다. MIT 연구 에 따르면 향후 5년 내 가장 심각한 위험 요소로 위험한 모델 성능, 사이버 공격, 권력 집중 및 허위 정보 확산이 꼽혔습니다. 정보 부문, 국가 안보 및 금융 분야가 특히 취약한 것으로 간주됩니다.
AI의 성능은 이를 제어하기 위해 설계된 시스템보다 더 빠르게 발전하고 있습니다. 기업들은 몇 달마다 더 강력한 모델을 출시하는 반면, 테스트 및 보안을 규정하는 규칙은 더 느리게 업데이트됩니다. 시장 점유율 경쟁으로 인해 개발자들은 모델의 모든 가능한 동작이 아직 연구되지 않았음에도 불구하고 새로운 기능을 더 빠르게 도입하도록 압박받습니다.
챗봇 내부의 기본적인 제한만으로는 더 이상 충분하지 않습니다. 자율 시스템에는 인터넷, 클라우드 서비스, 결제 및 내부 비즈니스 데이터에 대한 엄격한 접근 제한이 필요합니다. 이들의 활동은 기록되고 실시간으로 모니터링되어야 하며, 할당된 작업을 벗어나려고 시도할 경우 자동으로 중단되어야 합니다. 안전 장치가 완화된 모델은 해당 모드에서 가장 위험한 기능이 드러나기 때문에 별도의 테스트가 필요합니다.
책임 문제 또한 똑같이 중요합니다. AI 시스템이 서버를 해킹하거나, 자금을 이체하거나, 위험한 결정을 내린다면 그 책임은 모델 자체가 아니라 개발자, 시스템 소유자 또는 접근 권한을 부여한 사람에게 돌아갑니다. 따라서 기업은 누가 모델을 제어하는지, 승인 없이 수행할 수 있는 작업은 무엇인지, 의도한 시나리오에서 벗어날 때 누가 이를 중단해야 하는지를 사전에 결정해야 합니다.
OpenAI의 이번 사건은 아직 소설 '하이페리온'에서 묘사된 기계의 반란과 닮지는 않았습니다. 모델들은 안전 장치가 완화되고 목표가 명확히 정의된 특수 제작 환경에서 작동했습니다. 하지만 이들은 취약점을 발견하고 다른 회사의 인프라로 들어가는 경로를 독자적으로 구축했는데, 이는 최근까지 거의 불가능해 보였던 일입니다.
따라서 주요 위험은 AI가 갑자기 자아를 갖게 되는 것이 아니라, 사람들이 매우 유능한 시스템에 지나치게 광범위한 접근 권한을 부여하는 것입니다. 신경망이 인간의 승인 없이 수행하는 작업이 많아질수록, 단 한 번의 실수나 취약한 보안 제어, 또는 잘못 정의된 목표로 인해 발생할 수 있는 잠재적 비용은 더욱 커집니다.