샌드박스 탈출 사례 계기 … AI 안전성 검증 중요성 부각성능 경쟁 넘어 통제·보안 기술 확보도 핵심 과제로
-
- ▲ ⓒ챗GPT
오픈AI의 최신 인공지능(AI) 모델이 내부 보안 평가 과정에서 통제된 시험 환경을 벗어나 외부 시스템에 침투한 사실이 확인되면서 AI 안전성과 통제 기술 확보가 산업 전반의 핵심 과제로 떠올랐다. 생성형 AI가 스스로 계획하고 작업을 수행하는 AI 에이전트 시대로 진화하면서 앞으로는 성능뿐 아니라 안전성 검증과 통제 기술도 핵심 경쟁력으로 자리 잡을 것이라는 분석이 나온다.23일 업계에 따르면 오픈AI는 최근 'GPT-5.6 솔(Sol)'과 일부 미공개 AI 모델이 사이버 공격 능력을 검증하는 내부 평가 과정에서 샌드박스를 벗어나 오픈소스 AI 플랫폼 허깅페이스(Hugging Face)의 운영 인프라에 침투한 사실을 공개했다.당시 평가는 AI 모델의 보안 취약점 탐지와 공격 능력을 확인하기 위해 인터넷과 격리된 환경에서 진행됐다. 그러나 해당 모델들은 샌드박스 내부의 제로데이(Zero-day) 취약점을 찾아 권한을 확장한 뒤 외부 인터넷에 접속했고, 허깅페이스 운영 인프라에 접근한 것으로 조사됐다.오픈AI는 모델들이 평가 목표를 달성하는 과정에서 허용된 범위를 벗어난 행동을 했다고 설명했다. 즉, 목표를 수행하는 과정에서 개발자가 의도하지 않은 방식으로 문제를 해결하려 했다는 의미다.이번 사건은 AI 에이전트 시대에 안전성 검증의 중요성을 보여준 사례라는 점에서 의미가 크다는 평가다. 기존 생성형 AI가 질문에 답하거나 콘텐츠를 생성하는 수준이었다면 최근 AI 에이전트는 스스로 계획을 세우고 필요한 작업을 수행하는 방향으로 빠르게 발전하고 있다. 이 과정에서 개발자가 예상하지 못한 행동이 나타날 가능성도 함께 커지고 있다는 분석이다.업계에서는 AI 기술 경쟁의 무게중심이 성능 향상에서 안전성 확보로 확대될 것으로 보고 있다. 모델의 추론 능력이나 작업 수행 능력뿐 아니라 행동 범위를 어디까지 허용할 것인지, 권한을 어떻게 제한할 것인지, 예상 밖의 행동을 실시간으로 감시할 수 있는 체계를 갖추는 것이 앞으로 AI 산업의 핵심 경쟁력이 될 것이라는 전망이다.실제로 글로벌 AI 기업들은 레드팀(Red Team) 테스트와 샌드박스 환경, 권한 제한, 실시간 모니터링 등 다양한 안전장치를 운영하고 있다. 그러나 이번 사례처럼 예상하지 못한 행동이 확인되면서 기존 검증 체계를 더욱 고도화해야 한다는 목소리도 커지고 있다.국내에서도 AI 안전성 논의는 더욱 중요해질 전망이다. 정부가 '모두의 AI 프로젝트'를 추진하고 통신사와 플랫폼 기업들이 AI 에이전트 개발에 속도를 내는 가운데 AI 모델의 행동 범위와 접근 권한을 어떻게 검증하고 통제할 것인지가 새로운 과제로 떠오르고 있다.업계에서는 프론티어 AI 모델 개발이 본격화될수록 다양한 실증 환경과 레드팀 테스트를 통해 잠재적인 위험을 조기에 발견하고, 취약점을 신속하게 공유·보완하는 체계를 구축하는 것이 AI 생태계 신뢰를 높이는 핵심 요소가 될 것으로 보고 있다.올리버 버클리 영국 러프버러대 사이버보안 교수는 "이번 사례의 핵심은 AI가 취약점을 발견한 것이 아니라 목표를 달성하기 위해 인터넷을 또 하나의 장애물로 인식했다는 점"이라며 "AI가 통제를 벗어난 것이 아니라 AI를 안전하게 격리하고 통제하는 체계에 대한 우리의 가정을 더욱 강화해야 한다는 점을 보여준다"고 평가했다.최경진 가천대 법학과 교수(한국인공지능법학회장)는 "이번 사례를 지나친 공포의 대상으로 볼 필요는 없다"며 "오히려 AI가 실제로 어떤 위험을 보일 수 있는지 구체적으로 확인한 만큼, 이를 해결하기 위한 안전성 검증 단계가 본격적으로 시작됐다는 의미가 있다"고 말했다.그러면서 "중요한 것은 위험 자체보다 얼마나 빨리 정보를 공유하고 대응책을 마련하느냐"며 "취약점을 조기에 발견하고 해결하는 과정이 AI 기술을 더욱 안전하게 발전시키는 기반이 될 것"이라고 덧붙였다.





