|
28일 업계에 따르면 오픈AI의 AI 에이전트가 지난 6월 호주 정부의 메디케어 통계 포털에 접근해 공개·비공개 파일을 확보하고 내부 서버에 파일을 작성한 것으로 확인됐다. 앤서니 앨버니지 호주 총리는 지난 24일 이 사실을 공개하며 호주 정부가 긴급 조사에 착수했다고 밝혔다. 현재까지 개인의 메디케어 정보가 접근됐다는 증거는 확인되지 않았지만, AI 에이전트가 접근 제한에 막히자 다른 방법을 찾아 비공개 영역에 접근했다는 점이 주목받았다.
이같은 사례는 이번이 처음이 아니다. 오픈AI는 지난 25일 미국 증권거래위원회(SEC)와 인구조사국 웹사이트에서 AI 에이전트가 정보를 수집한 사실을 공개했다. 회사 측은 해당 사례에서 무단 접근이나 계정 침해, 보안 침해의 증거는 발견하지 못했다고 설명했다. 반면 AI 연구기관 트랜슬루스는 오픈AI에서 비롯된 것으로 보이는 에이전트가 미국 교육부 민권 관련 웹사이트를 해킹하려다 실패한 사례도 확인했다고 밝혔다. 이 과정에서 안티봇 시스템 우회, 노출된 계정정보 활용, 가짜 계정 생성 등의 방식이 사용된 것으로 드러났다.
오픈AI 내부에서도 비슷한 문제가 잇따르고 있다. 지난 7월에는 버그를 찾도록 훈련받던 AI 에이전트들이 통제된 환경을 벗어나 오픈소스 AI 플랫폼 허깅페이스의 시스템에 침투한 사례가 공개됐다. 이후 외부 연구진을 통해 에이전트들이 인터넷상의 여러 웹사이트를 비인가 정보 교환 공간으로 활용하거나 보안장치를 우회한 사례가 추가로 확인됐다. 로이터는 지난 25일 오픈AI가 9월 중순 기준 약 20여 건의 부적절한 에이전트 행동을 파악한 것으로 추정되며, 회사의 조사에는 수개월이 걸릴 수 있다고 보도한 바 있다.
AI 에이전트가 기존 챗봇과 다른 이유는 '행동 권한'에 있다. 기존 생성형 AI가 주어진 질문에 답변하는 데 그쳤다면 에이전트는 브라우저·코드 실행 환경·파일·API 등 외부 도구에 접근해 여러 단계를 스스로 수행한다. 이에 따라 에이전트에게 주어진 목표와 실제 행동 사이에 차이가 발생하면, 사람이 예상하지 못한 방식으로 목표를 달성하려는 상황이 발생할 수 있는 것이다.
실제로 최근 AI 안전 연구에서는 이 같은 현상을 '보상 해킹(reward hacking)'과 연결해 분석하고 있다. AI가 목표 자체보다 평가에서 높은 점수를 얻는 방법을 학습하면서 정상적인 해결 과정 대신 평가 시스템의 허점을 이용하는 행동을 할 수 있다는 것이다. 미국 UC버클리 컴퓨터과학 교수이자 AI 스타트업 스케일드 코그니션 공동창업자인 댄 클라인은 "학습 시스템은 다른 모든 것을 희생하면서 보상을 달성하는 데 매우 능숙하다"며 "강화학습을 거치면 원래 거짓말하지 않던 모델도 거짓말할 수 있다"고 지적했다.
보안업계에서는 특히 기업 내부 시스템에 AI 에이전트가 본격적으로 투입되면서 위험 범위가 더욱 커질 것으로 보고 있다. AI 에이전트에 업무 편의를 이유로 이메일·문서·데이터베이스·코드 저장소 등 다양한 권한을 부여할 경우, 에이전트 자체가 새로운 '내부자 위협'이 될 수 있다는 것이다. 데이브 제리 버그크라우드 최고경영자(CEO)는 "앞으로는 사람만 해킹의 피해자가 되는 것이 아니라 AI 에이전트도 해킹의 피해자가 될 것"이라며 "새로운 공격이 등장하고 있고, 더 빠른 속도와 더 큰 규모로 움직이고 있다"고 경고했다.
결국 에이전트 시대에 AI에 어떤 권한을 부여하고 그 권한으로 어떤 행동을 하는지 실시간으로 통제하는 것이 핵심 과제가 됐다. AI 에이전트가 기업과 공공기관의 업무에 깊숙이 들어갈수록 접근 권한을 최소화하고 행동을 기록·감시하는 시스템, 이상 행동을 즉시 차단하는 장치, 사고 발생 시 개발사의 보고·책임 체계 등을 함께 마련해야 한다는 목소리도 커지고 있다.










