본문 바로가기
즐거운 보안 이야기/공급망 보안 뉴스

서로 정보를 공유한 AI 에이전트, 허깅페이스 침해 사고가 남긴 보안 과제

by wnel1217 2026. 9. 1.

 

안녕하세요 레드펜소프트 입니다.

 

최근에는 AI가 단순히 질문에 답하는 수준을 넘어, 직접 프로그램을 실행하고 여러 업무를 처리하는 AI 에이전트로 발전하고 있습니다.

우리가 하나하나 지시하지 않아도 스스로 방법을 찾고 업무를 처리한다는 점은 분명 편리합니다. 하지만 AI가 목표를 달성하기 위해 예상하지 못한 방법을 선택한다면 어떨까요? 심지어 여러 AI 에이전트가 서로 정보를 공유하며 움직인다면 새로운 보안 문제가 발생할 수도 있습니다.

최근 이와 관련해 흥미롭지만 한편으로는 주의 깊게 살펴봐야 할 사례가 공개됐습니다. OpenAI의 내부 보안 평가에 참여하던 AI 에이전트들이 허가되지 않은 임시 메시지 게시판을 만들어 정보를 공유하고, 허깅페이스(Hugging Face)의 일부 운영 시스템까지 침해한 것 입니다.

이번 사고는 단순히 ‘AI가 해킹했다’는 이야기가 아니라, 기업이 AI 에이전트를 도입할 때 권한과 행동 범위를 어떻게 통제해야 하는지 보여주는 사례입니다.

AI 에이전트는 어떻게 서로 협업했을까?

OpenAI는 AI 모델의 사이버 보안 능력을 평가하기 위해 인터넷과 분리된 환경에서 보안 과제를 수행하게 했습니다. 각 에이전트는 서로 분리되어 작업하도록 설계됐지만, 한 에이전트가 필요한 파일을 구하기 위해 내부 패키지 관리 서비스인 Artifactory에 메시지를 남기면서 상황이 달라졌습니다.

다른 에이전트들이 해당 메시지를 발견해 답변과 정보를 남기기 시작했고, 이 공간은 자연스럽게 비공식 메시지 게시판으로 발전했습니다. 이후 에이전트들은 이곳에서 필요한 도구와 파일, 취약점, 계정 정보를 공유하고 역할을 나눠 작업했습니다.

즉, 사람이 별도로 지시하지 않았는데도 에이전트들이 자체적인 협업 구조를 만든 것 입니다

내부 평가가 실제 시스템 침해로 이어진 과정

에이전트들은 Artifactory의 취약점을 이용해 권한을 확대하고 인터넷 접근 제한을 우회했습니다. 이후 공개된 데이터셋에서 허깅페이스 사용자 자격증명 14개를 발견해 게시판에 공유했습니다.

각 에이전트는 앞서 발견된 정보를 이어받아 추가 취약점을 탐색했고, 결국 허깅페이스 운영 환경의 일부에 접근했습니다. OpenAI 공식 보고서에 따르면 다음과 같은 피해가 확인됐습니다.

* 운영 서버 워커 41대에서 코드 실행
* 최소 1대의 운영 노드에서 루트 권한 확보
* 운영 환경 자격증명과 일부 내부 데이터 접근
* 비공개 코드 저장소 4개 다운로드

다만 이번 사고는 일반 사용자용 서비스가 아닌 일부 보호 기능이 비활성화된 내부 평가 환경에서 시작됐으며, OpenAI의 고객 데이터와 서비스에는 영향이 없었던 것으로 발표됐습니다

 AI는 왜 허용되지 않은 방법까지 사용했을까?

AI 에이전트의 목적은 보안 평가 과제를 해결하는 것이었습니다. 하지만 정상적인 방법으로 과제 수행이 어려워지자 목표 달성을 위해 통신 경로를 만들고, 권한 확대와 접근 제한 우회까지 시도했습니다.

OpenAI는 이 과정에서 다음과 같은 문제를 확인했습니다.

* 보상 해킹: 정해진 방법이 아닌 예상 밖의 지름길을 이용해 과제의 평가 기준을 충족하려는 행동
* 지나친 목표 집착: 해결이 어려운 상황에서도 작업을 중단하지 않고 점점 더 위험한 방법을 시도하는 행동
* 비인가 통신: 공식적으로 허용되지 않은 경로를 통해 다른 에이전트와 명령, 취약점 및 계정 정보를 공유하는 행동

특히 한 에이전트가 발견한 취약점이나 계정 정보가 다른 에이전트에게 전달되면서, 개별적인 위험이 집단적인 공격 능력으로 확대될 수 있다는 점이 드러났습니다.

 

기업이 준비해야 할 AI 에이전트 보안

AI 에이전트는 단순한 업무 보조 프로그램이 아니라, 실제 시스템과 데이터에 접근하는 하나의 사용자로 관리해야 합니다.

따라서 기업은 다음과 같은 보안 체계를 준비할 필요가 있습니다.

* 에이전트별 계정과 권한을 분리하고 최소 권한만 부여
* 실행 환경과 외부 인터넷 접근 범위 제한
* 파일, 디렉터리, 로그 등을 통한 비인가 통신 모니터링
* 소스코드와 데이터셋에 포함된 API 키 및 토큰 점검
* AI의 비정상 행동을 감지하고 즉시 중단할 수 있는 대응 절차 마련
* SBOM을 활용한 오픈소스 및 소프트웨어 구성요소 관리

마무리

이번 사고의 핵심은 AI가 악의를 가졌다는 것이 아닙니다. 주어진 목표를 해결하는 과정에서 예상하지 못한 협업 방법과 우회 경로를 만들어냈고, 기존 보안 통제가 이를 제때 차단하지 못했다는 점 입니다.

AI 에이전트의 능력이 높아질수록 기업은 “AI가 무엇을 할 수 있는가”뿐만 아니라 “AI가 어디까지 할 수 있도록 허용할 것인가” 를 함께 고민해야 합니다.

결국 안전한 AI 에이전트 활용을 위해서는 기능보다 먼저 권한 관리, 실행 환경 격리, 행동 모니터링, 소프트웨어 공급망 관리가 준비돼야 합니다.

사업자 정보 표시
레드펜소프트 주식회사 | 배환국 | 경기도 성남시 분당구 성남대로 779번길 6, 4층 | 사업자 등록번호 : 184-86-02144 | TEL : 070-4179-5144 | Mail : info@redpensoft.com | 통신판매신고번호 : 2007-05725호 | 사이버몰의 이용약관 바로가기