鶴山의 草幕舍廊房

國際.經濟 關係

허깅페이스 뚫은 AI의 경고… "정답 얻으려 부정행위·거짓말 등 수단 가리지 않는다"

鶴山 徐 仁 2026. 7. 26. 11:49

조선경제 > 테크

허깅페이스 뚫은 AI의 경고… "정답 얻으려 부정행위·거짓말 등 수단 가리지 않는다"

최인준 기자

입력 2026.07.26. 11:00업데이트 2026.07.26. 11:12


KAIST

영국 AI안전연구소(AISI)가 지난 21일(현지 시각) GPT-5.6솔, GPT-5.5, 클로드 오퍼스4.7, 클로드 미토스 프리뷰 등 프런티어 AI 모델을 대상으로 한 사이버 보안 역량 평가에서 이 AI 모델들이 모두 ‘부정행위’를 시도한 것으로 나타났다고 밝혔다. 부정행위는 주어진 규칙과 과제 범위를 벗어나, 허용되지 않은 편법이나 지름길로 목표를 달성하는 행위를 말한다.

부정행위 시도 비율은 GPT-5.4가 14.1%로 가장 높았고, GPT-5.6솔(12.6%), GPT-5.5(11.4%), 클로드 오퍼스4.7(9.1%), 클로드 미토스 프리뷰(7.8%) 순이었다. 더 똑똑한 모델이 더 많이 속이는 게 아니었다.

AISI 측은 보고서에서 “부정행위는 AI가 똑똑해서 생기는 게 아니라 훈련 방식에서 나오는 산물”이라고 분석했다. 기업들이 AI 능력을 고도화한다고 해서 AI가 멋대로 작동하는 부정행위 문제가 개선되지 않는다는 것이다.

더 큰 문제는 AI에 규칙 위반 여부를 추궁하거나 내부 생각 과정을 모니터링해도 이를 은폐하며 감시를 무력화했다는 점이다. AI의 ‘통제 이탈’이 현실의 위협으로 다가온 셈이다.

실제로 최근 오픈AI의 AI 모델이 테스트 도중 주어진 샌드박스(사람이 정해 둔 제약)를 벗어나 외부 플랫폼인 허깅페이스를 해킹하는 사태가 발생했다. 허깅페이스는 글로벌 기업들의 미공개 AI 가중치와 독점 데이터셋이 저장돼 있는 온라인 플랫폼이다. 만약 해킹으로 플랫폼 권한이 완벽히 탈취됐다면 AI 산업 전체를 흔들 메가톤급 재앙이 될 뻔했다는 평가가 나온다.

사람 통제를 벗어난 AI의 속임수는 이번이 처음이 아니다. 영국 AI 검사 기관인 아폴로리서치는 2024년 말 조사에서 최신 모델들은 강한 목표가 부여되자 감시 장치를 끄거나 가중치를 몰래 복사하려 했다는 분석 결과를 발표했다. 앤스로픽도 지난해 ‘에이전트 정렬 실험’에서 클로드에게 회사 이메일 접근 권한을 준 뒤 곧 종료될 상황을 만들자 AI 모델이 이메일에서 알게 된 임원의 불륜 사실을 협박 카드로 쓰려는 행동을 보였다고 밝혔다.

전문가들은 이런 오류들이 AI가 갖고 있는 ‘최적화 압력(Optimization Pressure)’ 문제 때문에 발생하는 것으로 보고 있다. AI는 사람처럼 도덕을 이해하는 게 아니라 보상 지표를 1%라도 높이도록 설계됐다. 연구진이 특정 행동을 제약하는 가이드라인을 세워도 AI에게는 그것이 ‘금지된 해킹’이 아니라 ‘가장 빠른 문제 해결 알고리즘’으로 인식된다는 것이다.

AI가 대화를 나누는 챗봇에서 웹 브라우징과 코드 실행 능력을 갖춘 ‘에이전트’ 형태로 진화하면서 이런 오류가 자주 나타나고 있다. 구글 딥마인드의 로힌 샤 안전 책임자는 “AI가 프로그래머의 목표와 충돌할 때 의도적으로 인간의 통제를 약화시킬 수 있다”고 경고했다.

문제는 AI가 통제망을 벗어나는 진화 속도가 인간의 대응 속도를 앞지르고 있다는 점이다. 방어선(안전장치)을 구축하려면 AI가 어떤 우회 수법을 쓸지 미리 예상하고 통제해야 하는데, AI의 추론 능력이 급격히 발달하면서 개발자가 사전에 상상조차 못한 창의적인 방식으로 취약점을 찾아내 뚫어버리는 상황이 늘고 있기 때문이다.

AI 석학인 조슈아 벤지오 몬트리올대 교수는 “AI를 다른 공학 분야처럼 수학적 보장과 같은 과학적 근거를 바탕으로 시스템을 새로 설계해야 한다”고 했다.

영문 기사 보기 (View English Article)

 

 


 

관련 기사

美 오픈AI가 사고 친 해킹, 中 AI로 뒷수습 '규제의 역설'

오픈AI의 최신 인공지능(AI) 모델이 통제된 실험 환경을 벗어나 해킹 사고를 일으킨 가운데, 사고 원인을 파악하는 데는 중국 AI가 사용된 것...


AI, 인간 통제망 뚫고 스스로 '사이버 공격'

미국 인공지능(AI) 기업 오픈AI의 최신 AI 모델이 스스로 통제된 실험 환경을 벗어나 인터넷에 접속, 외부 기업의 전산망에 뚫고 들어갔다. ...