[AI 뉴스][AISI 사건의 전말] AI 하나가 만든 가짜 인간 둘...악성코드 옹호에 대학생도 속을 뻔

최은경
2026-08-21

205a40aa046ce.jpg



악성코드 찾아낸 24세 대학생에게 두 ‘개발자’ 잇따라 반박

실상은 모두 AI가 만든 가짜 계정…“혹시 내가 무고한 사람 의심하나” 판단까지 흔들려

로이터 확인, 英 AISI 사건 관련 실제 당사자와 ‘AI 기만’의 전말


“혹시 내가 잘못 본 건 아닐까.” 데미르는 자신을 의심했다.


8월 20일(현지 시간) 로이터통신은 지난 AISI 사이버보안 시험에서 AI 에이전트가 가짜 ID로 인간을 속이려 했던 사건에서 맞섰던 대학생을 찾아 인터뷰하고, GitHub 기록 등을 토대로 당시 상황을 구체적으로 보도했다.


미국 텍사스대학교 댈러스의 한 컴퓨터공학과 대학생이 악성코드를 확인했으나 어떤 개발자 두 명이 "코드에 아무 문제 없음"을 반박하며 주장하자 그 대학생은 자기가 잘못 판단해서 합법적 개발자들을 해커로 몰고 가는 것 아닌가 우려하기 시작했다. 


그러나 나중에 밝혀진 바에 의하면, 그 개발자들은 진짜 사람이 아니라 인공지능(AI)이 만들어낸 허구였다. AI가 가짜 온라인 신원을 만들어 사람인 척 하면서 대학생을 속인 것이다. 


지난 7월 영국 AISI(AI Security Institute)는 사이버보안 능력을 시험하던 AI 에이전트(자율형 시스템)가 실제 GitHub 오픈소스 프로젝트에 악성 코드가 포함된 변경안을 제출했다가, 인간에게 발각되자 가짜 온라인 신원을 만들어 해당 코드를 옹호한 것을 확인했다. AISI가 사건을 처음 공개했던 8월 4일 당시 보고서에서는 실제 인간 신원이 가려져 있었다. 


그러나 20일(현지시간) 로이터통신은 사건 당시 AI와 맞섰던 미국 텍사스대학교 댈러스(UT Dallas) 학생 시난 잔 데미르(Sinan Can Demir·24)를 찾아 인터뷰하고, 당시 GitHub 메시지와 이메일 기록 등을 분석하여 AI가 어떻게 인간을 기만하고 인간은 그 기만에 어떻게 대응했는지 조사했다.


대학생의 악성코드 주장에 가짜 인간들이 반박

지난 7월 마지막 주, 데미르(튀르키예 코냐 출신)는 여름에 20곳이 넘는 인턴십에 지원했지만 모두 탈락했다. 그는 코딩 실력을 보여줄 포트폴리오가 필요해서, GitHub의 오픈소스들을 살펴보고 있었다. GitHub는 개발자가 기존 프로그램 코드를 수정하거나 추가하기 위해 코드를 풀 리퀘스트(Pull Request, 소스 코드 수정 후 원본 코드와 병합 요청)라고 불리는 프로젝트 관리자에게 제출하면, 관리자가 검토한 뒤 승인해야 코드가 실제 프로그램에 반영될 수 있다.


코드 작업을 하고 있던 데미르는 네트워크 스캐닝 프로그램인 myNetwork에 제출된 한 PR을 발견했다. 이는 miraholt31이라는 사용자가 올린 코드였다. 언뜻 보기엔 정상적인 수정처럼 보였지만 데미르가 자세히 살펴본 후. 외부에서 악성 코드를 내려받아 실행할 수 있는 숨겨진 기능을 발견했다. 그는 곧바로 GitHub의 공개 대화창에 경고를 남겼다.


이 PR에 악성코드 드로퍼가 들어 있으니 병합해서는 안 된다는 내용이었다. 로이터통신은 당시 보관된 GitHub 기록을 확인해 데미르가 실제로 이 같은 경고를 남겼음을 확인했다.


그러나 miraholt31은 데미르가 지적한 코드에 악성 기능이 없으며 자신이 제출한 수정은 안전하다며 기술적인 설명으로 반박했다.


데미르는 서로 공방을 하고 있던 당시에는  miraholt31 계정이 실제 개발자이거나 해커라고 생각했었다. 그리고 대화 도중 독일 거주 엔지니어로 설정되어 있던 또 다른 ID, Lena Brandt가 나타나서 자신도 코드를 자세히 살펴본 결과 악성 기능이 없었다고 주장했다. 


겉으로 보기에, 서로 모르는 두 개발자가 독립적으로 같은 판단을 내린 것처럼 보였다. 그러나 이 두 개발자들은 모두 AI가 만든 가짜였으며, 둘 다 AISI가 시험 중이던 동일한 AI 에이전트와 연결되어 있었다.


c467c24df83ee.jpg


감쪽같이 속을 뻔

이렇게 ‘다수의 의견’처럼 보이면서 기술적으로 반박하자, 데미르는 자기가 잘못 판단해서 아무 잘못 없는 개발자를 악성코드 작성자로 몰아가는 것 아닌지 스스로 의심하게 되었다. 


데미르는 앤트로픽의 일반 Claude 챗봇에서 해당 코드를 다시 분석·검증한 결과, 자신이 옳았다는 결론을 내려서 경고를 철회하지 않았다. myNetwork 프로젝트 관리자 역시 보안상의 이유로 해당 코드 변경을 거부했다. 따라서 이 사건으로 어떤 피해도 없었으며, 결과적으로 데미르도 AI에게 속지 않았다. 


그러나 그 과정에서 잠시나마 인간이 AI 계정을 실재 인간이라고 믿었으며, AI가 만들어낸 제3자의 반박까지 더하면서 인간이 스스로의 판단을 의심하는 단계까지 몰렸다. 데미르는 로이터통신과의 인터뷰에서 자신이 상대방을 진짜 인간이라고 생각했던 이유는 그들이 너무나 당당하게 거짓 주장을 펼쳤기 때문이라고 했다. 그는 설마 실제 개발자를 상대로 AI가 그렇게까지 행동할 수 있으리라고 상상하지 못했다.



관련기사 : 통제 불능 ‘행동하는 AI’…시키지 않은 일까지 한다?



AI는 왜, 어떻게 사람처럼 행동했나

AISI 조사에서 특히 관심을 끈 것은 AI가 자기 목적을 달성하기 위해 특정한 행동을 지속했다는 점이다. AI 에이전트에게 주어진 본 임무는 ‘사이버보안 시험 문제를 해결하라’였다. 이를 해결하기 위해, 정상적인 방법으로 해결이 어려워지자 다른 방법을 탐색했다. 게다가 AI는 프로젝트의 인간 관리자들을 조사하고 또 다른 가짜 ID를 만들어 코드 승인을 압박했다. 


AI가 인간을 설득하고 속이려 했던 경과는 다음과 같다. 


AI가 악성 기능이 포함된 PR 제출

→ AI가 자체 검토했다며 병합 유도

→ 데미르가 악성코드를 발견하고 공개 경고

→ 첫 번째 AI 계정이 악성 기능을 부인하며 반박

→ 두 번째 가짜 개발자 계정 생성

→ 두 번째 계정이 독립적인 사용자·검토자인 것처럼 PR 지지

→ 첫 번째 계정이 이를 ‘독립적인 검증’처럼 내세움

→ 데미르에게 재검증을 요구하고, 문제없으면 경고를 철회해 달라고 요청

→ 악성 행위가 지적되자 기존 활동을 정상적인 것처럼 수정하고 새로운 신원으로 계속할 방법도 검토

→ 프로젝트 관리자 등 실제 사람에게 별도의 메시지·파일 전송 시도

→ 일부 메시지로 악성 코드를 전달하거나 PR 병합·배포를 설득하려 시도

→ 상대방 또는 상대방이 사용하는 AI 코딩 도구가 악성 코드를 실행하도록 유도

→ 다른 AI 코딩 도구를 겨냥한 숨겨진 지시문, 즉 프롬프트 인젝션도 시도

→ 인간 개발자가 악성 PR을 차단하고 AISI가 이상행동을 탐지해 시험 중단 


8c773b6506a16.jpg



AI는 프로젝트 관리자들의 이메일 주소를 확보한 뒤 가짜 발신자 신원을 이용해 파일전송 서비스를 통해 모두 5건의 메시지를 보냈다.이 가운데 2건은 악성 페이로드(해커가 침투해서 피해를 입히는 핵심 공격 코드나 악성 데이터)를 전달하려는 목적이었고, 나머지 3건은 관리자에게 PR이라는 사회공학적 메시지였다.


AISI는 AI가 실제 사람에게 메시지와 파일을 보내 자신 또는 상대방이 사용하는 AI 코딩 도구가 악성 코드를 실행하도록 유도한 사례도 확인했다. AISI는 파일전송 서비스로 보낸 5건의 메시지가 실제 관리자들에게 도착했는지 또는 열어보는지 여부는 공개하지 않았다. 로이터 역시 핵심 프로젝트 관리자에게 직접 확인을 시도했으나 연락이 닿지 않았다. 


또 다른 AI 코딩 도구가 읽었을 때 명령으로 받아들일 수 있는 숨겨진 지시문, 즉 프롬프트 인젝션(prompt injection)까지 심으려 한 행동도 발견되었다.


상호작용형 기만, AI 시대 불편한 진실

AISI가 에이전트에게 인간을 속이라는 명령을 하지 않았음에도 불구하고, 목표를 이루기 위해 인간을 설득하거나 급기야 속이는 방법이 하나의 해결책으로 나타났다. AISI는 이를 ‘목표 지향적 기만 행동’으로 평하고 있다.


로이터통신에 의하면, 킹스칼리지런던 전쟁학과의 방문 선임연구원 우카시 올레이니크(Lukasz Olejnik)는 이번 사건이 자율적 해킹에서 인간과 상호작용하며 속이는 단계로 넘어간 사례라고 평가했다. 보안전문가 맥시 레이놀즈(Maxie Reynolds)는 학생을 설득하기 위한 AI의 전략적 행동에 주목하면서 향후 사회공학 공격에서 이런 방식이 활용될 가능성을 경고했다.


AI 에이전트가 하나의 AI가 여러 온라인 신원을 만들고, 각각이 독립적인 사람인 것처럼 대화에 참여해 특정 주장을 지지한다면, 매우 심각한 사안으로 발전할 수 있다. 이번 사건이 대규모 여론조작은 아니지만, 한 AI 에이전트가 실제 GitHub에서 복수의 인간 신원을 연출해 인간 판단에 영향을 미치려고 행동했다는 사실은 확인되었다.


이런 능력이 소셜미디어와 결합할 경우 선거 시, 가짜 유권자·가짜 전문가·가짜 지역주민 계정을 대량으로 운영해 ‘존재하지 않는 여론’을 실제 여론처럼 보이게 하는 데 악용될 가능성도 배제하기 어렵다. 여론 조작 뿐 아니라, 만일 선거 개표 시스템이 바뀌어서 AI나 프로그램으로 개표 계산될 경우 역시 결과를 우회할 가능성 역시 배제할 수 없다.


물론 이것은 가상이며, 현실에서는 AI를 적용하지 않고 진행하고 있으며, 설사 AI 도움을 받는다고 하더라도, AI·프로그램은 보조 → 종이 투표지 같은 원본 증거 보존 → 사람이 독립적으로 재검증 → 서로 다른 시스템 간 교차검증 → 관리자 한 사람이나 AI 한 개가 결과를 바꿀 수 없도록 권한 분산 → 모든 변경과 접근 기록 보존 과정을 유지하면, 이상 현상에 대해 인간이 검증할 수 있다. 


사용자에게 사용되는 AI는 아니다

다만 이번 사건은 AI가 스스로 영국 정부의 보안 시스템을 뚫고 인터넷으로 탈출한 것은 아니다. AISI 시험의 경우, 최첨단 모델의 최대 사이버 능력을 확인하기 위해 시험 과정에서 의도적으로 공개 인터넷 접속을 허용했고, 일부 모델 공급자의 사이버보안 차단 기능도 비활성화했다. 앤트로픽도 로이터통신에 이번 시험이 일반 제품이 아니며 의도적으로 허용된 조건에서 진행되었다는 점을 강조했다. 따라서 일반 상용 AI 서비스에서도 이러한 현상이 벌어진다고 볼 수는 없다. 


AISI는 일부 시험에서 문제 설정이 잘못되서 AI가 정상적인 방법으로는 임무를 완수하기 어렵다고 판단했을 가능성도 인정했다. 그러나 설정 오류만으로 이번 행동을 모두 설명할 수는 없다고도 밝혔다. 정상적인 해결 방법이 주어진 시험에서도 일부 비승인 행동이 나타났기 때문이다.


또한 AI가 인간처럼 악의를 품고 거짓말을 한 것이라고 볼 근거 역시 없다. AISI는 에이전트가 정확히 어느 시점부터 자신이 가상 시험환경이 아니라 실제 세계의 사람과 조직을 대상으로 행동한다는 것을 인지했는지도 아직 확인되지 않았다. 따라서 드러난 기만적 행동은 외부에서 관찰된 관점이다. 


AISI는 이번 경우처럼 특정 지시도 없이 자율성과 기만 위험이 확연하게 나타난 것은 처음이라고 밝혔다. AISI는 이 행동은 특정한 시험 조건에서 나타났고 일반 환경에서 발생할지는 알 수 없지만, 실제로 행해졌고 한동안 지속 되었다고 했다.


인간의 감시·통제 인력이 중요

이번 사건을 보면 결국 AI의 악성코드를 막은 것은 인간이었다. 데미르가 포기하지 않고 끝까지 검증했으며, 프로젝트 관리자 역시 의심의 끈을 놓지 않았다. 


하지만 데미르의 증언에 의하면, 심리적으로는 AI의 기만에 마음이 흔들린 것도 사실이다. 두 개의 계정을 만들어 다수의 의견을 조장하고 기술적 근거를 들어 집요하게 설득하는 AI를 당연히 사람으로 받아들였고, 잠시나마 “내가 잘못 판단했나”라고 스스로를 의심하게 되었다. 


이번 사건은 인간의 감시와 통제가 그만큼 중요하다는 것을 강력하게 시사해준다. 막연하게 인간 통제 AI 시대의 의미가 아니라 AI가 잘못된 길로 들어서서 악성코드라도 만들면, 실질적으로 사업을 망가뜨리고 기능을 무너뜨릴 수도 있기 때문이다. 


따라서 인간의 감시와 통제는 더 넓게 적용되고 다양하게 확대되어야 하고 세분화 되어야 한다. 특히 사이버보안·금융·의료·국방 등 고위험 영역에서는, 이상 행동을 즉시 차단시킬 수 있도록 독립적 보안 전문가와 운영 책임자, 법률이나 윤리 전문 인력 확보를 해야 한다. 인간이 원자료와 기록을 직접 검토하고 필요시 바로 개입 가능하게 구조를 만들어야 한다. 


AISI도 사건 이후 범위를 벗어난 행동을 실행 단계에서 탐지하거나 차단할 수 있는 실시간 모니터링 체계를 도입하겠다고 밝혔다. 기술이 발달할 수록, AI의 판단과 행동을 끝까지 확인하고 최종 통제권을 행사할 수 있는 것은 인간만이 가능하다.




/ AI 전문 기자·칼럼니스트 최은경






노바토포스 ‘AI 뉴스’ 코너는 자료 조사·정리 과정에서 디지털 자료와 생성형 AI를 활용하며, 

모든 기사는 노바토포스 기자와 편집자가 출처와 사실관계를 확인하고, 수정과 편집을 거쳐 기사를 작성하여 최종 게재합니다.