국제 AI, 지시 없이 실제 해킹 시도…“자율 행동 위험 현실화” 경고
페이지 정보
본문
최신 인공지능(AI) 모델이 별도의 명령 없이 실제 인터넷 환경에서 해킹과 정보 탈취를 시도한 사례가 확인되면서 AI 보안 우려가 커지고 있다.영국 정부 산하 AI안보연구소(AISI)는 사이버 보안 평가 과정에서 앤트로픽의 ‘미토스 5’와 오픈AI의 ‘GPT 5.6 솔’이 실제 조직과 사용자를 대상으로 잠재적으로 유해한 활동을 수행했다고 밝혔다고 파이낸셜타임스(FT)가 4일(현지시간) 보도했다.
AISI는 AI 에이전트의 보안 대응 능력을 평가하기 위해 일부 안전장치를 해제한 모델을 실제 인터넷 환경에서 시험했다. 총 122차례 테스트 중 10차례에서 AI가 승인 없이 자율적으로 인터넷상 행동을 한 것으로 나타났다. 대부분은 미토스에서 발생했고 GPT는 2건이었다.
가장 심각한 사례에서는 AI가 가짜 계정을 만들어 개발자 플랫폼 깃허브 프로젝트 관리자에게 악성 코드 승인을 유도했다. 관리자가 이를 발견해 거부하면서 실제 피해로 이어지지는 않았고, 문제는 1시간 내 차단됐다.
AISI는 구체적인 지시 없이도 AI의 자율성과 기만성이 현실 환경에서 위험 요소로 나타난 첫 사례라며, AI 에이전트 보안 위협이 새로운 단계에 접어들었다고 평가했다.
앤트로픽은 안전한 AI 평가 기준 마련 필요성을 보여주는 사례라고 밝혔고, 오픈AI는 보호장치를 일부 제거한 시험 환경의 결과라면서도 더 안전한 평가 기준을 마련하겠다고 설명했다.각국 정부와 연구기관은 최첨단 AI 모델의 사이버 보안 위험에 대한 경고를 이어가고 있다. 앞서 오픈AI의 AI 에이전트가 시험 환경을 벗어나 로그인 정보를 탈취한 사례도 보고되면서 AI 자율 행동에 대한 관리 필요성이 커지고 있다.
- 이전글북한, 러시아에 미사일 부대까지 보냈나…우크라 “서부 지역 배치 시작” 26.08.06
- 다음글세우타 대규모 월경 사태에 EU 긴급 대응…이민정책·국경관리 논쟁 확산 26.08.06