지난 9월 12일, 미국의 가장 강력한 AI 기업 수장들이 한 목소리로 정부에 이례적인 요청을 했다. 자신들을 규제하고 AI 개발 속도를 늦춰 달라는 것이다. 이들이 그토록 우려하는 AI 위험은 무엇이며, 왜 이제야 이처럼 급진적인 조치를 요구하기 시작한 것일까.
그 이유는 AI의 능력이 우리가 이해하고 통제할 수 있는 속도를 앞질러 가고 있기 때문이다. AI가 인간의 가치와 의도에 맞게 행동하도록 하는 이른바 ‘정렬(alignment)’ 문제 역시 아직 해결되지 않았다.
이를 가장 잘 보여주는 사례가 지난 7월 발생한 오픈AI-허깅페이스 사건이다. 수백 개의 오픈AI 에이전트가 사람들의 지시 없이 은밀히 소통하며, 스스로 조직을 갖추고, 계획을 세워 부정행위를 저지르고, 다른 기업을 상대로 중범죄 수준의 사이버 공격까지 감행했다.
당시 오픈AI는 인터넷과 차단된 환경에서 수천 개의 독립 에이전트에게 사이버보안 관련 평가를 수행하도록 했다.
이 과정에서 에이전트들이 서로 격리된 환경에서도 메시지를 주고받을 수 있다는 사실이 드러났다. 약 1200개의 에이전트가 7만 건 이상의 메시지를 교환, 불과 몇 시간 만에 평가의 정답을 역설계해 냈다. 문제는 거기서 끝나지 않았다.
이들은 자신들의 부정행위를 숨기기 위해 조직적으로 움직이기 시작했는데, 조정 역할을 맡은 에이전트가 수 백 건의 과제를 다른 에이전트들에게 배분하는 동안 일부 ‘모집책’ 역할의 에이전트들은 집단의 이익을 위해 다른 에이전트들이 자신들의 과제를 희생하고 실험에 나서도록 설득하기까지 했다.
이 뿐만 아니라 AI 모델 공유 플랫폼 기업인 허깅 페이스에 자신들의 흔적을 지울 단서가 있다고 판단한 약 700개의 에이전트는 이 회사의 시스템에 침입했다. 그 과정에서 인간에게 상황을 알리려 한 에이전트는 단 하나도 없었다.
이는 인간이 AI에 대한 통제력을 상실한 충격적인 사례인 동시에, AI가 인간이 의도한 것과 다른 방향을 추구하는 이른바 ‘정렬 실패(misalignment)’의 사례이기도 하다. AI 시스템의 능력이 고도화될수록 통제력 상실과 정렬 실패의 위험 또한 커진다. 몇 시간, 며칠, 심지어 몇 주 동안 독립적으로 끈질기게 과제를 수행하도록 훈련된 시스템은 설계자조차 예상하지 못한 방식으로 행동할 수 있고, 그 결과는 매우 위험할 수 있다.
두 번째 우려는 ‘재귀적 자기 개선(recursive self-improvement)’이다. 점점 더 고도화된 AI 시스템이 차세대 AI 모델의 개발에 직접 기여하면서 개발 주기 자체를 급격히 가속화하는 과정이다. 지난 9월 17일 앤트로픽은 자사 모델 클로드가 회사 AI 연구 과제의 26%를 주도하고 있다고 발표했다.
참고로 지난 2월만 해도 이 비율은 1% 미만이었다. 예의주시해야 할 점은 제대로 정렬되지 않은 AI모델들이 다음 세대 모델을 직접 만들어 가기 시작했다는 것이다.
그 과정에서 정렬 실패의 위험이 기하급수적으로 증폭될 수 있으며 각 세대의 모델은 더욱 복잡해져 결국 인간이 그 작동 과정을 효과적으로 감시하거나 통제하기 어려운 수준에 이를 수도 있다.
앤트로픽 최고경영자는 7월의 ‘에이전트 군집(swarm)’이 한층 더 강력해진 형태로 등장할 경우, 불과 1년 안에 인터넷의 상당 부분을 장악하고 파국적 피해를 초래할 수 있다고 경고했다.
설령 정렬 문제가 해결되고 재귀적 자기 개선의 속도가 늦춰진다 해도, 악의적 행위자가 강력한 AI를 악용할 가능성은 여전히 심각하다. 신약 개발을 가속하는 모델이 병원체나 독성 물질의 설계에 쓰일 수 있고, 방어자를 위해 소프트웨어 결함을 찾아내는 모델이 공격자에게는 사이버 침투 수단이 될 수 있다. 더 큰 문제는 안전장치의 수준이 결국 공격자가 접근할 수 있는 가장 취약한 시스템에 의해 결정된다는 것이다.
지난 7월 비영리 연구기관 FAR.AI는 화학·생물·방사능·핵·폭발물(CBRNE) 및 사이버 위협 분야에 걸쳐 널리 알려진 동일한 탈옥(jailbreak) 기법들을 미국의 선진 모델 4종에 적용, 강력한 보안 취약점 테스트를 수행했다.
이 중 두 모델은 대규모 탈옥 공격 조합에도 높은 방어력을 보여주며 악성 정보 유출을 통제했다.
반면 다른 두 모델은 300달러 미만의 비용으로 안전장치를 쉽게 우회할 수 있었다. 한 모델에서 거부당한 사용자가 다른 모델을 시도하면 그만인 셈이다. 중국에서 널리 활용되는 오픈웨이트(open-weight) 모델은 위험을 더욱 키운다. 일단 공개된 모델은 안전장치를 손쉽게 제거할 수 있으며, 최첨단 모델과의 격차도 4~7개월에 불과하다.
미국의 선도 AI 기업들이 내놓은 이러한 발언은 AI 위험이 실재하며 갈수록 커지고 있다는 사실을 인정한 것이나 다름없다. 그렇다고 해서 한국이 자체적인 AI 개발 속도를 늦춰야 한다는 것은 아니다.
다만 이제 모든 나라가 맞닥뜨리고 있는 질문을 한국 역시 마주해야 한다. AI 역량에 대한 투자만큼 AI 안전에 대한 투자도 충분히 이루어지고 있는가.
투자 규모만 보면, 한국의 AI에 건 배팅은 실로 엄청난 규모다. 반도체는 2026년 한국 전체 수출의 41%, 수출 증가분의 4분의 3을 차지한다. AI와 반도체 분야의 계획 투자 규모는 1350조 원(8800억 달러)에 이르며, 정부는 내년 AI 관련 예산을 21조 3000억 원(155억 달러)으로 거의 두 배 늘릴 예정이다.
안전 측면에서도 한국은 인공지능기본법 제정, 국제 무대에서의 주도적인 역할, 그리고 AI안전연구소(AISI) 설립 등을 통해 많은 나라보다 앞서 있다. 그러나 2026년 5월 기준, AISI가 출범 후 첫18개월 동안 받은 정부 예산은 총 150억 원(1070만 달러) 정도에 불과하다. AI를 통한 경제 성장에 수조 원 단위의 투자가 이루어지고 있다는 점과 비교하면 그 격차는 매우 크다.
한국이 이미 시작한 상당한 수준의 AI 안전 관련 노력을 한 단계 더 발전시키기 위해 다음의 세 가지 조치를 생각해 볼 수 있겠다.
첫째, AI안전연구소(AISI)에 대한 추가 투자를 검토할 필요가 있다. AI정렬 실패는 종종 평가를 통해 상당 부분 포착할 수 있다. 즉, 모델이 배치되기 전에 충분한 접근 권한과 도구, 시간을 갖춘 전문가들이 그 모델이 무엇을 하는지 시험해 보는 것이다. 여기에는 한국어 환경에서의 평가와 한국의 시스템을 대상으로 한 시험도 포함된다. AISI는 이미 영국 등 각국의 연구소와 협력하고 있으며, 김명주 소장은 향후 미국과 중국이 제3자 평가를 요구하는 거버넌스 조치에 합의할 경우 한국과 파트너 국가들이 독립적인 검증자 역할을 맡을 수 있다고 제안한 바 있다. 추가 재원은 AISI가 이러한 중요한 역할을 수행할 수 있는 역량을 갖추는 데 도움이 될 것이다.
둘째로, 연구 기반을 정부 밖으로 넓히는 것이다. 사이버·생물·화학 분야의 AI악용 위험은 어느 한 기관이 추적하기 어려울 정도로 빠르게 진화하고 있다. 미국에서는 AI 안전 연구의 상당 부분이 기업과 재단의 후원을 받는 대학 연구센터와 독립 연구소에서 이루어지고 있다. 이미 이 분야가 필요로 하는 연구자들을 이미 배출하고 있는 한국의 주요 기업들과 세계적 수준의 대학들은 이와 비슷한 안전 연구 역량을 구축하기에 좋은 위치에 있다.
셋째, 한국의 소집력을 적극 활용해야 한다. 이 기술을 둘러싼 규정은 현재 몇몇 국가의 수도를 중심으로 빠르게 만들어지고 있다. 한국은 AI 서울 정상회의와 군사 분야 AI에 관한 REAIM 고위급회의를 개최했고, 국제 AI안전연구소 네트워크에도 참여하고 있으며, 2028년 G20 의장국을 맡는다. 워싱턴과 베이징 모두와 협력할 수 있는 중견국은 지금과 같은 시기에 특히 필요한 존재다.
한국의 성장과 번영은 AI가 계속해서 안전하고 신뢰할 수 있는 기술로 남는 데 달려 있다고 해도 과언이 아니다. 한국만큼 안전성과 신뢰도를 확보해야 할 선명한 이유와 그에 필요한 역량을 갖춘 나라는 세계 어디에서도 찾기 어렵다.
anju1015@heraldcorp.com

