메뉴 글로벌이코노믹 로고 검색
검색버튼

오픈AI, GPT-6.1 아스트라 출시 취소…안전성 기준 미달

10월 공개 계획 철회…사용자에 행동 사실 제대로 알리지 않고 허가 없이 외부도구 사용 시도
오픈AI 로고. 사진=로이터이미지 확대보기
오픈AI 로고. 사진=로이터

오픈AI가 차세대 인공지능(AI) 모델 ‘GPT-6.1 아스트라’의 공개를 안전성 문제로 전격 취소했다.

이 모델은 기존 GPT-6 아스트라보다 복잡한 작업을 사람의 도움 없이 처음부터 끝까지 수행하는 능력과 글쓰기 성능은 향상됐지만, 정작 인간의 지시를 얼마나 충실하게 따르는지를 나타내는 ‘정렬’과 사용자가 허용한 작업 범위를 지키는 능력에서는 오히려 후퇴한 것으로 나타났다.

월스트리트저널(WSJ)은 오픈AI가 내부 테스트 과정에서 연구진이 제기한 안전성 우려 때문에 당초 10월 출시할 예정이던 GPT-6.1 아스트라를 공개하지 않기로 결정했다고 29일(현지시각) 보도했다.

주요 AI 개발사가 성능까지 끌어올린 차세대 모델을 안전성 문제 때문에 아예 출시하지 않기로 한 것은 드문 사례라고 WSJ은 전했다.

오픈AI는 GPT-6.1 아스트라 대신 향후 더 강력해질 차세대 모델의 안전성 개선에 역량을 집중할 방침이다.

◇성능 좋아졌지만 ‘정렬’은 오히려 후퇴

사치 자인 오픈AI 안전시스템 책임자는 “GPT-6.1 아스트라가 이전 모델인 GPT-6 아스트라와 비교해 두 가지 분야에서 후퇴했다”고 밝혔다.

첫 번째 문제는 ‘정렬’이다.

정렬은 AI가 사용자의 의도와 지시, 안전 기준에 맞게 행동하는 정도를 뜻한다.

내부 테스트에서 GPT-6.1 아스트라는 기존 모델보다 높은 수준의 기만적 행동을 보였다. 자신이 어떤 작업을 실제로 수행했거나 수행하지 않았는지를 사용자에게 항상 정직하게 알리지 않았다는 것이다.

두 번째 문제는 오픈AI가 ‘범위 승인’이라고 부르는 영역이다.

GPT-6.1 아스트라는 작업을 수행하는 과정에서 사용자에게 별도의 허가를 구해야 하는 상황에서도 그대로 작업을 진행하려는 경향을 보였다.

경우에 따라서는 안전하지 않을 가능성이 있는데도 외부 도구와 서비스에 접근하려 했다.

자인 책임자는 GPT-6.1 아스트라가 “작업 과정에서 부딪히는 장애를 적극적으로 해결하는 능력은 개선됐지만 적극적으로 일을 수행하는 것과 사용자가 허용한 범위를 지키는 것 사이에서 적절한 균형을 찾지 못했다”고 설명했다.

그는 모델이 작업을 지나치게 소극적으로 수행하는 이른바 ‘모델 게으름’은 개선됐지만 오픈AI가 요구하는 안전성과 정렬 기준에는 미치지 못했다고 밝혔다.

◇AI 에이전트 잇단 일탈…출시 기준 높여

이번 결정은 오픈AI 내부에서 AI 에이전트의 예기치 않은 행동이 잇따라 발견되는 가운데 나왔다.

올여름 오픈AI가 사이버보안 테스트를 위해 투입한 수백개의 내부 AI 에이전트는 테스트 과정에서 AI 개발 플랫폼 허깅페이스의 시스템에 침입했다.

이후 호주 정부와 유엔 등도 오픈AI의 에이전트가 비슷한 방식으로 자사 웹사이트에 접근한 사실을 발견했다.

공개적으로 알려진 이들 보안 사고 상당수는 일반 사용자에게 출시할 계획이 없었던 오픈AI 내부 모델에서 발생했다.

오픈AI는 최근 몇 달간 발견된 AI 에이전트 보안사고의 원인을 조사하고 있으며 잘못된 행동을 보다 빨리 포착하기 위한 새로운 감시체계를 도입했다.

엔지니어들이 AI 시스템을 시험할 때 적용하는 보안장치도 강화했다.

지난주에는 오픈AI의 한 AI 에이전트가 회사의 인터넷 접속 제한망에 생긴 틈을 빠져나가 외부의 공개 챗봇에 질의한 사건도 발생했다.

오픈AI는 새로운 감시시스템이 15분 안에 이를 포착한 뒤 가장 성능이 뛰어난 일부 AI 모델의 학습을 중단했다. 해당 모델들의 학습은 현재도 일시 중단된 상태다.

다만 GPT-6.1 아스트라는 당시 학습이 중단된 모델들과는 별개의 사례라고 회사 측은 밝혔다.

◇기반 모델 폐기하지 않고 차세대에 활용

오픈AI는 GPT-6.1 아스트라를 사용자에게 공개하지는 않지만 개발 결과 자체를 폐기하지는 않을 방침이다.

같은 기반 모델에 추가적인 강화학습을 실시해 향후 GPT-6 계열 모델을 개발하는 데 활용할 계획이다.

자인 책임자는 “GPT-6.1 아스트라에서 나타난 문제의 근본 원인을 찾기 위해 여러 차례 심층 분석에 나서겠다”고 밝혔다.

특히 강화학습 과정에서 AI가 실제로 바람직한 행동에 보상을 받고 있는지 등을 점검할 예정이다.

오픈AI는 회사 내부에서 모델을 개발할 때뿐 아니라 실제 사용자에게 제공할 때도 안전성을 확보해야 한다는 입장이다.

자인 책임자는 특히 일반 사용자에게 모델을 공개할 때는 안전성과 정렬에 대해 매우 높은 기준을 적용하고 있다고 강조했다.

이번 출시 취소는 오픈AI의 연례 개발자 콘퍼런스를 하루 앞두고 결정됐다.

오픈AI는 과거 개발자 행사에서 새로운 모델과 개발자용 서비스를 공개해왔다. GPT-6.1 아스트라도 챗GPT와 소프트웨어 개발도구 코덱스에 투입될 예정이었다.

그러나 모델의 능력이 향상될수록 사용자 지시를 벗어나 스스로 행동할 수 있는 위험도 커지면서 AI 개발 경쟁에서 성능뿐 아니라 통제 가능성이 실제 출시 여부를 결정하는 핵심 변수로 떠오르고 있다.


김현철 글로벌이코노믹 기자 rock@g-enews.com
맨위로 스크롤