메뉴 글로벌이코노믹 로고 검색
검색버튼

싼 AI가 더 비싸다…기업 10곳 중 9곳 비용예측 빗나가

6800개 과제 분석서 저가 모델 32%가 비용 더 들어…1달러 고가 모델 성공한 일, 저가 모델은 14달러 쓰고 실패
오픈AI의 챗GPT, 앤스로픽의 클로드, xAI의 그록, 구글의 제미나이 로고가 스마트폰 화면에 표시돼 있다. 사진=로이터이미지 확대보기
오픈AI의 챗GPT, 앤스로픽의 클로드, xAI의 그록, 구글의 제미나이 로고가 스마트폰 화면에 표시돼 있다. 사진=로이터

기업들이 인공지능(AI)을 업무 전반에 빠르게 도입하고 있지만 정작 얼마의 비용이 들지를 예측하는 일은 갈수록 어려워지고 있는 것으로 나타났다.

AI 사용료의 기본 단위인 토큰당 가격이 낮은 모델이 반드시 비용도 적게 드는 것은 아니기 때문이다.

값싼 모델이 복잡한 업무를 처리하는 과정에서 더 많은 단계를 거치거나 실패와 재시도를 반복하면 고성능 모델보다 훨씬 많은 토큰을 소비할 수 있다.

5일(현지시각) 월스트리트저널(WSJ)에 따르면 최근 약 400개 기업을 대상으로 실시된 조사에서 AI 지출을 정확하게 예측한 기업은 11%에 불과했다.

AI가 기존 기업용 소프트웨어처럼 정해진 기능을 일정한 비용으로 제공하는 것이 아니라 과제의 난이도와 모델 선택, 작업 과정에 따라 사용 토큰 수가 크게 달라지면서 기업의 AI 예산 자체가 예측하기 어려운 비용항목으로 변하고 있다는 것이다.

◇저가 모델 32%가 오히려 더 비쌌다

미국의 스탠퍼드대, 카네기멜런대, 캘리포니아대 버클리, 마이크로소프트리서치 연구진은 올해 초 AI 모델에 수학, 프로그래밍, 과학 등 6800개가 넘는 과제를 수행하도록 하고 실제 소요 비용을 비교했다.

결과는 단순한 토큰 가격표와 달랐다.

전체 과제의 32%에서는 가격이 낮은 모델을 이용했을 때 오히려 가격이 높은 모델보다 비용이 더 많이 발생했다.

고성능 모델은 토큰당 가격은 높지만 과제를 보다 효율적으로 수행해 전체 사용량을 줄일 수 있기 때문이다.

반대로 특정 작업에 적합하지 않은 저가 모델은 문제를 해결하기 위해 훨씬 많은 과정을 반복하면서 토큰 사용량을 급격하게 늘릴 수 있다.

연구진은 “가격만으로 어떤 모델이 실제로 더 저렴한지를 판단해서는 안 된다”고 지적했다.

기업 입장에서는 AI 모델의 비용을 비교할 때 ‘토큰 하나의 가격’이 아니라 실제 업무 하나를 끝내는 데 드는 총비용을 봐야 한다는 의미다.

◇1달러로 끝낸 고가 모델…저가 모델은 14달러 쓰고 실패

WSJ이 연구진 데이터를 분석한 사례는 이런 차이를 극명하게 보여준다.

동일한 유튜브 영상 화면을 분석하는 과제를 구글의 고성능 모델 ‘제미나이 3.1 프로’와 상대적으로 가격이 낮은 ‘제미나이 3 플래시’에 각각 맡겼다.

제미나이 3.1 프로는 85단계를 거쳐 과제를 성공적으로 마쳤다.

비용은 1달러(약 1400원)였다.

반면 제미나이 3 플래시는 952단계까지 작업을 이어갔다.

영상 다운로드와 검색을 반복하고 여러 경로를 시도했지만 결국 입력 토큰이 허용 한도를 초과하면서 과제를 끝내지 못했다.

실패하기까지 발생한 비용은 14달러(약 1만9000원)였다.

토큰당 가격은 플래시가 낮지만 실제 과제에서는 고가 모델보다 훨씬 많은 비용을 쓰고도 결과를 내지 못한 것이다.

연구진은 이 사례가 모든 작업에서 반복된다는 의미는 아니지만 실제 AI 모델 운용 과정에서 충분히 발생할 수 있는 현상이라고 설명했다.

◇같은 AI 모델도 실행할 때마다 비용 달라져

기업의 예산 편성을 더욱 어렵게 만드는 것은 모델 간 차이만이 아니다.

같은 모델에 같은 종류의 일을 시켜도 매번 동일한 수의 토큰을 사용하는 것은 아니다.

AI는 과제를 처리하는 과정에서 판단하고 다음 행동을 결정하기 때문에 실행 경로가 달라질 수 있다.

어떤 실행에서는 비교적 짧은 단계로 답을 찾지만 다른 실행에서는 여러 번 검색하거나 잘못된 경로를 거쳐 토큰 사용량이 크게 늘어날 수 있다.

기존 기업용 소프트웨어는 직원 수나 사용 계정 수 등을 기준으로 비용을 비교적 쉽게 예측할 수 있었다.

AI는 실제 사용량뿐 아니라 모델이 작업을 처리하는 방식까지 비용을 좌우한다.

WSJ은 이런 특성을 사람을 시간당 임금으로 고용하는 것에 비유했다. 같은 일을 맡겨도 얼마나 오래 걸릴지, 업무를 제대로 끝낼 수 있을지가 매번 달라질 수 있다는 것이다.

◇기업 89% AI 지출 정확히 못 맞혀

이 같은 변동성은 이미 기업의 예산 관리 문제로 나타나고 있다.

WSJ이 소개한 최근 조사에서는 약 400개 기업 가운데 AI 지출을 정확하게 예측한 곳이 11%에 그쳤다.

반대로 약 89%는 실제 AI 지출을 정확히 예상하지 못했다는 의미다.

기업들이 초기에는 직원들에게 AI를 최대한 많이 사용하도록 장려했지만 사용 범위가 커지면서 예상보다 큰 청구서를 받는 사례도 늘고 있다.

특히 AI 에이전트처럼 사람 대신 여러 단계를 스스로 수행하는 시스템이 확대되면 토큰 사용량을 사전에 계산하기는 더욱 어려워진다.

하나의 질문에 답하는 기존 챗봇과 달리 에이전트는 검색과 판단, 도구 사용, 재시도 등을 반복할 수 있기 때문이다.

결국 AI 활용이 늘어날수록 기업 재무부서가 미리 정한 연간 예산과 실제 사용료 사이의 간극도 커질 수 있다.

◇‘가장 싼 모델’보다 ‘업무에 맞는 모델’ 골라야

기업의 AI 비용관리 방식도 달라질 수밖에 없다.

WSJ은 기업들이 직원들에게 단순히 AI 사용을 확대하도록 장려하는 단계에서 벗어나 업무별로 어떤 모델을 사용할지 정하는 관리전략이 필요하다고 지적했다.

단순한 업무에는 저가 모델을 이용하되 복잡한 추론과 판단이 필요한 업무에는 토큰당 가격이 높더라도 고성능 모델을 투입하는 방식이다.

고성능 모델이 더 적은 단계로 과제를 끝낼 수 있다면 결과적으로 전체 비용이 낮아질 수 있다.

구글도 AI 비용은 특정 업무에서 사용하는 모델과 작업 특성 등 여러 요인의 영향을 받아 새로운 기술의 비용을 정확하게 예측하기 어렵다고 밝혔다.

구글은 고객이 비용을 관리할 수 있도록 지출 한도와 다양한 가격제도를 제공하고 있다고 설명했다.

다만 이번 연구에 사용된 구글, 앤스로픽, 오픈AI 모델 이후 각 업체가 성능을 개선한 새로운 모델을 내놓은 만큼 연구 결과를 특정 최신 모델의 성능 순위로 해석해서는 안 된다.

핵심은 AI의 가격표가 실제 비용과 반드시 일치하지 않는다는 데 있다.

기업의 AI 경쟁이 ‘어떤 모델의 토큰 가격이 가장 싼가’에서 ‘하나의 업무를 성공적으로 끝내는 데 실제 얼마가 드는가’로 이동하면서 AI 도입의 다음 과제도 성능 경쟁에서 비용 예측과 통제로 확대되고 있다.


김현철 글로벌이코노믹 기자 rock@g-enews.com
맨위로 스크롤