어려움은 크게 네 가지 영역으로 나뉩니다.
사전 설정된 기준선(Baseline) 부재. 대부분의 AI 배포는 출시 후에야 지표 추적을 시작하기 때문에 어떤 가치 창출도 입증할 수 없습니다. 2026년 ModelOp의 조사에 따르면 기업의 3분의 2 이상이 여전히 측정된 재무 결과가 아닌 추정치에 의존하여 투자수익률을 평가하고 있습니다
.
허영 지표(Vanity Metrics)의 만연. 많은 기업이 활성 사용자 수, 세션 수 또는 일일 쿼리 수를 추적합니다. 하지만 이는 AI가 실제 비즈니스 가치를 창출하는지에 대해 아무것도 알려주지 않습니다. 2025년의 지표는 '사용자'였습니다. 2026년에 필요한 지표는 '감사 가능한 결과(Auditable Outcomes)' 입니다
.
프로덕션 대 ROI 격차. 11,000명의 CIO를 대상으로 한 가트너(Gartner)의 2026년 CIO 보고서에 따르면, AI 이니셔티브의 59%가 프로덕션 단계에 도달하지 못하며, CIO의 71%는 측정 가능한 성과를 제공할 유스 케이스의 우선순위를 정하는 데 어려움을 겪고 있습니다.
가시성 없는 지출 폭발. AI 비용은 여러 제공업체, 모델 및 부서에 걸쳐 분산되어 있지만 이를 통합할 회계 프레임워크가 없습니다. 포레스터(Forrester)의 연구에 따르면 재무적 감독이 강화됨에 따라 기업들은 계획된 AI 지출의 25%를 2027년으로 연기하고 있습니다
.
OpenAI — '달러당 유용한 지능(Useful Intelligence per Dollar)'
OpenAI의 CFO 사라 프라이어(Sarah Friar)는 4가지 질문으로 구성된 스코어카드를 도입했습니다: AI가 작동하는가? 비용 효율적인가? 창출하는 가치가 비용보다 빠르게 증가하는가? 이 프레임워크는 대화의 초점을 단순 토큰 소비에서 **성과 조정 단위 경제(Outcome-Adjusted Unit Economics)**로 전환합니다.
Anthropic — '경제적 기본 요소(Economic Primitives)'
Anthropic은 '경제적 기본 요소'를 기반으로 한 프레임워크를 발표했습니다. 이는 일반적인 사용량이 아닌 작업 복잡성, 자율성 수준, 작업당 비용 대비 절약된 시간을 측정합니다. 이들의 내부 엔터프라이즈 가이드라인은 성능 임계값, 정확도, 속도 개선 및 비용 효율성과 연결된 성공 지표를 강조합니다
.
리눅스 재단의 토크노믹스 재단(Tokenomics Foundation)
2026년 8월 4일, JP모건 체이스, 액센추어, IBM, SAP, BNY, 부킹닷컴을 포함한 약 30개의 창립 멤버와 함께 출범한 이 벤더 중립적인 표준 기구는 FinOps 재단이 클라우드 지출에 대해 해냈던 것을 AI 토큰 비용에 대해 해내는 것을 목표로 합니다. 첫 번째 초안인 'Big-T 표기법(Big-T Notation)'은 API 호출당 비용(Cost-per-API-Call)(토큰당 비용이 아닌)을 표준화하여 지표가 수행된 하나의 작업 단위에 직접 매핑되도록 제안합니다
. 재단은 현재 표준화된 형태가 존재하지 않는 서비스 비용(Cost-to-Serve) 지표도 정의하고 있습니다
.
Elisity — '바이오닉 헤드카운트(Bionic Head Count)'
이 사이버 보안 회사는 총 AI 지출을 평균 인건비로 나눈 다음, 인간과 AI '근로자'의 결합된 산출량을 수익과 비교하는 지표를 만들었습니다. 이는 CFO에게 AI 투자에 대한 직접적인 노동 생산성 아날로그를 제공합니다.
업계 차원의 노력
FinOps 재단은 쿼리당 비용, 사용자당 비용, 워크플로우당 비용과 같은 단위 비용 지표를 권장하는 AI별 프레임워크를 발표하여 비즈니스 이해관계자가 토큰 지출을 이해할 수 있도록 했습니다. Oracle과 Jellyfish를 비롯한 여러 기업은 이제 소비를 워크플로우 수준의 비즈니스 성과에 매핑하는 토큰 경제 대시보드를 제공합니다
. BCG는 공식적인 'AI 수익률(Return on AI, RoAI)' 비율을 제안합니다: 경제적 수익 / (인간 지능의 비용 + 토큰 비용)
.
이 모든 프레임워크에서 명확한 패턴이 나타나고 있습니다. 가장 효과적인 접근 방식은 공통된 구조를 공유합니다.
아직 단일 표준이 폭넓게 채택되지는 않았습니다. 하지만 방향은 명확합니다. 단순 토큰 수가 아닌 성과 연동 단위 경제(Outcome-Linked Unit Economics) — 완료된 작업당 비용, 해결된 티켓당 비용, 바이오닉 헤드카운트 — 를 중심으로 합의가 형성되고 있습니다. 시작점을 찾고 있는 CFO와 CIO를 위해, OpenAI의 사라 프라이어의 조언이 가장 실용적입니다: "하나의 워크플로우로 시작하는 것이 가장 좋습니다. '완료'가 무엇을 의미하는지 정의하고 작업이 이루어지는 시스템에서 그 결과를 측정하십시오."