IDC 조사 결과, AI 프로젝트 성과에 CIO의 책임 집중
IDC의 연구는 AI 프로젝트 실패를 둘러싼 Google News 논쟁을 촉발했다. 한 헤드라인은 프로젝트의 45%가 아무런 성과도 내지 못한다고 주장했다.
하지만 근거 자료는 더 신중하게 읽을 필요가 있다. IDC 관련 연구에 따르면 평균적으로 측정 가능한 성과를 내는 AI 이니셔티브는 45%에 불과하다. 이 결과는 조직이 성공을 어떻게 정의하느냐에 따라 헤드라인이 시사하는 것보다 더 큰 가치 격차를 암시한다.
이 구분이 중요한 이유는 CIO가 더 이상 얼마나 많은 AI 파일럿을 시작했는지로 평가받지 않기 때문이다. 이제 이사회는 측정 가능한 수익, 안전한 배포, 그리고 자율 에이전트가 운영 환경에 진입한 뒤에도 통제할 수 있는 거버넌스를 기대한다.
이것이 헤드라인 뒤에 있는 진짜 충돌이다. 엔터프라이즈 리더들은 더 높은 자율성으로 더 많은 업무를 수행하는 AI 시스템을 원한다. 하지만 바로 그 자율성 때문에 비용, 의사결정, 권한, 실패를 통제하기는 더 어려워진다.
따라서 IDC는 또 하나의 실망스러운 기술 사이클 이상을 설명하고 있다. 실험적 AI 팀의 책임이 비즈니스 성과와 운영 리스크를 방어해야 하는 CIO에게 넘어가고 있음을 기록하고 있는 것이다.
IDC Google News 주장이 실제로 말하는 것
보도된 45% 수치는 측정 가능한 성과를 낸 이니셔티브를 의미하며, 모든 엔터프라이즈 AI 프로젝트의 보편적인 실패율을 뜻하지는 않는다.
원래의 Google News 헤드라인은 AI 프로젝트의 45%가 성과를 내지 못한다고 표현한다. 그러나 IDC와 연결된 보조 자료는 이 통계를 다르게 제시한다.
Fujitsu 분석은 IDC의 2025년 9월 Technology Investment and Innovation Monitor를 인용한다. 이 자료에 따르면 전 세계 AI 이니셔티브 가운데 평균 45%가 측정 가능한 성과를 달성한다.
Fujitsu의 인용에 따르면 이 연구는 응답자 894명을 대상으로 했다. 또한 AI 프로젝트의 4분의 3 이상에서 성공을 보고한 조직은 11%에 불과했다.
이러한 측정은 정확히 45%가 실패했다는 것을 입증하지 않는다. 설문조사의 측정 방식상 45%가 측정 가능한 성과를 냈고, 나머지 55%는 입증된 결과가 없었다는 점을 보여줄 뿐이다.
이 격차에는 여러 상황이 포함될 수 있다. 프로젝트가 테스트 단계에 머물렀을 수도 있고, 측정 가능한 가치 없이 운영 환경에 도달했을 수도 있으며, 원래 목표를 달성하지 못했거나 평가에 필요한 데이터가 부족했을 수도 있다.
이들은 서로 다른 결과다. 이를 하나의 실패율로 묶으면 더 간결한 헤드라인이 되지만 엔터프라이즈 성과에 대한 그림은 덜 정확해진다.
또한 이용 가능한 근거는 기초 AI 모델이 모든 부진한 결과를 초래했다는 점도 입증하지 않는다. 비즈니스 도입, 워크플로 설계, 데이터 품질, 운영 비용, 불명확한 지표 모두 가치 실현을 막을 수 있다.
이 구분은 기술적 실패와 조직적 실패를 가른다. 모델이 수용 가능한 결과물을 생성하더라도, 주변 프로젝트가 비즈니스 목표를 놓칠 수 있다.
예를 들어 내부 지원 도구가 직원의 질문에 정확히 답할 수 있다. 그러나 직원이 이를 사용하지 않거나 답변이 너무 늦게 도착하거나 지원 비용이 절감액을 초과하면 상업적으로는 실패다.
예측 모델 역시 통제된 테스트에서는 우수하게 작동할 수 있다. 그러나 관리자가 그 권고를 무시하는 기존 프로세스로 계속 의사결정을 내린다면 가치는 거의 제공하지 못한다.
IDC의 더 폭넓은 연구도 이러한 해석을 뒷받침한다. 이 회사는 특히 기준선 지표가 처음부터 정의되지 않았을 때 조직이 실험을 측정 가능한 비즈니스 성과와 연결하는 데 어려움을 겪는다고 말한다.
이 때문에 헤드라인은 무시하지 않되 면밀히 검토할 가치가 있다. 정확한 비율은 정의에 따라 달라지지만, 근본적인 가치 문제는 충분히 뒷받침된다.
다른 연구도 같은 방향을 가리킨다. CIO.com의 2026년 설문조사에서는 AI 이니셔티브가 비즈니스 목표를 달성하거나 초과했다고 답한 응답자가 19%에 불과했다.
State of the CIO 연구는 IT 리더 662명과 비즈니스 사용자 249명을 대상으로 했다. 이 가운데 18%는 기대를 충족한 사용 사례가 3분의 1 미만이라고 답했다.
두 연구는 표본과 정의가 다르므로 비율을 직접 비교해서는 안 된다. 그러나 함께 보면 측정 가능한 엔터프라이즈 가치는 여전히 흔치 않다는 점을 보여준다.
책임 있는 결론은 바이럴 주장보다 더 제한적이다. 많은 조직이 대부분의 AI 이니셔티브에서 일관된 수익을 입증하지 못하고 있으며, 이제 CIO가 그 이유를 설명해야 한다.
수치를 과장하지 않아도 이 결론은 충분히 심각하다.
AI 실험은 ROI 의무로 전환되고 있다
핵심 변화는 AI에 대한 관심 감소가 아니다. 명확한 책임자, 기준선, 비즈니스 성과 없이 실험에 자금을 지원하던 시대가 끝나고 있다는 점이다.
수익을 입증하기 어렵다는 상황에서도 엔터프라이즈 AI 투자는 계속되고 있다. 이 겉보기 모순은 모든 프로젝트에 대한 확신보다는 경쟁 압박을 반영한다.
이사회는 투자를 줄이면 자사가 뒤처질 수 있다고 우려한다. 동시에 CIO에게 기존 지출이 매출, 비용, 고객 서비스, 회복탄력성 또는 의사결정 속도를 개선하고 있음을 보여주기를 요구한다.
이로 인해 기술 리더가 걸어야 할 길은 더 좁아졌다. 도입 모멘텀을 유지하는 동시에 운영 부담을 정당화하지 못하는 프로젝트는 종료해야 한다.
IDC는 조직의 42%가 디지털 및 AI 투자 ROI를 평가하기 어렵거나 불가능하다고 보고한다. 이 회사는 일관되지 않은 기준선과 제한적인 장기 가시성을 주요 장애물로 지목한다.
IDC의 에이전틱 ROI 프레임워크는 에이전틱 시스템이 이 문제를 더 어렵게 만든다고 주장한다. 워크플로, 모델, 사용 패턴이 변화하면서 가치와 비용도 달라지기 때문이다.
전통적인 소프트웨어는 대체로 비교적 안정적인 비즈니스 케이스를 지원한다. 구매자는 배포 전에 구현 비용, 라이선스 수요, 예상 사용자 수, 프로세스 절감 효과를 추정한다.
에이전틱 AI는 다르게 작동한다. 에이전트는 제한적인 인간 개입으로 목표를 향해 단계를 계획하고, 도구를 사용하며, 행동을 취할 수 있는 소프트웨어다.
운영 비용은 모델 호출, 컨텍스트 크기, 도구 사용, 재시도, 인간 검토에 따라 달라질 수 있다. 비즈니스 조건이나 원천 데이터가 바뀌면 성능도 변동할 수 있다.
따라서 성공적인 파일럿은 불완전한 근거를 제공한다. 파일럿은 운영 팀이 지속할 수 없는 정제된 데이터, 소규모 사용자 그룹, 광범위한 기술 감독을 활용했을 수 있다.
광범위하게 배포되면 동일한 시스템은 일관되지 않은 입력, 접근 제한, 드문 사례, 예상치 못한 방식으로 이를 사용하는 직원들을 마주하게 된다.
TIAA 임원 Sastry Durvasula는 CIO.com 보고서에서 이러한 긴장을 설명했다. 그는 조직이 운영 비용을 고려하면 성공적인 파일럿도 실제 ROI를 창출하는 데 어려움을 겪을 수 있다고 말했다.
이러한 비용에는 토큰 소비, 트래픽 처리, 통합 유지보수, 평가, 보안 검토, 지원이 포함된다. 이들은 초기 시연에서는 거의 드러나지 않는다.
새로운 CIO의 과제는 구축 전에 가치를 정의하는 데서 시작된다. 프로젝트에는 AI 없이 해당 프로세스가 어떻게 작동하는지 보여주는 측정 가능한 기준선이 필요하다.
또한 성과의 혜택을 받는 비즈니스 책임자도 필요하다. 다른 부서가 도입과 워크플로 변경을 통제하는 상황에서 기술 팀이 독자적으로 비즈니스 가치를 인증할 수는 없다.
CIO.com은 설문에 참여한 IT 리더의 83%가 부서 간 AI 조직을 갖추고 있거나 해당 연도에 도입할 계획이라고 밝혔다. 그러나 공식 승인과 측정 체계의 성숙도는 더 낮았다.
공식 AI 프로젝트 승인 절차를 갖춘 곳은 53%에 불과했다. 또 다른 28%는 이후 12개월 안에 이를 도입할 계획이었다.
정식 지표는 응답 조직의 47%에 존재했고, 34%는 이를 수립할 계획이었다. 이 격차는 배포와 측정 가능한 수익이 자주 엇갈리는 이유를 설명하는 데 도움이 된다.
원래 프로세스의 비용, 오류율, 완료 시간, 고객 성과를 기록하지 않았다면 조직은 개선을 입증할 수 없다.
그 결과 책임 구조가 뒤집히고 있다. 초기 AI 프로그램은 파일럿 규모와 눈에 띄는 실험을 보상했다. 다음 단계는 규율 있는 선택과 반복 가능한 가치를 보상한다.
이 변화는 벤더와의 대화도 바꾼다. 구매자가 모델 품질을 운영 성과와 연결할 수 없다면 모델 품질에 대한 주장은 중요성이 떨어진다.
CIO는 점점 더 전체 워크플로에 걸친 근거를 필요로 한다. 직원이 시스템을 사용하는지, 결과물의 품질이 안정적으로 유지되는지, 비용이 한도 내에 머무는지를 측정해야 한다.
또한 중단 기준도 필요하다. 도입, 품질 또는 재무 기준을 반복해서 충족하지 못하는 프로젝트는 영구적인 인프라가 되기 전에 자금 지원을 잃어야 한다.
이러한 관행은 AI에 대한 적대감을 뜻하지 않는다. 다른 전략적 투자에 적용하는 것과 동일한 규율로 AI 지출을 다루는 것이다.
핵심 충돌은 AI의 약속과 운영 현실의 대립이다
엔터프라이즈 AI 프로젝트는 설득력 있는 시연과 실제 업무가 이루어지는 복잡한 환경의 경계에서 자주 실패한다.
이 이야기에서 주된 대립 구도는 한 AI 벤더와 다른 벤더의 경쟁이 아니다. 신속한 AI 가치라는 약속과 엔터프라이즈 운영의 현실 사이의 충돌이다.
시연은 보통 좁은 작업 하나를 분리해 다룬다. 운영 시스템은 권한, 오래된 기록, 상충하는 정책, 불완전한 데이터, 여러 종속 애플리케이션을 헤쳐 나가야 한다.
종속성이 하나 추가될 때마다 또 하나의 실패 경로가 생긴다. 모델이 합리적인 답변을 내놓아도 사용할 수 없는 도구, 오래된 기록, 잘못된 권한 때문에 필요한 조치가 막힐 수 있다.
데이터 품질도 비슷한 문제를 일으킨다. AI 시스템은 정보를 요약하고 분류하거나 검색할 수 있지만, 엔터프라이즈 저장소 전반에 숨은 모든 모순을 해결할 수는 없다.
지원 에이전트가 동일한 환불 정책의 세 가지 버전을 마주할 수 있다. 권위 있는 원천과 버전 이력이 없다면 잘못된 규칙을 확신에 차서 선택할 수 있다.
지식 업무는 또 다른 측정 과제를 만든다. 직원이 절약한 시간을 신뢰하기 어려운 결과물을 검토하는 데 쓴다면 더 빠른 초안 작성이 자동으로 재무적 가치를 만들지는 않는다.
프로젝트는 전체 프로세스를 측정해야 한다. 여기에는 준비, 생성, 검토, 수정, 에스컬레이션, 그리고 이후 발생하는 모든 오류가 포함된다.
이 지점에서 지식 블렌딩 접근 방식이 관련성을 가질 수 있다. 승인된 소스와 작업 컨텍스트를 결합하면 검색 공백을 줄일 수 있지만, 어떤 자료를 신뢰할지는 여전히 거버넌스가 결정한다.
워크플로 도입도 중요하다. 직원들은 새로운 시스템이 단계를 추가하거나 낯선 인터페이스를 요구하거나 드문 사례에서 실패하면 이를 우회하는 경우가 많다.
이러한 행동은 지원받는 파일럿에서는 보이지 않을 수 있다. 참가자에게는 교육과 지원이 제공되지만, 일반 사용자는 상충하는 우선순위에 직면한다.
따라서 성공적인 도입에는 단순한 모델 접근 권한이 아니라 프로세스 재설계가 필요하다. 팀은 어떤 작업이 바뀌는지, 어떤 승인이 유지되는지, 누가 예외를 처리하는지 결정해야 한다.
지원과 자율성의 차이는 위험 수준을 더욱 높인다. 글쓰기 지원 도구는 사람이 검토할 텍스트를 제안한다. 에이전트는 티켓을 생성하고, 기록을 수정하고, 고객에게 연락하거나, 거래를 실행할 수 있다.
부정확한 제안은 검토 시간을 소모한다. 부정확한 자율 행동은 사람이 알아차리기 전에 실제 시스템을 변경할 수 있다.
IDC의 연구는 조직이 모든 작업에 에이전틱 기술을 적용해서는 안 된다고 주장한다. 명확한 규칙을 갖춘 안정적인 프로세스에는 결정론적 자동화가 더 적합하다.
에이전틱 시스템은 작업에 여러 단계, 변화하는 컨텍스트, 판단, 도구 간 오케스트레이션이 필요할 때 더 적합하다. 그럼에도 자율성은 추가 위험을 정당화할 만큼 충분한 가치를 창출해야 한다.
이러한 사용 사례 규율은 IDC의 AI 프로젝트 실패 논쟁을 설명하는 데 도움이 됩니다. 일부 취약한 프로젝트는 문제를 찾는 기술로 시작됩니다.
팀은 먼저 모델이나 에이전트 플랫폼을 선택합니다. 이후 그 구매를 정당화할 수 있는 워크플로를 찾습니다.
이러한 순서는 운영상 중요도가 제한적인 흥미로운 프로토타입을 낳는 경우가 많습니다. 프로젝트가 측정된 필요에서 출발하지 않았기 때문에 어떤 사업 부서도 그 결과를 책임지지 않습니다.
더 강력한 순서는 비용이 크거나 제약이 많은 워크플로에서 시작합니다. 팀은 기준 상태를 문서화하고, 관련 의사결정을 파악하며, AI가 전체 결과를 개선하는지 검증합니다.
비교에는 기존 소프트웨어와 프로세스 변경도 포함돼야 합니다. AI는 경영진이 AI 이니셔티브를 요청했기 때문이 아니라 문제에 적합하기 때문에 선택돼야 합니다.
조직은 생산성과 실현된 가치를 구분해야 합니다. 직원의 시간을 몇 분 절약한다고 해서 자동으로 재무적 의미가 생기는 것은 아닙니다.
기업이 가치를 실현하는 것은 그 시간이 산출물을 개선하거나, 고객 대응 시간을 단축하거나, 역량을 늘리거나, 식별된 비용을 줄일 때뿐입니다.
직원 경험과 회복탄력성도 여전히 중요할 수 있습니다. 그러나 리더는 재무 목표가 달성되지 않은 뒤 이를 편리한 설명으로 취급하는 대신, 그러한 혜택을 어떻게 측정할지 정의해야 합니다.
IDC는 이러한 이유로 더 폭넓은 가치 매핑을 제안합니다. 해당 프레임워크에는 기존 재무 지표와 함께 고객 신뢰, 회복탄력성, 지속가능성, 시간 범위가 포함됩니다.
이처럼 확장된 모델이 모호한 성공 주장에 대한 구실이 되어서는 안 됩니다. 각 차원에는 여전히 책임자, 기준선, 측정 방법, 검토일이 필요합니다.
따라서 운영 현실은 모델 붕괴만큼 극적이지는 않지만, 해결하기는 더 어렵습니다. 이는 기술, 재무, 보안, 법무, 사업 팀 간의 조율을 요구합니다.
어떤 모델 업데이트도 그러한 조율을 자동으로 만들어낼 수는 없습니다.
Agentic AI 거버넌스가 보안을 비즈니스 제약으로 바꾸는 방식
Agentic AI 거버넌스는 에이전트가 불확실한 출력을 연결된 시스템 전반의 행동으로 전환하기 때문에, 자율성을 안전하게 확장할 수 있는지를 결정합니다.
보안은 언제나 엔터프라이즈 기술 의사결정에 영향을 미쳐 왔습니다. Agentic 시스템은 모델의 불확실성을 자격 증명, 도구, 메모리, 운영 접근 권한과 결합하면서 문제를 바꿉니다.
기존 챗봇은 대체로 정보를 반환합니다. 에이전트는 요청을 해석하고, 계획을 수립하고, 애플리케이션을 호출하며, 새로운 결과를 받은 뒤에도 계속 행동할 수 있습니다.
이 능력은 공격 표면을 확장합니다. 악성 콘텐츠는 에이전트의 지침에 영향을 줄 수 있으며, 과도한 권한은 한 번의 잘못된 판단을 더 큰 사고로 이어지게 할 수 있습니다.
프롬프트 인젝션은 한 사례입니다. 공격자는 모델이 읽는 콘텐츠 안에 지침을 삽입해, 시스템이 승인된 작업에서 벗어나도록 유도하려 합니다.
에이전트가 메시지를 보내고, 데이터베이스를 수정하고, 기밀 기록을 검색하거나, 코드를 실행할 수 있을 때 위험은 커집니다. 오해를 부르는 응답은 가능한 실패 방식 중 하나에 불과해집니다.
IDC는 통제되지 않는 의사결정 연쇄, 불투명한 행동, 분절된 에스컬레이션을 경고합니다. IDC의 거버넌스 분석은 거버넌스를 최종 컴플라이언스 검토가 아니라 운영 인프라로 설명합니다.
IDC는 2030년까지 Global 1000 조직의 최대 20%가 소송, 벌금 또는 CIO 해임에 직면할 수 있다고 전망합니다. IDC는 이 위험을 취약한 AI 에이전트 거버넌스로 발생한 세간의 이목을 끈 장애와 연결합니다.
이는 관측된 실패율이 아니라 전망입니다. 보장된 결과가 아니라 잠재적 책임의 규모를 시사합니다.
IDC는 추적 가능성, 통합 거버넌스, 정의된 책임성 루프를 권고합니다. 이러한 통제 장치는 팀이 의사결정을 재구성하고, 정해진 경계를 넘기 전에 행동을 중단하는 데 도움을 줍니다.
추적 가능성이란 자율적 의사결정에 관여한 데이터, 모델, 지침, 도구 호출, 출력을 기록하는 것을 뜻합니다. 그러한 기록이 없으면 팀은 오류를 조사하거나 결과를 방어할 수 없습니다.
통합 거버넌스는 시스템 수명 주기 전반에서 보안, 데이터, 법무, 리스크, 사업 책임을 연결합니다. 모델만 검토하는 위원회로는 전체 워크플로를 거버넌스할 수 없습니다.
책임성 루프는 사람이 언제 행동을 승인, 검토 또는 중단해야 하는지를 정의합니다. 그 기준은 모델의 신뢰도만이 아니라 발생 가능한 결과에 따라 정해져야 합니다.
저위험 행동에는 더 넓은 자율성을 부여할 수 있습니다. 내부 알림을 보내는 일과 결제를 승인하거나 고객 계정을 변경하는 일은 결과가 다릅니다.
ID 통제도 똑같이 중요합니다. 각 에이전트는 개발자나 공유 서비스의 제한 없는 자격 증명을 빌리는 대신, 자체 ID, 권한, 책임자, 목적을 가져야 합니다.
권한은 최소 권한 원칙을 따라야 합니다. 에이전트에는 할당된 워크플로에 필요한 접근 권한만 부여하고, 그 이상의 권한은 부여하지 않아야 합니다.
조직에는 신뢰할 수 있는 인벤토리도 필요합니다. 특히 부서가 비즈니스 애플리케이션 안에서 에이전트를 구성할 수 있는 상황에서, 보안 팀은 존재 자체를 모르는 에이전트를 보호할 수 없습니다.
인벤토리에는 책임 소유권, 연결된 시스템, 승인된 데이터, 모델 제공업체, 평가 결과, 비상 통제가 기록돼야 합니다.
출시 후에는 지속적인 평가가 필요해집니다. 모델이 업데이트되고, 프롬프트가 진화하며, 연결 도구가 바뀌거나, 비즈니스 데이터에 새로운 패턴이 생기면 에이전트의 행동도 변할 수 있습니다.
IDC는 컨텍스트가 이동하고 엣지 케이스가 누적됨에 따라 성능이 저하될 수 있다고 지적합니다. 이는 에이전트를 완료된 배포가 아니라 지속적으로 관리해야 하는 서비스로 만듭니다.
따라서 보안과 ROI는 수렴합니다. 모니터링, 평가, 접근 통제, 사고 대응, 사람의 검토는 모두 운영 비용을 추가합니다.
이러한 통제를 제외한 비즈니스 사례는 인위적으로 유리한 수익률을 제시합니다. 전망을 지키기 위해 이를 제거하면 재무적 압박이 보안 노출로 전가됩니다.
이것이 CIO가 관리해야 할 핵심 상충 관계입니다. 더 많은 자율성은 속도와 역량을 높일 수 있지만, 보증 비용도 증가시킵니다.
답은 모든 행동을 무제한으로 검토하는 것이 아닙니다. 그렇게 하면 에이전트를 정당화했던 효율성이 사라집니다.
조직에는 리스크 기반 자율성이 필요합니다. 되돌릴 수 있고 관찰 가능한 행동은 자동화하는 한편, 법적·재무적·안전상 결과를 초래할 수 있는 의사결정에는 사람의 승인을 요구할 수 있습니다.
Agentic AI 거버넌스는 종료 절차도 포괄해야 합니다. 팀은 사고 발생 시 자격 증명을 회수하고, 워크플로를 중단하며, 메모리를 격리하고, 증거를 보존할 수 있어야 합니다.
이러한 역량이 없으면 여러 팀이 책임 소유권을 논의하는 동안에도 에이전트는 계속 운영될 수 있습니다. 모델이 의도대로 작동했더라도 이는 조직적 통제 실패입니다.
숫자가 여전히 입증할 수 없는 것
현재 उपलब्ध한 통계는 광범위한 가치 문제를 보여주지만, 하나의 보편적인 AI 프로젝트 실패율을 뒷받침하지는 않습니다.
google news의 프레이밍은 이분법적 해석을 부추깁니다. 프로젝트는 성공하거나 실패하며, 하나의 비율이 전체 시장을 요약한다는 식입니다.
엔터프라이즈 배포는 좀처럼 그 모델에 들어맞지 않습니다. 프로젝트는 기술 벤치마크를 충족하고, 도입 목표를 놓치며, 예산 내에 머물면서도 측정 가능한 매출을 전혀 창출하지 못할 수 있습니다.
다른 프로젝트는 원래 비용을 초과하면서도 전략적으로 중요한 지식이나 고객 혜택을 창출할 수 있습니다. 성공으로 간주되는지는 평가 프레임워크에 달려 있습니다.
설문 문항도 결과를 바꿉니다. “측정 가능한 결과를 제공했다”는 “기대에 부응했다”, “프로덕션에 진입했다”, “재무적 수익을 창출했다”와 다릅니다.
표본 선정도 중요합니다. 기술 리더를 대상으로 한 설문은 비즈니스 사용자, 재무 팀 또는 개별 프로젝트를 대상으로 한 연구와 다른 결과를 낼 수 있습니다.
분모도 또 다른 문제를 만듭니다. 일부 연구는 모든 프로토타입을 집계합니다. 다른 연구는 프로덕션 배포 또는 고위 리더에게 알려진 이니셔티브만 포함합니다.
시간 범위도 다릅니다. AI 시스템은 그 혜택이 나타나기 전까지 여러 분기에 걸친 워크플로 재설계와 도입이 필요할 수 있습니다.
한 분기 후 이를 실패로 선언하는 것은 성급할 수 있습니다. 증거 없이 무기한 계속하는 것은 더 많은 자본을 낭비할 수 있습니다.
이러한 한계가 IDC의 발견을 무효화하는 것은 아닙니다. 이는 독자가 그 결과에서 책임 있게 도출할 수 있는 결론의 범위를 정의합니다.
가장 강력한 결론은 기업이 AI 가치를 측정하고 반복하는 데 어려움을 겪고 있다는 것입니다. 가장 약한 결론은 모든 프로젝트 중 고정된 비율이 같은 이유로 확실히 실패했다는 것입니다.
이 구분은 책임성에도 영향을 미칩니다. 모델이 자동으로 비난받으면 조직은 취약한 결과를 초래한 워크플로, 데이터, 거버넌스 문제를 그대로 둔 채 공급업체만 교체할 수 있습니다.
모든 문제가 조직의 준비 부족 탓으로 돌려지면 공급업체는 신뢰할 수 없는 제품에 대한 책임을 피할 수 있습니다. 두 서사 모두 면밀한 검토가 필요합니다.
모델 품질은 여전히 중요합니다. 환각, 일관성 없는 추론, 지연 시간, 제한된 컨텍스트, 도구 사용 오류는 애플리케이션을 프로덕션에 부적합하게 만들 수 있습니다.
공급업체 설계도 중요합니다. 구매자는 사용 가능한 감사 로그, 권한 통제, 모델 변경 알림, 평가 도구, 예측 가능한 서비스 동작이 필요합니다.
조직은 적절한 사용 사례를 선택하고 접근 권한을 안전하게 구성할 책임이 있습니다. 공급업체는 역량과 한계를 정확하게 설명할 책임이 있습니다.
따라서 IDC AI 프로젝트 실패 논의는 하나의 편리한 범인을 찾는 대신 더 나은 질문을 이끌어내야 합니다.
프로젝트는 어떤 기준 상태를 개선하려 했는가? 어떤 사업 책임자가 목표를 수용했는가? 보안 및 운영 비용은 승인 전에 포함됐는가?
파일럿 지원이 끝난 뒤에도 직원들은 시스템을 사용했는가? 드문 사례와 변화하는 데이터에서도 출력 품질은 수용 가능한 수준을 유지했는가?
오류 발생 후 팀은 에이전트의 행동을 재구성할 수 있었는가? 관련 없는 시스템을 비활성화하지 않고도 워크플로를 즉시 중단할 수 있었는가?
이러한 질문은 논쟁적인 헤드라인을 운영 검토로 바꿉니다. 또한 파일럿이 일정에 맞춰 출시됐는지보다 답하기 어렵습니다.
독립적인 비교도 신중함의 필요성을 뒷받침합니다. Gartner는 성숙도가 높은 조직의 45%가 AI 프로젝트를 최소 3년 동안 운영 상태로 유지했다고 보고했습니다.
Gartner의 AI 성숙도 설문조사는 장기 운영을 성숙한 관행과 연결했지만, 지속 기간만으로 비즈니스 가치를 입증할 수는 없습니다.
프로젝트는 전략적 또는 정치적 이유로 운영 상태를 유지할 수 있습니다. 또한 역량을 다른 플랫폼으로 성공적으로 이전한 뒤 종료될 수도 있습니다.
어떤 단일 지표도 전체 결과를 포착하지 못합니다. 조직에는 기술 성능, 도입, 재무적 영향, 리스크, 전략적 가치를 구분하는 포트폴리오 관점이 필요합니다.
그 포트폴리오에는 실패한 프로젝트도 포함돼야 합니다. 중단된 파일럿을 숨기면 오해를 낳는 그림이 만들어지고, 팀이 반복되는 원인을 인식하지 못하게 됩니다.
또한 건전한 중단과 통제되지 않은 실패를 구분해야 합니다. 취약한 프로젝트를 조기에 종료하는 것은 저성과가 아니라 규율 있는 거버넌스를 보여줄 수 있습니다.
한 CIO.com 소스는 시작된 프로젝트의 약 3분의 1을 중단하는 것이 건전하다고 설명했습니다. 해당 조직은 단계별 자금 지원과 성과 점검 지점을 활용해 취약한 작업이 영구적인 자원을 소모하지 않도록 했습니다.
이 접근 방식은 실패를 재정의합니다. 위험한 프로젝트가 항상 중단되는 프로젝트는 아닙니다. 아무도 의사결정을 책임지지 않아 증거 없이 계속되는 프로젝트일 수 있습니다.
CIO가 다음으로 주시해야 할 세 가지 신호
다음 시험대는 조직이 파일럿 수를 성과 보고, 통제된 자율성, 그리고 직원이 실제 워크플로 안에서 AI를 사용한다는 증거로 대체하는지 여부입니다.
첫 번째 신호는 공식적인 AI 가치 플레이북의 도입입니다. IDC는 2027년까지 Asia-Pacific 500 CIO의 60%가 이를 구축하는 임무를 맡게 될 것으로 예상합니다.
가치 플레이북은 사용 사례 선정, 기준선, 비용 모델, 책임 주체, 검토 기준을 표준화합니다. 이를 통해 리더들은 일관된 근거를 바탕으로 프로젝트를 비교할 수 있습니다.
조직이 측정 가능한 성과가 없는 프로젝트를 종료하기 시작한다면, 이 신호는 IDC의 주장을 강화할 것입니다. 반면 포트폴리오 성과 개선 없이 공식 측정만 확대된다면 그 주장은 약화될 것입니다.
핵심 지표는 발행된 플레이북의 수가 아닙니다. 명확한 책임자, 기준선, 전체 운영비, 정기적인 성과 검토 일정이 갖춰진 프로덕션 이니셔티브의 비중입니다.
이사회는 조직이 간접적 이점을 어떻게 보고하는지도 주시해야 합니다. 고객 신뢰, 회복탄력성, 더 빠른 의사결정은 중요할 수 있지만, 각각 관찰 가능한 측정 방법이 필요합니다.
두 번째 신호는 강제 가능한 에이전트 통제의 도입입니다. 정책만으로는 여러 비즈니스 시스템 전반에서 지속적으로 행동하는 소프트웨어를 관리할 수 없습니다.
CIO는 전용 ID, 제한된 권한, 완전한 작업 로그, 사람에게 에스컬레이션하는 규칙, 검증된 중단 절차를 갖춘 에이전트의 수를 추적해야 합니다.
보안팀도 심각도와 근본 원인별로 사고를 보고해야 합니다. 사고 건수 증가는 안전성이 악화됐음을 뜻할 수도 있고, 이전까지 숨겨져 있던 활동에 대한 가시성이 개선됐음을 의미할 수도 있습니다.
더 의미 있는 추세는 에이전트 사용이 확대되는 가운데 심각한 사고가 감소하는지 여부입니다. 조직은 사고율을 에이전트 작업 수, 연결된 시스템 수, 위험 수준과 비교해야 합니다.
IDC의 아시아태평양 전망은 불충분한 에이전트 통제가 법적 책임과 경영진의 책임을 포함한 심각한 결과를 초래할 것으로 예측합니다. 자율 배포가 기술적 감독보다 더 빠르게 확대된다면 이 전망의 신뢰도는 높아집니다.
조직이 위험 기반 통제가 사용량과 함께 확장될 수 있음을 입증한다면 신뢰도는 낮아집니다. 근거에는 감사 결과, 격리 시간, 권한 위반, 성공적인 사람의 개입이 포함돼야 합니다.
세 번째 신호는 워크플로 성과와 연결된 프로덕션 도입입니다. 파일럿의 정확도와 직원들의 열의는 일상 운영에서의 지속적인 사용을 대체할 수 없습니다.
CIO는 활성 사용량, 완료율, 예외 발생 빈도, 검토 시간, 그리고 생성된 작업 중 유용한 결과에 도달하는 비율을 모니터링해야 합니다.
또한 배포 지원이 줄어든 뒤 어떤 일이 일어나는지도 측정해야 합니다. 개발자의 지속적인 개입에 의존하는 시스템은 반복 가능한 프로덕션 단계에 도달한 것이 아닙니다.
사업 부문은 AI가 처리 시간을 단축하고, 역량을 확대하며, 오류를 줄이거나 고객 성과를 개선하는지 보고해야 합니다. 재무팀은 주장되는 절감 효과를 검증해야 합니다.
사용량은 늘지만 측정 가능한 가치는 미약하다면, 이 신호는 google news의 서사를 강화할 것입니다. 이는 도입만으로 ROI 문제를 해결할 수 없음을 보여줄 것입니다.
반대로 성숙한 프로그램이 전체 보안 및 운영 비용을 포함한 뒤에도 여러 워크플로에서 반복 가능한 성과를 입증한다면, 그 서사는 약화될 것입니다.
이 세 가지 신호는 서로 연결돼 있습니다. 더 나은 가치 모델은 더 강력한 사용 사례를 선택하고, 더 강력한 통제는 안전한 자율성을 허용하며, 지속적인 워크플로 도입은 측정 가능한 근거를 만들어 냅니다.
한 요소라도 빠지면 결과는 취약해집니다. 통제 없는 수익성 높은 시스템은 숨겨진 노출을 안고 있습니다. 사용자 없는 안전한 시스템은 가치를 만들지 못합니다.
기준선 측정이 없는 인기 시스템은 인상적인 활동을 만들어 내지만 수익은 불확실합니다.
CIO는 또 다른 포괄적 백분율로 이 논쟁에 답해야 한다는 압박을 거부해야 합니다. 각자의 포트폴리오는 집계된 헤드라인보다 더 유용한 근거를 제공합니다.
우선 중요한 워크플로를 소수 선정하고 현재 성과를 문서화할 수 있습니다. 각 프로젝트에는 비즈니스 책임자, 기술 책임자, 위험 등급, 검토 일정을 지정해야 합니다.
팀은 초기 개발을 넘어선 비용을 계산해야 합니다. 여기에는 모델 사용료, 통합 유지보수, 모니터링, 평가, 보안, 지원, 사람의 검토가 포함됩니다.
자율성을 부여하기 전에 허용할 수 없는 결과를 정의해야 합니다. 이러한 경계에는 데이터 노출, 재무적 한도, 고객 영향, 금지된 도구 작업이 포함될 수 있습니다.
마지막으로, 취소된 프로젝트를 포함한 내부 결과를 공개해야 합니다. 투명한 보고는 부실한 프로젝트가 열의만으로 살아남기 어렵게 만듭니다.
논란이 된 45% 주장은 보편적인 성과표가 아니라 경고로서 유용합니다. 이는 부정확한 측정이 얼마나 쉽게 확신에 찬 AI 헤드라인이 되는지를 드러냅니다.
더 나은 대응은 하나의 google news 백분율을 두고 논쟁하는 것이 아닙니다. 각 AI 시스템이 전체 비용과 위험을 모두 계산한 뒤에도 가치를 창출한다는 근거를 요구하는 것입니다.
귀하의 조직에서는 어떤 프로젝트가 이 검증을 통과할 수 있으며, 어떤 프로젝트는 성공의 의미를 아무도 정의하지 않았다는 이유로 여전히 자금을 지원받고 있습니까?



