장애가 났을 때 개발팀은 애플리케이션을, 운영팀은 인프라를, AI 담당자는 에이전트의 실행 과정을 따로 살펴본다면 원인을 찾는 데 시간이 걸릴 수 있다. Amazon CloudWatch Omni는 이 단서들을 애플리케이션 중심의 공동 조사 공간에 모으려는 AWS의 AI 기반 관측 기능이다. AWS는 2026년 9월 22일 블로그에서 Omni를 소개했고, 23일에는 정식 출시를 알렸다.
23
17
같은 화면에서 무엇을 볼 수 있나
Omni는 팀과 팀이 운영하는 애플리케이션을 중심으로 구성된다. 구성원은 조직 전용 URL에서 기존 계정으로 로그인할 수 있으며, AWS 관리 콘솔 접근 권한이 없어도 Omni를 이용할 수 있다. AWS는 자동으로 파악한 애플리케이션 구성·연결 관계, 자연어 질의, AWS DevOps Agent를 활용한 조사 안내도 소개했다. 개발자와 운영자가 같은 문제를 놓고 단서를 맞춰볼 수 있도록 한 설계다.
23
20
다만 한곳에서 조사한다는 것과 모든 시스템이 저절로 보인다는 것은 다르다. AWS에 따르면 CloudWatch로 이미 전송 중인 관측 데이터는 재설정 없이 Omni에 나타난다. 그 밖의 워크로드는 개방형 관측 표준인 OpenTelemetry로 계측한 뒤 OTLP(OpenTelemetry Protocol) 엔드포인트로 데이터를 보낼 수 있다. AWS 계정이나 클라우드 하나에만 조사를 묶어둘 필요는 줄지만, 계측되지 않은 서비스의 상태까지 확인할 수 있는 것은 아니다.
23
17
AI 에이전트에서는 ‘응답했는가’만으로 부족하다
생성형 AI 에이전트는 응답을 돌려줬더라도 그 과정에서 예상과 다른 경로를 거쳤을 수 있다. Omni의 에이전트 관련 기능은 요청의 성공 여부를 확인하는 데 그치지 않고, 실행 과정을 추적하고 결과 품질을 평가하며 문제가 생긴 단계를 살펴보도록 설계됐다. 출시 관련 보도에는 에이전트 워크플로 추적, 프롬프트 비교, 내장 평가 도구 등이 소개됐다.
18
24
출시 시점이 중요한 이유
New Relic의 ‘2026 Observability Forecast’에 따르면, 조사 대상 기업의 영향이 큰 장애로 인한 연간 환산 손실 추정치는 7,400만 달러, 시간당 평균 손실은 185만 달러다. 이런 장애를 발견하는 데 걸린 평균 시간은 41분, 해결하는 데 걸린 평균 시간은 54분으로 집계됐다. 이는 조사 결과이지 Omni를 도입하면 절약할 수 있는 금액이나 시간을 뜻하지 않는다.
33
대응 인력의 부담도 크다. New Relic의 별도 ‘2026 AI Impact Report’는 엔지니어가 근무 시간의 33%를 긴급 대응이나 시스템 중단 문제 처리에 쓴다고 밝혔다. 또 자사 AI 강화 관측 기능 이용자가 비이용자보다 사고를 25% 빠르게 해결했다고 보고했다. 이 비교를 CloudWatch Omni에서도 같은 개선이 나타날 것이라는 근거로 해석해서는 안 된다.
8
6
에이전트 관측의 공백은 더 직접적인 배경이다. New Relic 조사에서 조직의 25%는 운영 환경에 AI 에이전트를 배포하고도 이를 모니터링하지 않는다고 답했다. Omni는 애플리케이션 상태와 에이전트의 동작을 같은 조사에서 살펴볼 방법을 제시한다. 실제 효용은 필요한 시스템이 얼마나 계측돼 있는지, 수집한 데이터가 문제를 설명하기에 충분한지, 팀이 그 단서로 얼마나 빨리 판단할 수 있는지에 달려 있다.
33
23