
오픈라우터에서 인간 사용량 추월 후 격차 확대
퓨처럼 그룹의 다니엘 뉴먼 CEO는 X 게시물에서 AI가 현재 인간보다 AI에 의해 5배 더 많이 사용되고 있으며, 이 비율은 10배 이상으로 커질 것이라고 밝혔다. 그가 공유한 안드리센 호로위츠(a16z)의 오픈라우터 데이터 차트에 따르면 8월 기준 AI 에이전트의 토큰 사용량은 7조3000억 개로, 인간 사용자의 1조4000억 개를 크게 웃돌았다.
에이전트 사용량이 인간 사용량을 처음 넘어선 것은 2월이며, 이후 6개월간 격차가 확대됐다. 오픈라우터 인사이트 총괄 피터 워커가 제시한 7일 평균 토큰 사용량 차트에서는 2월 교차 시점 이후 에이전트 토큰 사용량이 14배 늘어난 반면 인간 사용량은 2.8배 증가한 것으로 나타났다.
오픈라우터는 API 키를 에이전트형, 혼합형, 인간형의 세 범주로 분류한다. 분류에는 도구 호출 비율, 대화 턴 수, 요청 간 시간 간격 등을 포함한 7개 신호의 가중 복합 점수가 활용된다. 인간과 에이전트가 함께 작동하는 트래픽을 포함할 가능성이 있는 혼합형 범주는 같은 기간 약 4.7배 증가했다. 이 트래픽이 어느 쪽에 얼마나 배분되는지에 따라 에이전트와 인간 사이의 실제 격차는 달라질 수 있다.
에이전트 토큰의 85% 이상은 캐시된 프롬프트
다만 에이전트가 소비하는 토큰 대부분은 새 내용을 처리하는 것이 아니라 이미 본 문맥을 다시 읽는 데 쓰인다. a16z는 오픈라우터 자료를 인용해 에이전트 토큰의 85% 이상이 캐시된 프롬프트에서 나온다고 설명했다. 토큰 사용량의 상대적 증가분도 거의 전부 캐시 토큰에서 발생했다는 분석이다.
캐시 토큰은 프롬프트를 처음부터 처리하는 경우보다 비용이 훨씬 낮다. 따라서 토큰 규모가 곧바로 사용자 지출 규모를 뜻하지는 않는다. 이번 수치도 단일 플랫폼인 오픈라우터에서 집계된 토큰 물량이며, 4월과 7월에는 사용량이 감소하는 흐름도 있었다.
그럼에도 에이전트 도입 자체는 다른 조사에서도 늘고 있다. 맥킨지의 2026년 AI 현황 조사에서는 대규모 조직 응답자의 40%가 AI 에이전트를 확장 배포 중이라고 답했다. 이는 1년 전의 27%에서 증가한 수치다.
낮은 토큰 단가와 별개로 메모리 부담은 커져
캐시된 문맥은 모델의 키-값(KV) 캐시에 메모리 형태로 유지돼야 한다. a16z는 이를 고대역폭 메모리(HBM) 수요 확대와 연결했고, KV 캐시가 GPU HBM 용량보다 빠르게 커지고 있다는 지적도 나왔다. 즉 캐시 처리의 토큰 단가는 낮더라도 하드웨어 측면의 메모리 비용은 여전히 커질 수 있다.
임대한 엔비디아 H200에서 딥시크를 시험한 한 콜센터 컨설팅 업체의 기록도 비슷한 양상을 보였다. 이 업체는 9월 자사 에이전트의 클로드 코드 사용량에서 전체 입력의 96%가 이전 대화를 재독하는 작업이었다고 밝혔다. 오픈라우터 데이터와 함께 보면 토큰 수가 청구 비용을 과대하게 보이게 할 수 있지만, 문맥 보관에 필요한 메모리 수요는 실재한다는 뜻이다.
메모리 공급은 이미 빠듯한 상황이다. 마이크론은 메모리 제조업체들이 AI 데이터센터용 HBM을 우선시하는 가운데 2027년과 2028년 RAM 및 스토리지 부족이 더 심해지고, 고객 가격도 올해보다 높아질 것으로 전망했다. 뉴먼이 예상한 대로 AI 대 AI 사용 비율이 10배, 20배, 30배로 높아질 경우 PC 구매자들은 더 많은 에이전트 수요와 메모리를 놓고 경쟁하게 될 수 있다.
출처: Tom's Hardware — 원문 기사 보기 (AI agents use 5x more tokens than humans as cached prompts explode, headed for 10x — agents are mostly rereading what they've already seen, skyrocketing KV cache demand threatens already-worsening RAM shortages - Tom's Hardware)


