
AI 에이전트가 인간 사용자보다 약 5배 많은 토큰을 쓰고 있으며, 이 차이는 앞으로 10배 이상으로 커질 수 있다는 분석이 나왔다. 다만 에이전트가 사용하는 토큰의 대부분은 새 요청을 처리하는 데 쓰이기보다 이미 본 대화와 문맥을 다시 읽는 캐시 프롬프트인 것으로 나타났다. 이 방식은 처리 비용을 낮추지만, 메모리에 저장해야 하는 데이터 규모를 키워 고대역폭메모리(HBM) 수요를 압박할 수 있다.
퓨처럼 그룹의 대니얼 뉴먼 최고경영자(CEO)는 9월 30일 X 게시물에서 “AI는 현재 인간보다 AI에 의해 5배 더 많이 사용된다”며 이 수치가 “10배, 그 이상으로 가속할 것”이라고 밝혔다. 그는 투자사 안드리센 호로위츠(a16z)가 오픈라우터 데이터를 토대로 제시한 차트를 인용했다.
8월 기준 에이전트 7조3000억 토큰, 인간 1조4000억 토큰
해당 차트에 따르면 8월 기준 오픈라우터에서 에이전트 사용량은 7조3000억 토큰, 인간 사용량은 1조4000억 토큰이었다. 에이전트 사용량이 인간 사용량을 처음 넘어선 시점은 2월로, 약 6개월 뒤 격차가 크게 벌어진 셈이다.
오픈라우터의 인사이트 책임자 피터 워커가 제시한 ‘유형별 7일 평균 토큰 사용량’ 차트에서는 2월 역전 이후 에이전트 토큰 사용량이 14배 늘어난 반면 인간 사용량은 2.8배 증가한 것으로 집계됐다. 오픈라우터는 API 키를 에이전트형, 혼합형, 인간형의 세 범주로 분류한다. 이 분류에는 도구 호출 비율, 대화 턴 수, 요청 간 시간 간격 등을 포함한 7개 신호의 가중 복합 점수가 활용된다.
인간과 에이전트 사용이 섞인 것으로 보이는 혼합형 트래픽도 같은 기간 4.7배 늘었다. 이 트래픽을 어느 쪽으로 분류하느냐에 따라 에이전트와 인간 간 실제 격차는 달라질 수 있다. 또한 이 지표는 지출액이 아니라 토큰 물량을 측정한 것이며, 오픈라우터 단일 플랫폼의 데이터라는 한계가 있다. 증가 추세도 매달 일관되지는 않아 4월과 7월에는 감소 구간이 나타났다.
에이전트 토큰의 85% 이상은 캐시 프롬프트
a16z는 에이전트 토큰의 85% 이상이 캐시된 프롬프트에서 나온다고 설명했다. 토큰 사용량의 상대적 증가분도 거의 전부 캐시 토큰이 차지한다는 분석이다. 캐시 토큰은 매번 프롬프트를 처음부터 처리하는 것보다 비용이 훨씬 적게 들지만, 모델이 문맥을 유지하려면 데이터를 메모리에 보관해야 한다.
이 저장 영역은 KV 캐시로 불린다. a16z는 오픈라우터 투자사이기도 하며, 캐시 프롬프트 확대가 HBM 수요 증가와 연결된다고 봤다. 관련 보도에 따르면 KV 캐시는 GPU의 HBM 용량보다 빠르게 커지고 있다.
콜센터 컨설팅 업체가 임대한 엔비디아 H200에서 딥시크를 시험한 사례에서도 비슷한 양상이 관측됐다. 이 업체는 9월 자사 에이전트의 클로드 코드 사용량에서 전체 입력의 96%가 이전 대화를 다시 읽는 데 쓰였다고 밝혔다. 이는 토큰 수가 실제 청구 비용을 과대하게 보일 수 있음을 시사하지만, 메모리 하드웨어 비용과 수요는 여전히 실질적인 문제라는 뜻이기도 하다.
메모리 공급 부족 우려와 맞물려
에이전트 사용 확대는 다른 조사에서도 나타난다. 맥킨지의 2026년 AI 현황 조사에서는 대기업 응답자의 40%가 AI 에이전트를 확장 배치하고 있다고 답했다. 이는 1년 전 27%에서 상승한 수치다.
메모리 공급 여건은 이미 빠듯하다는 전망이 나온 상태다. 마이크론은 RAM과 스토리지 부족이 2027년과 2028년에 더 심해지고, 고객 가격도 올해보다 높아질 것으로 예상했다. 메모리 제조사들이 AI 데이터센터용 HBM 공급을 우선시하고 있다는 점도 배경으로 꼽힌다. 뉴먼의 전망대로 AI 에이전트 사용량이 인간의 10배, 20배, 30배 수준으로 확대될 경우 PC 구매자는 더 많은 에이전트 수요와 메모리를 놓고 경쟁하게 될 수 있다.
출처: Tom's Hardware — 원문 기사 보기 (AI agents use 5x more tokens than humans as cached prompts explode, headed for 10x — agents are mostly rereading what they've already seen, skyrocketing KV cache demand threatens already-worsening RAM shortages - Tom's Hardware)


