[투자정보] AI 경쟁의 승부처가 모델 크기에서 ‘긴 업무를 끝내는 시스템’으로 이동했음
📋 핵심 내용 요약
국제머신러닝학회(ICML) 2026의 가장 큰 변화는 짧은 질문의 정답률보다 여러 단계로 이어지는 업무의 완주율과 실패 원인을 평가하기 시작했다는 점임. [팩트, p1]
에이전트형 인공지능은 계획, 검색, 도구 호출, 검증, 재시도를 반복하므로 질문 한 건이 소비하는 토큰과 연산량이 기존 대화형 인공지능보다 크게 늘어나는 구조임. [해석]
Vercel 인공지능 게이트웨이에서 도구 호출로 끝난 요청은 2026년 4월 전체 요청의 22.2%였지만 전체 토큰의 58.9%를 사용해, 에이전트형 요청이 일반 요청보다 훨씬 많은 자원을 소비했음. [팩트, p4]
법률·의료·바이오는 성공한 업무 한 건의 가치와 오류 비용이 모두 크기 때문에, 비싼 추론과 반복 검증을 먼저 받아들일 가능성이 높은 산업임. [해석]
장기 작업은 키-값 캐시(KV cache, 이전 문맥의 계산 결과를 저장하는 메모리)의 부담을 키우며, 향후 인공지능 인프라 경쟁은 단순한 연산 성능보다 메모리 관리와 성공 업무당 총비용을 낮추는 방향으로 이동함. [해석]
확산형 언어모델(Diffusion language model)은 여러 토큰을 동시에 수정해 메모리 부담을 낮출 수 있지만, 반복 계산과 품질 저하 가능성이 남아 자기회귀형 모델(Autoregressive model, 앞 토큰을 바탕으로 다음 토큰을 순서대로 생성하는 방식)을 전면 대체하기에는 이른 단계임. [해석]
기업용 인공지능의 현실적인 구조는 하나의 거대 모델이 모든 일을 맡는 방식보다 범용 대형언어모델(LLM), 전문 수치 모델, 데이터베이스, 검증 모델, 사람의 승인을 연결하는 분업형 구조에 가까움. [팩트, p12]
투자 관점의 핵심은 인공지능 사용량 증가가 실제로 가속기 출하, 서버당 고대역폭메모리(HBM)와 디램(DRAM) 탑재량, 메모리 가격, 공급사 마진 증가로 이어지는지를 확인하는 데 있음. [해석]
🚀 사건의 핵심은?
이 보고서의 핵심 주제는 “더 똑똑한 한 번의 답변”보다 “길고 복잡한 업무를 끝까지 수행하는 시스템”이 인공지능 산업의 다음 성장 단위가 되고 있다는 점임. [해석]
이 변화가 중요한 이유는 업무가 길어질수록 생성 횟수, 도구 호출, 중간 검증, 실패 후 재작업이 함께 늘어 인공지능 서비스의 사용량과 인프라 비용이 동시에 커지기 때문임. [해석]
따라서 인공지능 산업의 평가 기준은 모델별 토큰 가격에서 업무 한 건을 끝내는 데 들어가는 총비용으로 이동하고 있음. [해석]
ICML은 머신러닝 이론, 학습 방법, 시스템, 산업 응용을 다루는 대표 학회이며, 2026년 행사는 7월 6일부터 11일까지 서울 코엑스에서 열렸음. [팩트, p2]
[그림 1, p2]
DS투자증권이 2025년 3,339건과 2026년 6,628건의 논문 제목·초록을 같은 기준으로 분석한 결과, 추론과 검증 관련 비중은 8.93%에서 20.73%로 상승했음. [팩트, p3]
같은 분석에서 에이전트 작업은 3.03%에서 7.20%, 장기 작업은 2.19%에서 5.94%, 확산형 언어모델은 0.09%에서 1.31%로 증가했음. [팩트, p3]
[그림 2, p2]
이 수치는 논문의 질이나 시장 규모를 뜻하지 않지만, 연구 관심이 단순 생성에서 에이전트·검증·장기 업무로 이동했음을 보여주는 방향성 지표임. [해석]
워크숍 수도 33개에서 44개로 늘었고 제안서는 약 150건에서 247건으로 증가했으며, 제목에 에이전트형 인공지능 관련 표현이 들어간 제안만 60건을 넘었음. [팩트, p3]
🔄 장기 워크플로가 토큰 경제를 바꾸는 방식임
기존 대화형 인공지능은 질문과 답변이 한 번씩 오가는 구조였지만, 에이전트형 인공지능은 계획 수립→검색→도구 호출→결과 평가→재시도를 반복하는 구조임. [팩트, p4]
사고과정(Chain-of-Thought, 문제를 여러 추론 단계로 나누는 방식)이 생성 단계를 늘렸다면, 판정 모델(judge)과 검증 모델(verifier)은 중간 결과를 검사해 다음 행동을 결정함. [팩트, p4]
생성 모델과 판정 모델이 같은 편향을 공유하면 두 모델이 동일한 오답을 정답으로 착각할 수 있어, 검증 모델을 추가하는 것만으로 신뢰성이 자동으로 확보되지는 않음. [해석]
UltraHorizon은 고부하 조건에서 20만 토큰과 400회가 넘는 도구 호출을 사용해, 장기 작업이 일반 대화와 전혀 다른 비용 구조를 가진다는 점을 보여줬음. [팩트, p5]
KellyBench는 한 시즌에 500~1,000회의 도구 호출을 사용했지만 주요 모델들의 다섯 번 실행 평균 수익률이 모두 음수였으며, 호출량 증가가 성공을 보장하지는 않음을 보여줬음. [팩트, p5]
Qiushi Discovery Engine은 한 연구에 1억4,590만 토큰을 사용해 장비 검증까지 연결했다고 보고했으며, 연구형 에이전트는 단순한 문답보다 훨씬 큰 계산 자원을 요구함. [팩트, p5]
UltraHorizon의 결과는 작업 단계가 늘어날수록 에이전트 성능이 낮아지고 오류가 누적되는 경향을 보여, 장기 작업의 핵심 병목이 단순한 모델 지능이 아니라 상태 관리와 오류 통제에 있음을 시사함. [해석]
[그림 4, p5]
모델 효율과 토큰 단가가 개선돼도 기업이 더 긴 업무와 더 많은 동시 작업을 맡기면 총사용량과 총지출은 오히려 증가할 수 있음. [해석]
이는 자동차 연비가 좋아져도 운행 거리가 더 빠르게 늘면 전체 연료 사용량이 증가하는 것과 같은 구조임. [해석]
💼 전문 산업에서 고비용 추론이 먼저 자리 잡는 이유임
법률 인공지능은 규칙을 설명하는 능력보다 실제 문서 작성과 도구 사용 과정에서 법률을 준수하는 행동을 검증하는 방향으로 발전하고 있음. [팩트, p7]
기업법 상황에서는 일반적으로 합법인 문서 수정이나 주식 거래도 조사·파산 상황에서는 불법이 될 수 있어, 법률 지식과 상황별 행동 판단은 서로 다른 능력임. [팩트, p7]
법률 업무는 검색→추론→문서 작성→검토→승인→감사 기록으로 이어지므로 토큰 소비가 많지만, 오류 한 건의 손실도 커 높은 추론 비용을 감당할 경제적 이유가 있음. [해석]
Thomson Reuters 조사에서 생성형 인공지능을 사용하는 조직은 2025년 22%에서 2026년 40%로 증가했지만, 에이전트형 인공지능 도입은 15%, 투자수익률 추적 조직은 18%에 그쳤음. [팩트, p7]
이는 사용 확대 속도에 비해 책임 소재와 경제성 검증 체계가 뒤처져 있음을 의미하며, 법률 인공지능의 경쟁력이 모델보다 승인·감사·검증 절차에서 갈릴 수 있음을 보여줌. [해석]
바이오 분야에서는 생성 모델이 신약 후보를 제시하는 데서 끝나지 않고 실험 결과를 다음 행동에 반영하는 폐루프(closed loop, 결과를 다시 입력해 다음 판단을 수정하는 구조) 연구로 이동했음. [팩트, p8]
분자 도킹용 확산 모델의 반복 단계를 줄인 연구는 특정 조건에서 AlphaFold3 대비 300배가 넘는 속도 향상을 보고했지만, 분자 도킹 결과를 일반 언어모델의 비용 절감으로 확대 해석해서는 안 됨. [팩트, p8]
의료 분야의 MedScope는 긴 임상 영상을 모두 처리하지 않고 필요한 구간을 먼저 찾은 뒤 세부 내용을 확인해, 의료 인공지능의 핵심이 답변 생성보다 근거 탐색과 검증에 있음을 보여줬음. [팩트, p9]
[그림 7, p9]
미국의사협회 조사에서 인공지능을 알고 있거나 사용한다는 응답은 2023년 38%에서 2026년 81%로 증가했고, 한 가지 이상 활용 사례를 업무에 적용했다는 응답은 72%였음. [팩트, p9]
다만 의료·법률·바이오의 실제 배포에는 내부 데이터 접근권, 감사 기록, 전문가 승인, 개인정보 보호, 명확한 책임 주체가 필요해 모델 성능만으로 상용화가 완성되지 않음. [해석]
🧩 기업 인공지능은 거대 모델 하나보다 조합형 구조로 발전함
정형 데이터는 표와 시계열처럼 일정한 구조를 가진 숫자 데이터이며, 이 영역에서는 범용 대형언어모델보다 해당 데이터에 맞춰 학습한 전문 모델이 강한 기준선으로 남아 있음. [팩트, p10]
범용 대형언어모델은 숫자 예측을 직접 맡기보다 전문 모델의 결과를 보고서·뉴스·계약 조건과 연결하고 사람이 이해할 수 있는 언어로 설명하는 역할에 강점이 있음. [해석]
현실적인 기업 인공지능 구조는
데이터베이스·전문 모델 → 대형언어모델 조정 → 판정 모델 검증 → 사람 최종 승인의 흐름으로 정리됨. [해석]XTX Markets는 학습에는 그래픽처리장치(GPU)를 사용하고 배포에는 맞춤형 반도체를 활용하는 구조를 제시했으며, 기업은 업무별 비용과 지연시간에 따라 반도체를 나눠 쓸 수 있음을 보여줬음. [팩트, p12]
[그림 10, p12]
모델을 실제 시장에 배포하면 그 모델의 거래 행동이 이후 데이터에 영향을 주므로, 과거 데이터로 학습한 규칙이 그대로 유지되지 않는 분포 이동 문제가 발생함. [팩트, p12]
따라서 기업용 인공지능의 진입장벽은 모델 자체보다 데이터를 연결하고 모델을 배치하며 오류를 감시하고 지속적으로 갱신하는 운영 계층에서 높아질 가능성이 큼. [해석]
🧠 정답률보다 완주율과 성공 업무당 비용이 중요해짐
범용 벤치마크 상위권 점수 차이가 좁아질수록 작은 점수 차이만으로 모델의 우열을 판단하기 어려워지며, 전문 과제의 완주율과 실패 원인을 함께 봐야 함. [팩트, p13]
VenusBench-Mobile은 계속 바뀌는 모바일 화면을, WorldTravel은 15개가 넘는 제약을, ComplexMCP는 300개 도구와 변화하는 상태를 제시해 실제 업무와 가까운 실패 조건을 평가했음. [팩트, p13]
값싼 모델이 반복해서 실패하고 사람이 수정해야 한다면, 비싼 모델이 한 번에 끝내는 경우보다 업무 한 건의 총원가가 더 높을 수 있음. [해석]
기업의 구매 대시보드에는 토큰당 가격 외에도 완주율, 사람 개입률, 평균 재시도 횟수, 오류 비용, 성공 업무당 총비용이 포함될 가능성이 높음. [해석]
💾 긴 문맥이 메모리 산업에 미치는 영향임
자기회귀형 모델은 앞선 문맥의 키와 값을 KV 캐시에 저장하므로 출력 길이와 동시 요청 수가 늘수록 가속기 메모리 사용량과 데이터 이동량이 증가함. [팩트, p14]
EntroKV는 모든 어텐션 헤드에 같은 캐시 예산을 주지 않고 정보 밀도에 따라 보존할 토큰 수를 조절해, 장문맥 인공지능에서 메모리 관리가 모델 성능만큼 중요함을 보여줬음. [팩트, p14]
MAGE는 128K 문맥에서 첫 단계의 어텐션 정보를 재사용해 최대 3.7~6.8배의 종단 간 가속을 보고했으며, KV 캐시를 없애기보다 접근량을 줄이는 방식임. [팩트, p14]
확산형 언어모델은 여러 토큰을 동시에 수정해 KV 캐시 의존을 낮출 수 있지만, 같은 신경망을 여러 번 실행하므로 메모리 병목이 계산과 전력 병목으로 이동할 수 있음. [해석]
SPIGM 패널은 자기회귀형 모델은 메모리 병목에, 확산형 모델은 계산 병목에 가깝다고 정리했으며, 동일 품질에서 지연시간·동시성·전력·캐시를 포함한 총서빙비용을 비교해야 한다고 판단했음. [팩트, p15]
[표 1, p15]
언어는 순차 구조가 강해 자기회귀형 모델이 여전히 유리하지만, 단백질·분자·정형 데이터처럼 생성 순서가 명확하지 않은 분야에서는 확산형 또는 혼합형 구조가 유리할 수 있음. [팩트, p16]
따라서 투자자가 볼 핵심은 확산형 모델이 자기회귀형 모델을 완전히 대체하는지가 아니라, 같은 품질에서 KV 캐시·지연시간·전력·성공 업무당 비용을 실제로 낮추는지 여부임. [해석]
📈 투자 전략과 확인 순서임
투자 판단은
작업당 토큰·도구 호출 증가 → 클라우드 사용량 증가 → 가속기 출하 증가 → 서버당 HBM·DRAM 탑재량 증가 → 메모리 가격과 공급사 마진 개선의 연결이 실제 데이터로 확인되는지를 순서대로 점검해야 함. [해석]문맥 압축과 메모리 최적화가 요청당 사용량을 줄이더라도 전체 작업량과 동시 요청이 더 빠르게 늘면 총메모리 수요는 증가할 수 있으므로, 단위 효율과 전체 사용량을 반드시 분리해 해석해야 함. [해석]
📌 핵심 관계도
긴 업무 확대 → 생성·검색·도구 호출·검증 증가 → 작업당 토큰 증가 → 장문맥·동시 요청 증가 → KV 캐시와 메모리 대역폭 부담 증가 → 가속기·HBM·DRAM·운영 소프트웨어 수요 확대
확산형 모델 도입 → KV 캐시 부담 완화 가능함 → 반복 계산과 전력 부담 증가 가능함 → 메모리 수요 소멸이 아니라 자원 배분 변화가 발생함
📊 기술별 투자 의미
| 구분 | 자기회귀형 모델 | 확산형 모델 | 투자 해석 |
|---|---|---|---|
| 생성 방식 | 한 토큰씩 순차 생성함 | 여러 토큰을 반복 수정함 | 단일 승자보다 역할 분화 가능성이 높음 |
| 주요 병목 | KV 캐시와 메모리 대역폭임 | 반복 연산과 전력임 | 메모리와 연산 수요의 비중이 달라짐 |
| 강점 | 언어 품질과 도구 생태계가 성숙함 | 병렬 수정과 양방향 구조가 가능함 | 언어는 자기회귀형, 비순차 데이터는 확산형이 유리할 수 있음 |
| 확인 지표 | 요청당 캐시, 동시성, 처리량임 | 반복 횟수, 동일 품질, 전력당 성능임 | 성공 업무당 총비용으로 비교해야 함 |
자료는 DS투자증권의 ICML 2026 현장 분석과 보고서 내 인용 연구를 근거로 정리했음.
📈 리스크 & 기회
| 시계열 | 구분 | 확률 | 영향도 | 확인법 |
|---|---|---|---|---|
| 단기 1~3개월 | 기업용 에이전트 도입이 늘어 추론 사용량과 클라우드 소비가 확대되는 기회임 | 70% | 높음 | 클라우드 사업자의 추론 매출, 도구 호출 비중, 기업용 인공지능 계약 증가를 확인함 |
| 단기 1~3개월 | 인공지능 인프라 기대가 주가에 선반영돼 실적이 기대에 못 미치는 위험임 | 55% | 높음 | 가속기 출하, HBM 가격, 공급사 이익 추정치와 주가 상승률을 비교함 |
| 중기 6~12개월 | 장기 업무가 법률·의료·바이오로 확산돼 고비용 추론과 검증 소프트웨어 수요가 증가하는 기회임 | 65% | 높음 | 실제 유료 고객 수, 완주율, 사람 개입률, 고객당 사용량을 확인함 |
| 중기 6~12개월 | 문맥 압축·모델 경량화·확산형 구조가 요청당 메모리 사용량을 빠르게 낮추는 위험임 | 45% | 보통 | 요청당 KV 캐시, 서버당 메모리 탑재량, 메모리 가격과 마진을 확인함 |
| 중기 6~12개월 | 메모리 증설이 수요보다 빨라 가격과 마진이 하락하는 공급 위험임 | 40% | 높음 | HBM·DRAM 공급계획, 재고, 계약가격, 공급사 자본지출을 확인함 |
⚖️ 나라면 이 섹터에 투자할지에 대한 판단
현재 보고서만으로는 인공지능 인프라·메모리 섹터에 대한 신규 투자 의견을 제시하지 않겠음.
산업 방향은 분명히 긍정적임. 긴 업무, 도구 호출, 반복 검증이 늘면 추론 사용량과 인프라 수요가 증가할 논리가 강함. 그러나 이 보고서는 기술과 수요의 구조를 설명하는 자료이며, 기업별 수익성·현재 밸류에이션·공급 증설·고객 계약·메모리 가격을 충분히 제공하지 않음.
특히 “인공지능 사용량 증가”와 “메모리 기업 주가 상승” 사이에는 가속기 출하, 서버당 탑재량, 판매가격, 공급 경쟁, 투자비 부담이라는 여러 단계가 존재함. 이 연결이 모두 확인되지 않은 상태에서 확신에 찬 투자 의견을 내리기는 어려움.
따라서 투자 판단을 내리려면 최소한 다음 네 가지가 동시에 확인돼야 함.
기업용 추론 사용량 증가 → 서버당 HBM·DRAM 탑재량 증가 → 메모리 가격 안정 또는 상승 → 공급사 이익과 현금흐름 개선
🧵 한 줄 코멘트
이번 변화는 더 빠른 자동차를 만드는 경쟁이 아니라, 여러 정거장을 거쳐 화물을 끝까지 배달하는 물류망을 만드는 경쟁으로 바뀐 것과 같음.
https://finance.naver.com/research/invest_read.naver?nid=39670