클라우드 기억 저장소

[투자정보] AI의 경쟁축이 ‘모델 크기’에서 ‘연산 깊이·업무당 비용·풀스택 장악’으로 옮겨가는 구조임 본문

돈 불리기/산업보고서

[투자정보] AI의 경쟁축이 ‘모델 크기’에서 ‘연산 깊이·업무당 비용·풀스택 장악’으로 옮겨가는 구조임

똘이장군초코 2026. 9. 7. 22:07

https://finance.naver.com/research/invest_read.naver?nid=40123

📋 핵심 내용 요약

  1. GPT-6 Astra의 의미는 벤치마크 1위 자체보다 Recurrent Depth(순환 깊이)라는 새로운 스케일링 방식, 10만개 이상 GPU를 활용한 대규모 사전학습, 코딩을 넘어 전문업무로 확장된 Agent(에이전트) 능력이 동시에 등장했다는 점임 [팩트, p2]

  2. Recurrent Depth는 파라미터를 계속 늘리는 대신 동일한 Transformer(트랜스포머) 블록을 반복 계산해 토큰 하나당 투입되는 연산량을 키우므로 AI 하드웨어 경쟁에서 GPU 연산성능·전력효율·HBM 대역폭·Scale-up 네트워크의 중요성을 높이는 구조임 [팩트, p3]

  3. 보고서는 OpenAI가 다시 모델 경쟁력을 높인 배경에 Stargate Abilene의 B200·B300 대규모 학습 인프라가 있다고 보며, 연말까지 GPU가 약 40만개로 확대될 경우 Astra 이후 모델에서도 성능 주도권이 이어질 가능성을 제시함 [팩트, p4-5]

  4. 반대로 추론에서는 OpenAI의 자체 ASIC(Application-Specific Integrated Circuit, 특정 작업에 맞춘 주문형 반도체)인 Jalapeño와 Google TPU(Tensor Processing Unit)가 빠르게 강화돼 학습은 NVIDIA GPU, 반복 추론은 자체 ASIC으로 역할이 나뉠 가능성이 커지고 있음 [팩트, p8-10]

  5. Astra가 여러 소프트웨어를 직접 조작해 업무를 끝까지 수행하면서 AI의 경제성 기준도 ‘토큰당 가격’에서 완료된 업무당 비용(Cost per Completed Task)으로 이동하고 있어 단순 기능형 소프트웨어에는 위협이고 데이터·권한·보안·워크플로우를 장악한 플랫폼에는 기회가 됨 [팩트, p6-7]

  6. NVIDIA는 ASIC 확산을 막기보다 CUDA·NVLink·네트워크·CPU·랙·Nemotron 오픈모델까지 묶어 AI Factory 전체를 표준 플랫폼으로 만들려 하므로 장기 경쟁은 GPU와 ASIC의 단순 승부보다 모델과 하드웨어를 얼마나 빠르게 공동 최적화하는가의 싸움으로 바뀌고 있음 [팩트, p11-12]

  7. 투자 측면에서는 AI 기업의 EPS(Earnings Per Share, 주당순이익) 성장률이 금리 상승을 크게 웃도는 한 AI 투자사이클이 유지될 수 있지만, 고금리 환경에서는 약 10.6%의 요구수익률을 넘는 성장성이 필요하므로 하이퍼스케일러·AI 인프라·고성장 AI 공급망을 선별해야 한다는 것이 보고서의 결론임 [팩트, p15-16]

🚀 사건의 핵심은 ‘더 똑똑한 모델’보다 계산법의 변화임

  1. 이 보고서의 핵심 주제는 Astra가 얼마나 높은 점수를 받았는가보다 모델 성능을 높이는 방식이 바뀌면서 반도체·클라우드·소프트웨어의 가치사슬까지 재편될 수 있다는 점임 [해석]

  2. 투자 논리는 Recurrent Depth 도입 → 토큰당 연산 증가 → 대규모 GPU·네트워크 수요 지속 → Agent 성능 향상 → 실제 업무 자동화 확대 → AI 서비스 매출 증가 → 다시 인프라 투자 확대로 이어짐 [해석]

  3. 따라서 Astra는 하나의 신제품 이슈가 아니라 학습 인프라와 추론 ASIC, 기업용 Agent, 소프트웨어 과금방식이 동시에 변화하는 AI 산업의 다음 단계로 해석하는 것이 적절함 [해석]

🧠 Recurrent Depth가 하드웨어 수요를 어떻게 바꾸는가

  1. 기존 Reasoning은 여러 Transformer 레이어를 거친 뒤 추론 토큰을 더 많이 생성해 ‘생각의 길이’를 늘리는 방식인 반면 Recurrent Depth는 동일 블록을 반복 사용해 출력 전에 수행하는 내부 계산의 ‘깊이’를 늘리는 방식임 [팩트, p2-3]

[그림 1 Recurrent Depth: Non-Looped vs. Looped Transformer 비교, p2]

  1. 동일한 가중치를 여러 번 실행하면 파라미터 수를 크게 키우지 않아도 출력 토큰당 FLOPs(Floating Point Operations, 부동소수점 연산량)가 증가하므로 GPU와 AI 가속기의 순수 연산성능 및 전력당 연산효율이 더 중요해짐 [팩트, p3]

  2. HBM(High Bandwidth Memory, 고대역폭 메모리)은 저장해야 할 가중치가 직접 늘어나지 않아 ‘용량’의 상대적 중요도는 낮아질 수 있지만 반복 계산마다 가중치와 KV Cache를 읽어야 하므로 데이터 통로인 ‘대역폭’의 중요도는 오히려 높아질 수 있음 [팩트, p3]

  3. KV Cache는 이전 토큰의 계산 결과를 저장해 다음 토큰 생성에 재사용하는 메모리 영역이며 반복 단계가 늘어나면 저장과 데이터 이동 부담이 커질 수 있어 HBM 병목이 사라진다고 보기는 어렵다는 것이 보고서의 판단임 [팩트, p3]

  4. 모델이 여러 GPU에 분산돼 있으면 동일 블록을 반복 실행할 때마다 GPU 사이 통신이 필요하므로 NVLink 같은 Scale-up Network, 즉 여러 가속기를 한 덩어리처럼 연결하는 고속 네트워크도 직접적인 수혜 영역으로 제시됨 [팩트, p3]

[표 1 Recurrent Depth 스케일링 확산 시 주요 AI HW 수혜 논리, p3]

🏗️ 모델 경쟁력의 바닥에는 여전히 거대한 학습 클러스터가 있음

  1. 보고서는 Astra가 텍사스 Stargate에서 10만개 이상의 GPU를 활용한 OpenAI 사상 최대 규모 학습을 거쳤으며 Abilene에는 B200과 B300이 각각 약 10.1만개씩 배치된 것으로 추정함 [팩트, p4]

[그림 2 Stargate Abilene에 배치된 GPU 현황 및 전망, p4]

  1. Epoch AI 추정에 따르면 Abilene의 GPU는 현재 약 20만개에서 2026년 말 약 40만개로 확대되고 증가분 대부분이 B300일 것으로 예상돼, 보고서는 Astra 이후 모델의 성능 개선에도 대규모 NVIDIA 인프라가 계속 중요하다고 판단함 [팩트, p5]

  2. 더 좋은 AI가 코드 작성·실험 설계·평가를 도와 더 좋은 AI → 연구 자동화 → 실험량 증가 → 다음 모델 개선으로 이어지면 강한 의미의 RSI(Recursive Self-Improvement, 재귀적 자기개선)는 아니더라도 AI 개발 속도를 스스로 높이는 약한 피드백 루프가 형성될 수 있음 [팩트, p5]

🧑‍💼 Agent가 소프트웨어 산업의 돈 버는 방식을 바꾸기 시작함

  1. Astra는 전문업무 자동화 능력을 측정하는 AutomationBench에서 41.4%를 기록해 GPT-5.6 Sol의 18.1%와 Claude Fable 5.1의 31.4%를 웃돌았고 Agents’ Last Exam에서도 59.3%를 기록했다고 보고서는 제시함 [팩트, p6]

[그림 4 AutomationBench / 그림 5 Agents’ Last Exam, p7]

  1. Astra는 Agents’ Last Exam에서 Claude Opus 5보다 약 65% 적은 출력 토큰을 사용하고 OSWorld 2.0에서는 GPT-5.6 Sol보다 높은 성능을 내면서 업무 수행시간을 약 47% 줄여, 비싼 토큰 가격보다 ‘업무 하나를 끝내는 총비용’이 중요해지는 흐름을 보여줌 [팩트, p6]

  2. 이런 구조가 확산되면 사용자 수에 따라 돈을 받는 $/Seat 방식보다 완료된 업무량이나 성과에 따라 돈을 받는 $/Completed Task 방식이 강해질 수 있어 단순 기능을 묶어 판매하던 소프트웨어의 가격 결정력은 약해질 수 있음 [팩트, p6]

  3. 반대로 수많은 Agent가 이메일·CRM(Customer Relationship Management, 고객관계관리)·클라우드 접근 권한을 가진 비인간 계정으로 활동하면 신원·권한·데이터·자동 대응을 통제하는 사이버보안 플랫폼의 중요성이 높아져 보안은 Agent 확산의 구조적 수혜 영역으로 제시됨 [팩트, p6-7]

[그림 6 소프트웨어 ETF IGV와 사이버보안 ETF CIBR 추이, p7]

⚙️ 자체 ASIC의 등장은 NVIDIA의 종말보다 역할 분화에 가까움

  1. OpenAI의 첫 자체 추론 ASIC Jalapeño는 DeepSeek R1과 Kimi K2.5에서 GB300 대비 Peak Throughput/kW, 즉 전력 1킬로와트당 최대 처리량이 각각 약 1.7배와 1.5배 높아 Custom ASIC의 경쟁력이 단순 비용절감 이상임을 보여줌 [팩트, p8]

[그림 7 Jalapeño와 기존 최고 가속기 성능 비교 / 그림 8 Decode 성능, p9]

  1. 다만 Jalapeño는 NVIDIA Vera Rubin보다 성능에서 뒤지고 본격 배치가 예상되는 2027-2028년에는 Rubin Ultra가 등장할 예정이어서 보고서는 NVIDIA를 곧바로 대체한다기보다 훈련·범용 추론은 GPU, 대규모 반복 추론은 자체 ASIC으로 역할이 분화될 가능성을 더 높게 봄 [팩트, p8]

  2. Jalapeño의 후속 세대는 2027년 약 1.3GW, 2028년 합산 5GW 이상 배치를 목표로 하는 것으로 제시돼, 자체 ASIC 생태계가 커질수록 Broadcom 같은 설계 파트너와 파운드리·HBM·첨단패키징 공급망의 시장도 함께 커질 수 있음 [팩트, p9]

[그림 9 Jalapeño 및 후속 세대 배치 계획, p9]

  1. Google도 TPU 출시주기를 기존 약 2년에서 약 6개월로 단축하고 8세대부터 학습용 8t와 추론용 8i를 나눠 설계하며 모델·컴파일러·네트워크까지 함께 최적화하는 방향으로 NVIDIA 추격 속도를 높이고 있음 [팩트, p10]

[그림 10 Google TPU 출시주기 단축 / 그림 11 공급망 다변화 가능성, p10]

  1. NVIDIA는 이에 맞서 Nemotron 연합과 CUDA 최적화 오픈모델, NVLink Fusion을 이용해 고객이 자체 ASIC을 쓰더라도 네트워크·CPU·랙에서 NVIDIA 시스템을 계속 사용하도록 만들어 GPU 점유율 100% 방어보다 AI Factory의 공통 플랫폼 지위를 지키려는 전략을 취함 [팩트, p11-12]

[그림 12 Nemotron 3 Ultra / 표 2 NVIDIA·Alphabet·OpenAI AI Full-Stack 경쟁력, p12]

💰 AI 데이터센터는 아직 ‘투자할수록 손해’인 구조가 아님

  1. 보고서는 1GW의 데이터센터를 추론에 전부 사용하면 AI 모델사가 연간 약 600억달러의 매출을 만들 수 있고 같은 용량의 AI 컴퓨팅 임대료가 연간 약 200억~250억달러이므로 모델사 입장에서도 컴퓨팅 비용을 감당할 여지가 있다고 설명함 [팩트, p14]

  2. 1GW 데이터센터 구축비 약 600억달러에 서버·네트워크 내용연수 6년과 건설·부지 내용연수 20년을 적용하면 연간 감가상각비가 약 76억달러로 계산돼, 연간 200억~250억달러의 임대매출과 비교하면 하이퍼스케일러와 네오클라우드의 투자회수 구조도 여전히 매력적이라는 판단임 [팩트, p14]

[표 3 데이터센터 1GW의 경제학, p14]

  1. 결국 현재의 산업 구조는 AI 모델사 매출 증가 → 클라우드 컴퓨팅 가격 상승 → 데이터센터 투자여력 확대 → GPU·네트워크·HBM 가격과 수요 지지로 이어지므로 AI 밸류체인 앞단과 뒷단의 수익성이 동시에 좋아지는 국면이라는 것이 보고서의 강한 낙관론을 뒷받침함 [해석]

📈 리스크 & 기회

  1. 단기 1-3개월에는 AI EPS 추가 상향이 이어질 기회를 70%, 영향도 높음으로 보고 S&P500과 미국 AI 기업의 12MF EPS 추정치 변화를 확인하며, 반대로 Oracle·CoreWeave 같은 약한 고리의 크레딧 스프레드가 급등하는지를 가장 중요한 위험 신호로 확인해야 함 [해석]

  2. 중기 6-12개월에는 B300·TPU·자체 ASIC·Agent 확산이 AI 투자사이클을 연장할 기회를 75%, 영향도 매우 높음으로 보고 데이터센터 임대료·GPU 배치량·Jalapeño 후속 세대·업무당 AI 비용을 확인하며, 1GW 경제성이 무너지거나 EPS 성장률이 약 10.6% 요구수익률 아래로 내려가는 경우를 핵심 리스크로 봐야 함 [해석]

시계열 구분 확률 영향도 확인법
단기 1-3개월 AI 기업 EPS 추가 상향 70% 높음 12MF EPS 컨센서스를 확인함
단기 1-3개월 AI 인프라 크레딧 스트레스 30% 높음 Oracle·CoreWeave 크레딧 스프레드를 확인함
중기 6-12개월 B300·TPU·ASIC 투자 확대 75% 매우 높음 배치량과 데이터센터 GW 증설을 확인함
중기 6-12개월 데이터센터 경제성 훼손 35% 매우 높음 임대료·감가상각·모델사 ARR을 확인함
중기 6-12개월 Agent 업무 자동화 확산 70% 높음 Cost per Completed Task와 실제 사용량을 확인함

[그림 13 S&P500 12MF EPS / 그림 14 미국 AI 기업 12MF EPS / 그림 16 미국채 10년물과 S&P500 / 그림 17 주식 요구수익률 10.6%, p13·p15·p16]

🧵 한 줄 코멘트

  1. AI 산업은 지금 엔진만 크게 만드는 경쟁에서 같은 엔진을 더 깊게 돌리고 칩·네트워크·소프트웨어·업무까지 하나의 공장처럼 묶는 경쟁으로 넘어가고 있어, 승자는 단순히 가장 빠른 칩보다 업무 하나의 총비용을 가장 빠르게 낮추는 생태계가 될 가능성이 높음 [해석]

🎯 최종 투자 판단

  1. 첨부 보고서만을 기준으로는 AI 인프라·플랫폼 섹터에 투자하겠다는 의견을 제시할 만큼 논리적 확신이 높으며, 대규모 학습 인프라 확대와 Agent 활용 증가가 실제 매출·EPS 상승으로 연결되고 1GW 데이터센터 경제성도 아직 성립한다는 점이 확인되기 때문이지만, 섹터 전체를 무차별적으로 매수하기보다 고금리 환경의 약 10.6% 요구수익률을 충분히 웃도는 성장성을 가진 하이퍼스케일러와 NVIDIA·Broadcom 같은 AI 인프라 핵심 공급망, 그리고 광통신·사이버보안 같은 고성장 영역을 선별하는 방식이 적절함 [해석]