처음에는 네오클라우드를 GPU를 빌려주는 사업으로만 생각했습니다. 엔비디아 GPU를 많이 확보해 시간 단위로 팔면 보유 GPU 수가 경쟁력이라고 봤습니다. 그런데 같은 GPU라도 시간당 임대료, 토큰당 추론 API, 예약 용량, 소프트웨어 매출로 나뉘는 것을 확인하고 생각이 바뀌었습니다. 경쟁력은 GPU 자체보다 비어 있는 설비를 얼마나 안정적으로 매출과 현금흐름으로 바꾸는지에 있습니다. 지난 글에서 AI 클라우드의 핵심을 사용량보다 컴퓨트와 회수 구조라고 봤다면, 이번에는 그 회수를 담당하는 공급자 쪽을 보겠습니다.
GPU 임대에서 추론 API까지, 상품은 겹쳐 있습니다
가장 단순한 상품은 GPU 인스턴스입니다. 고객은 특정 GPU를 시간 또는 초 단위로 사용하고, RunPod처럼 워커가 시작된 때부터 종료될 때까지 과금하는 방식도 있습니다. 두 번째는 추론 API입니다. 고객이 GPU를 직접 임대하지 않고 모델을 호출하면 공급자는 입력·출력 토큰, 이미지 픽셀, 음성·영상 처리 시간처럼 결과물 단위로 요금을 받습니다. Together AI도 서버리스 모델은 토큰 단위로, 전용 모델 추론은 GPU 사용 분 단위로 구분합니다.
세 번째는 예약 용량과 서비스 수준입니다. 기본 수요에는 예약, 피크에는 유연 예약이나 온디맨드, 중단 가능한 배치에는 스팟을 섞습니다. 여기에 스토리지·CPU·네트워크·모델 배포를 붙이면 단순 GPU 임대보다 고객을 오래 묶을 수 있습니다. CoreWeave는 GPU 외 사업의 연환산 매출이 4억 달러를 넘었다고 설명했지만, 회사가 직접 제시한 수치이므로 업계 평균으로 볼 수는 없습니다.
가동률 숫자보다 배치와 과금의 조합이 중요합니다
네오클라우드 경제성을 설명하면서 가동률 90~95%를 업계 공통 숫자처럼 제시하면 위험합니다. GPU가 켜져 있는 시간, 메모리가 차 있는 정도, 실제 처리 토큰 수, 고객에게 예약됐지만 사용되지 않은 용량은 서로 다른 지표입니다. 90%의 메모리 사용률이 90%의 매출 가동률을 의미하지도 않습니다.
GPU 임대 매출은 시간당 단가와 실제 과금 시간의 곱이고, 추론 API 매출은 여기에 시간당 처리 토큰 수와 토큰당 단가가 결합됩니다. 따라서 GPU 수뿐 아니라 같은 하드웨어에서 처리하는 요청 수, 요청이 없을 때 다른 작업으로 전환하는 능력, 모델 로딩과 대기 시간을 함께 봐야 합니다. vLLM의 PagedAttention, 연속 배칭, 접두사 캐싱은 KV 캐시 메모리 낭비와 대기 시간을 줄여 같은 하드웨어에서 더 많은 요청을 처리하게 만듭니다.
다만 이를 여러 고객의 GPU 권리를 무제한으로 겹쳐 파는 오버부킹으로 표현해서는 안 됩니다. GPU는 메모리와 지연시간, 장애 격리가 중요하기 때문에 실제 서비스에서는 스케줄러와 용량 계획으로 공유 범위와 서비스 수준을 관리합니다. 더 정확한 질문은 오버부킹 비율이 얼마인가가 아니라, 출렁이는 여러 작업을 한 클러스터에 얼마나 효율적으로 배치하면서 서비스 수준을 지키는가입니다.
수요가 커도 이익은 자동으로 따라오지 않습니다
네오클라우드는 자본집약형 사업입니다. GPU와 서버, 네트워크 장비, 데이터센터 공간, 전력과 냉각 설비를 먼저 확보한 뒤 시간, 토큰, 예약 용량을 판매합니다. 매출은 사용량에 따라 움직이지만 감가상각, 이자, 임대료와 인력비용은 먼저 발생합니다.
CoreWeave의 2026년 2분기 실적은 이 구조를 보여주는 사례입니다. 매출은 전년 동기 12억1,200만 달러에서 25억7,500만 달러로 늘었고, 백로그는 1,040억 달러였습니다. 그런데 영업손실은 4,900만 달러, 순손실은 6억2,600만 달러, 순이자비용은 6억4,000만 달러였습니다. 수요와 수주가 강해도 설비를 먼저 깔아야 하는 사업에서는 매출 성장과 주주에게 돌아가는 이익 사이에 간격이 생길 수 있다는 뜻입니다.
백로그도 이미 현금으로 확정된 이익이 아닙니다. CoreWeave는 서비스 제공과 용량 납품 조건이 충족될 때 매출로 인식될 금액을 백로그에 포함한다고 설명합니다. 고객 선급금과 부채로 설비투자를 앞당길 수 있지만, GPU 세대교체나 계약 단축, 토큰 가격 하락이 겹치면 같은 부채가 성장 수단에서 재무 부담으로 바뀔 수 있습니다. 좋은 기업과 좋은 주식은 분리해서 봐야 합니다.
가격 경쟁이 심해질수록 플랫폼의 질이 드러납니다
모델 공급자가 늘어나면 추론 API의 토큰 가격은 내려갈 가능성이 큽니다. 공급자는 더 많은 토큰을 처리하거나 더 높은 효율을 만들어야 같은 매출을 유지할 수 있습니다. 가격을 지키는 해자는 GPU 보유량보다 고객 트래픽에 맞춘 스케줄링, 데이터 이동 비용, 모델 배포 편의성, 장애 대응과 서비스 수준에서 생길 수 있습니다.
Together AI는 변동성 있는 트래픽에는 서버리스, 안정적인 생산 트래픽에는 프로비저드 처리량이나 전용 엔드포인트를 제시합니다. 서버리스는 콜드스타트와 유휴 시간을 관리해야 하고, 전용 엔드포인트는 사용량이 줄어도 장비 부담이 남습니다. 결국 경쟁력은 예약, 온디맨드, 스팟, 소프트웨어를 어떤 비율로 조합하는지에 있습니다.
투자자는 매출보다 회수 속도를 확인해야 합니다
제가 먼저 확인할 숫자는 백로그의 크기보다 계약의 질입니다. 언제 매출로 전환되는지, 고객 선급금이 설비투자를 얼마나 보전하는지, 계약 기간이 GPU 감가상각 기간과 맞는지 봐야 합니다. 설비투자와 건설 중 자산, 감가상각비와 이자비용, 자유현금흐름도 함께 확인해야 합니다. 가동률은 전원·예약·청구 시간 중 무엇을 뜻하는지 구분하고, 추론 사업이라면 GPU당 초당 토큰 수와 콜드스타트, 유휴 시간, 고객 집중도, 이전 세대 GPU의 재활용을 봐야 합니다.
처음에는 네오클라우드를 GPU를 시간 단위로 파는 회사라고 생각했습니다. 지금은 GPU와 전력, 네트워크, 소프트웨어를 묶어 변동성 큰 AI 수요를 계약 가능한 상품으로 바꾸는 사업이라고 봅니다. 핵심은 보유 장비의 규모보다 수요를 촘촘하게 배치하고 자본을 빨리 회수하는지에 있습니다. 좋은 산업의 성장성과 좋은 주식의 수익률은 같은 말이 아닙니다. 저는 앞으로 백로그의 매출 전환, 고객 선급금, 감가상각과 이자비용, 실제 자유현금흐름, GPU 세대별 가동률을 먼저 확인하려고 합니다.
출처: CoreWeave 2026년 2분기 실적 발표 및 Capacity Plans, vLLM 공식 문서, RunPod Serverless 가격 문서, Together AI 추론·가격 문서, Nebius 2026년 2분기 실적 발표, McKinsey, 원문 확인일 2026년 8월 26일




