Fund EasyFund Easy로컬모델의 발전은 클라우드의 종말이 아닙니다, AI 추론이 기기로 분산되는 시작입니다
무료

로컬모델의 발전은 클라우드의 종말이 아닙니다, AI 추론이 기기로 분산되는 시작입니다

ipw-chart-1.pngipw-chart-2.png

한 VC의 분석 글을 읽고 처음에는 로컬모델의 발전을 클라우드 비용을 낮추는 기술로만 생각했습니다. 그런데 원문이 소개한 연구를 숫자로 따라가 보니 질문이 달라졌습니다. 로컬모델이 가장 큰 모델을 이길 수 있느냐보다, 어떤 질문을 굳이 데이터센터까지 보내지 않아도 되느냐가 더 중요한 문제였습니다.

AI 인프라의 다음 단계는 모델 크기 경쟁만으로 설명하기 어렵습니다. 데이터센터는 계속 필요하지만, 모든 질문을 중앙 서버에서 처리해야 하는 것은 아닙니다. 일상적인 지식 업무를 기기에서 처리할 수 있다면 AI 수요는 줄어드는 것이 아니라 처리 위치와 비용 구조를 바꾸게 됩니다.

로컬모델의 발전은 정확도보다 처리 가능한 일의 범위를 넓히고 있습니다

원문이 인용한 연구는 2023년부터 2025년까지 로컬모델이 프런티어 클라우드 모델과 같은 수준의 답을 내는 비율이 빠르게 높아졌다고 설명합니다. 가장 좋은 단일 로컬모델의 승리·무승부 비율은 2023년 23.2%에서 2024년 48.7%, 2025년 71.3%로 올라갔습니다. 숫자만 보면 1년마다 약 20%포인트씩 개선된 셈입니다.

다만 71.3%와 89%를 같은 지표로 읽으면 안 됩니다. 71.3%는 특정 시점의 가장 좋은 단일 로컬모델을 평가한 결과이고, 89%는 20개가 넘는 로컬모델 가운데 질문마다 가장 적합한 모델을 골라 응답했을 때의 상한에 가깝습니다. 모델 하나가 모든 일을 잘하게 됐다는 뜻이 아니라, 여러 모델을 나눠 쓰면 로컬 환경에서 처리할 수 있는 질문의 범위가 넓어진다는 뜻입니다.

연구는 100만 건의 실제 단일 질문과 추론 요청을 바탕으로 로컬모델을 비교했고, 약 88.7%의 질문에 로컬모델이 답할 수 있다고 제시합니다. 여기서 중요한 단어는 단일 질문입니다. 여러 단계의 에이전트 작업, 긴 문서 처리, 복잡한 도구 사용, 높은 위험이 따르는 전문 업무까지 모두 로컬에서 해결된다는 의미는 아닙니다.

저는 이 구분이 투자 판단에서 중요하다고 봅니다. 로컬모델의 발전은 클라우드 모델을 한 번에 대체하는 사건이 아니라, 지금까지 하나의 큰 모델에 맡겼던 일을 여러 난이도로 나누는 과정에 가깝습니다. 질문을 분류하고, 적절한 모델을 고르고, 필요할 때만 클라우드로 넘기는 소프트웨어가 새로운 운영 계층으로 올라오고 있습니다.

새로운 기준은 모델 크기가 아니라 지능을 와트로 얼마나 바꾸는가입니다

원문은 이 변화를 intelligence per watt, 즉 지능·와트라는 지표로 설명합니다. 쉽게 말해 일정한 전력으로 얼마나 정확한 답을 내는지를 보는 기준입니다. 단순히 초당 토큰 수가 빠른지, 파라미터가 큰지보다 실제 작업을 해결하는 능력과 전력 사용량을 함께 계산하자는 접근입니다.

이 기준으로 보면 로컬 AI의 효율은 2023년부터 2025년 사이 5.3배 개선됐습니다. 모델의 구조·학습·후처리·증류가 좋아지면서 3.1배의 개선이 나왔고, 가속기 발전이 1.7배를 더했습니다. 같은 전력으로 더 나은 모델을 돌리게 된 결과입니다.

그렇다고 로컬 하드웨어가 클라우드 하드웨어보다 이미 효율적이라는 뜻은 아닙니다. 같은 모델을 돌렸을 때 클라우드 가속기는 로컬 가속기보다 지능·와트가 최소 1.4배 높았습니다. 데이터센터는 여러 사용자의 요청을 묶어 처리할 수 있고, 전력과 냉각을 한곳에서 관리할 수 있기 때문입니다.

따라서 로컬 모델의 경쟁력은 전력 효율 하나로 결정되지 않습니다. 네트워크를 거치지 않는 지연시간, 데이터가 기기 밖으로 나가지 않는 구조, 사용자가 직접 부담하는 비용, 클라우드의 처리 용량을 아끼는 효과가 함께 계산돼야 합니다. 반대로 로컬 하드웨어가 클라우드의 효율 차이를 줄이지 못하면 모델 발전이 곧바로 기기 수요나 수익성으로 이어지지 않을 수 있습니다.

로컬모델은 AI 수요를 줄이기보다 수요의 위치를 바꿉니다

원문은 로컬모델과 라우터를 함께 사용하면 모든 질문을 클라우드에서 처리하는 방식보다 에너지를 80%, 연산을 77%, 비용을 74% 줄일 수 있다고 설명합니다. 이 숫자는 로컬모델 하나의 성능을 말하는 것이 아니라, 질문마다 처리 장소와 모델을 나누는 시스템의 효과입니다.

라우터는 사용자의 질문을 먼저 보고 난이도와 맥락을 판단합니다. 짧은 이메일 작성이나 문서 요약은 기기 안의 작은 모델로 보내고, 긴 추론이나 복잡한 코딩은 클라우드 모델로 넘깁니다. 이 구조에서는 가장 비싼 모델을 기본값으로 쓰지 않아도 됩니다.

여기서 AI 인프라 투자에 대한 해석도 달라집니다. 로컬모델이 좋아진다고 데이터센터 투자가 끝나는 것이 아닙니다. 오히려 데이터센터는 어려운 추론과 대규모 병렬 작업에 집중하고, 기기는 반복적이고 개인정보가 포함된 일상 업무를 맡을 수 있습니다. 중앙과 로컬이 경쟁하는 관계보다 역할을 나누는 관계가 먼저 나타날 가능성이 높습니다.

이 변화는 GPU 수요를 단순히 줄이거나 늘리는 문제가 아닙니다. 학습용 대형 GPU와 클라우드 추론용 가속기, PC·스마트폰의 NPU와 메모리, 모델 압축과 양자화 소프트웨어가 서로 다른 수요를 만들 수 있습니다. 같은 AI 시장 안에서 파라미터와 처리량이 아니라 배치 크기, 지연시간, 전력 예산, 메모리 용량이 제품 선택을 가르는 기준이 됩니다.

투자자는 로컬모델의 성능보다 돈이 남는 경로를 봐야 합니다

로컬 AI의 서사가 커질수록 기업을 세 가지 층위로 나눠 볼 필요가 있습니다. 첫째는 작은 모델을 더 적은 연산으로 훈련하고 실행하는 모델 기업입니다. 둘째는 메모리와 NPU, 저전력 가속기를 제공하는 하드웨어 기업입니다. 셋째는 질문을 분류하고 모델을 연결해 실제 사용량과 비용을 관리하는 소프트웨어 기업입니다.

좋은 기술과 좋은 주식은 다릅니다. 로컬모델이 많은 질문에 답할 수 있어도 소비자가 기기 교체 비용을 지불할 이유가 약하면 하드웨어 업체의 평균판매가격과 마진은 제한될 수 있습니다. 반대로 모델이 무료로 배포돼도 기업용 보안, 관리, 데이터 통제와 연결되면 소프트웨어와 서비스 매출이 남을 수 있습니다.

제가 먼저 볼 숫자는 로컬에서 처리되는 질문의 비중입니다. 그다음은 질문 한 건당 전력과 지연시간, 활성 파라미터 수, 메모리 사용량, 모델 라우팅 성공률을 확인하겠습니다. 기술 발표에서 정확도가 올랐다는 말만으로는 부족하고, 실제 사용자가 반복해서 쓰는지와 그 사용량이 매출·현금흐름으로 이어지는지를 함께 봐야 합니다.

하드웨어 기업은 클라우드 가속기와의 효율 격차를 얼마나 줄이는지 봐야 합니다. 모델 기업은 같은 정확도를 더 작은 모델과 낮은 비용으로 제공하는지 확인해야 합니다. 플랫폼 기업은 가장 싼 모델을 연결하는 데 그치지 않고, 고객이 이탈하기 어려운 업무 흐름과 데이터를 쌓는지 봐야 합니다.

로컬 추론이 늘어나도 모든 기기가 같은 방식으로 수혜를 받는 것은 아닙니다. 스마트폰과 노트북은 메모리 용량, 냉각, 배터리, 운영체제 권한이 서로 다르고, 모델을 설치하는 과정도 사용자 경험에 포함됩니다. 성능이 좋아도 설치와 업데이트가 번거롭거나 개인정보 처리에 대한 신뢰가 부족하면 실제 사용량은 기대만큼 늘지 않을 수 있습니다.

연구의 숫자도 이 한계를 포함해 읽어야 합니다. 100만 건의 질문은 로컬모델의 가능성을 보여주지만, 실제 기업 고객이 어떤 업무를 얼마나 오래 반복하는지까지 말해주지는 않습니다. 정확도와 지능·와트가 개선되는 것과 그 결과가 소프트웨어 매출이나 하드웨어 교체 수요로 이어지는 것은 별도의 검증 과제입니다.

클라우드를 없애는 경쟁이 아니라 추론을 어디서 처리할지 정하는 경쟁입니다

처음에는 로컬모델의 발전을 클라우드 수요를 줄이는 이야기로 읽었습니다. 지금은 생각이 조금 달라졌습니다. 로컬모델은 데이터센터를 대체하기보다 데이터센터가 맡아야 할 일을 선별하게 만들고, 나머지 질문을 기기와 가까운 곳으로 옮기는 기술에 가깝습니다.

클라우드는 긴 추론, 복잡한 전문 업무, 여러 요청을 한꺼번에 처리해야 하는 작업에서 여전히 강합니다. 로컬은 짧은 응답, 개인정보가 포함된 업무, 낮은 지연시간과 낮은 비용이 중요한 작업에서 장점이 있습니다. 승자는 한쪽이 완전히 사라지는 시장이 아니라 두 경로를 안정적으로 연결하는 기업일 가능성이 높습니다.

앞으로는 네 가지를 확인하려고 합니다. 첫째 로컬에서 처리 가능한 질문의 비중이 계속 올라가는지, 둘째 라우터가 클라우드 호출을 얼마나 줄이는지, 셋째 로컬 가속기의 지능·와트가 클라우드와의 격차를 좁히는지, 넷째 기업과 소비자가 절감된 비용을 실제 사용량 증가로 돌려주는지입니다.

로컬모델의 발전은 AI를 작게 만드는 경쟁이 아닙니다. 같은 전력과 비용으로 더 많은 일을 처리하고, 필요한 순간에만 큰 모델을 부르는 운영 방식의 변화입니다. 투자자에게 남은 질문은 어떤 모델이 가장 똑똑한가가 아니라, 이 분산된 추론 구조에서 누가 반복적으로 비용을 회수할 수 있는가입니다.

출처: VC. 원문이 소개한 로컬 AI 연구의 수치와 차트를 바탕으로 작성했으며, 로컬모델의 산업 구조와 투자 판단에 대한 해석은 Fund Easy의 분석입니다.

이 글은 특정 기업이나 종목의 매수·매도를 권하는 투자 조언이 아닙니다. 로컬모델의 정확도와 지능·와트 수치는 연구의 평가 범위와 측정 방식에 따라 달라질 수 있으며, 단일 질문 중심의 결과를 장기 에이전트 업무나 모든 기업용 작업으로 확대해서는 안 됩니다. 투자 전에는 모델의 실제 사용량, 하드웨어 원가와 마진, 고객 유지율, 클라우드 비용 구조, 현금흐름과 현재 밸류에이션을 직접 확인하시기 바랍니다. 투자 판단과 그 책임은 투자자 각자에게 있습니다.

본 콘텐츠는 일반적인 정보 제공 및 교육 목적이며 투자 자문, 투자 권유, 종목 추천이 아닙니다. 최종 판단과 책임은 이용자 본인에게 있습니다.
한국증시 힘내라! BrinK 오픈 이벤트 - 주식증정