DeepSeek V4.1 Flash가 메모리 투자자들을 놀라게 했지만, 매도세는 세부 내용을 놓쳤다
DeepSeek V4.1 Flash는 한 종류의 모델 메모리 사용량을 75% 줄였고, 주요 메모리 공급업체 두 곳의 주가는 곧바로 하락했다. Samsung Electronics는 9월 11일 서울에서 3.53% 하락했고, SK Hynix는 2.21% 내렸다. 이 반응은 AI 인프라 투자에서 새로운 균열선을 드러냈다.
DeepSeek에 따르면 이 모델은 글로벌 키-값 캐시에 이전 세대 대비 4분의 1 수준의 고대역폭 메모리만 필요하다. 영구 캐시 저장 공간도 8분의 1만 필요하다. AI 메모리 수요의 급격한 확대에 성장 스토리를 의존하는 칩 제조업체들에는 위협적으로 들릴 수 있는 수치다.
그러나 기술적 주장은 시장 반응이 시사하는 것보다 범위가 좁다. 키-값 캐시, 즉 KV 캐시는 모델 추론 과정에서 중간 어텐션 데이터를 저장한다. 이는 AI 시스템 전체 메모리 요구량의 한 부분일 뿐이다.
이 구분이 실제 경쟁 구도를 규정한다. DeepSeek는 AI 작업 단위당 필요한 메모리를 줄이려 하고 있다. Samsung과 SK Hynix는 전체 AI 활동이 이러한 효율성 개선을 압도할 만큼 빠르게 성장할 것이라는 데 베팅하고 있다.
DeepSeek V4.1 Flash가 메모리 산정을 바꿨다
DeepSeek는 컨텍스트 토큰당 연결되는 메모리를 줄여, 장시간 실행되는 AI 애플리케이션을 제공하는 데 드는 주요 비용을 직접 겨냥했다.
DeepSeek는 9월 10일 V4.1 Flash를 공개하며 이를 새로운 아키텍처 제품군의 가장 작은 구성원으로 제시했다. 회사는 네이티브 시각 이해 기능을 포함한 API를 통해 모델을 제공했고, 외부 검토를 위해 가중치도 공개했다.
이 모델은 MoE(mixture-of-experts) 설계를 사용하며, 각 토큰을 더 큰 네트워크의 선택된 부분으로 라우팅한다. DeepSeek는 백본 파라미터가 5,520억 개이며, 입력 처리 중에는 80억 개, 출력 생성 중에는 160억 개만 활성화된다고 설명한다.
이러한 선택적 활성화는 연산량을 줄이지만, 그것만으로 시장 반응을 설명할 수는 없다. 투자자들은 모델이 KV 캐시를 처리하는 방식에 주목했다.
기존 Transformer는 이전에 처리한 토큰의 키와 값 표현을 반복적으로 저장한다. 이 표현 덕분에 모델은 전체 대화를 다시 계산하지 않고도 다음 토큰을 생성할 수 있다. 프롬프트, 문서, 도구 결과, 대화가 길어질수록 캐시는 커진다.
DeepSeek는 글로벌 KV 캐시 사용량이 토큰당 890바이트라고 밝혔다. 공개한 모델 출시 발표에 따르면 이는 V4 Flash에 필요한 고대역폭 메모리의 4분의 1에 해당한다.
이 감소는 많은 양의 컨텍스트를 계속 유지해야 하는 워크로드에서 가장 중요하다. 코딩 에이전트, 리서치 시스템, 고객 서비스 애플리케이션, 문서 분석 도구는 하나의 작업 동안 방대한 이력을 축적할 수 있다.
DeepSeek는 영구 캐시가 이전 모델 대비 8분의 1 수준의 솔리드 스테이트 저장 공간만 필요하다고도 밝혔다. 영구 캐싱은 서비스가 가속기 메모리 밖에 재사용 가능한 컨텍스트를 보존한 뒤, 이후 요청을 위해 이를 복원할 수 있게 한다.
회사는 V4.1 Flash를 제한적인 실험으로 취급하지 않고 있다. 주요 Flash API 식별자로 이 모델 제공을 시작했으며, 기존 Flash 변형 두 종을 종료했다. 9월 14일에는 V4.1 Pro를 준비하면서 V4 Pro 요청도 새 모델로 라우팅하기 시작했다.
이 전환은 개발자에게 단순한 문서상 아키텍처가 아니라 실제 배포 환경을 제공한다. 또한 지연 시간, 처리량, 리소스 요구량을 비교하는 고객에게 추론 효율성을 가시화한다.
다만 DeepSeek의 벤치마크 및 효율성 수치는 여전히 회사 측 주장이다. 독립 사업자들은 다양한 하드웨어, 컨텍스트 길이, 동시성 수준, 애플리케이션 패턴에서 이를 재현해야 한다.
이 구분은 캐시 효율성이 제공 구현 방식에 따라 달라질 수 있기 때문에 중요하다. DeepSeek의 소프트웨어 스택으로 달성한 결과가 모든 추론 엔진에 그대로 적용된다고 볼 수는 없다.
그럼에도 이번 출시는 논의를 바꿨다. 모델 개발자들은 더 이상 파라미터 수, 벤치마크 점수, 학습 자원만으로 경쟁하지 않는다. 각 추론 요청이 얼마나 적은 실시간 메모리를 소비하는지를 놓고도 경쟁하고 있다.
이러한 변화는 중국 AI 연구소의 기술 출시가 한 거래 세션 안에 한국 반도체 제조업체들의 주가에 영향을 미친 이유를 설명한다.
Samsung과 SK Hynix 투자자들이 빠르게 반응한 이유
이번 매도세는 DeepSeek가 반도체 확장 사이클을 끝냈다는 증거가 아니라 AI 메모리 수요를 둘러싼 취약한 기대를 반영했다.
Samsung과 SK Hynix는 글로벌 메모리 시장에서 핵심적 위치를 차지하고 있다. 이들은 일반 DRAM, NAND 스토리지, 그리고 AI 프로세서 옆에 메모리 다이를 배치해 더 빠른 데이터 이동을 지원하는 고대역폭 메모리(HBM)를 공급한다.
HBM은 현대 가속기가 일반 메모리 시스템이 데이터를 전달할 수 있는 속도보다 더 빠르게 데이터를 처리할 수 있기 때문에 특히 중요해졌다. 이에 따라 더 많은 가속기 배치, 더 큰 모델, 더 긴 컨텍스트는 지속적인 메모리 수요에 대한 기대를 뒷받침해 왔다.
DeepSeek V4.1 Flash는 이 논리의 한 부분에 도전하는 듯 보였다. 미래 모델들이 토큰당 훨씬 적은 캐시 메모리를 사용한다면, 클라우드 제공업체는 동일한 설치 HBM 용량으로 더 많은 요청을 처리할 수 있다.
초기 주가 반응은 분명했다. 메모리 주식 반응에 관한 보도에 따르면 Samsung은 9월 11일 서울에서 3.53% 하락했고, SK Hynix는 2.21% 내렸다.
이 하락은 두 회사 모두에 유난히 변동성이 컸던 시기 뒤에 나타났다. 두 종목은 이미 AI 자본 지출, 메모리 부족, 데이터센터 건설에 대한 투자자 신뢰를 나타내는 지표가 되어 있었다.
SK Hynix는 앞선 조정 국면에서 충분한 압박을 받아 대규모 자사주 매입을 발표했다. 8월 시장 보도에 따르면 이 프로그램은 상당한 시가총액을 지운 두 달간의 하락 뒤에 나왔다.
이러한 배경은 이 부문을 새로운 효율성 주장에 유난히 민감하게 만들었다. 투자자들은 DeepSeek를 고립된 사례로 평가하지 않았다. 그들은 메모리 기업 전망에 이미 얼마나 많은 낙관론이 반영돼 있는지 재검토하고 있었다.
9월 11일 세션은 기술주 약세, 채권 수익률 상승, 유가 상승 속에서 진행되기도 했다. 이러한 광범위한 요인들은 DeepSeek만이 하락을 초래했다는 주장을 복잡하게 만든다.
미국에서의 대조적인 반응도 신중함이 필요한 또 다른 이유다. Micron Technology와 SanDisk는 메모리 또는 스토리지 수요에 노출돼 있음에도, 다음 뉴욕 거래 세션에서 거의 움직이지 않았다.
거래 시간과 투자자 집단의 차이는 서로 다른 반응을 낳을 수 있다. 그러나 이러한 차이는 이번 출시가 메모리 요구량 붕괴에 관한 즉각적인 글로벌 합의를 만들지 않았음을 시사한다.
대신 시장은 포지셔닝에 대한 경고를 보냈다. Samsung과 SK Hynix는 AI 인프라 수요의 매우 눈에 띄는 대리 지표가 되었기에, 메모리 사용량이 크게 줄었다는 헤드라인은 유난히 강한 영향을 발휘했다.
그 영향력은 근본적인 기술 변화의 경제적 중요성을 넘어설 수 있다. 한 캐시 범주에서 75% 감소했다고 해서 서버 메모리 구매가 75% 줄어드는 것은 아니다.
투자자들은 변화의 방향에 반응했다. DeepSeek는 칩 제조업체들이 현재 수요 가정에 기반해 생산 능력을 구축하기 전에, 모델 아키텍처가 메모리 집약도를 낮출 수 있음을 보여줬다.
Samsung과 SK Hynix에 필요한 대응은 즉각적인 생산 감축이 아니다. 모델의 효율성이 높아지는 상황에서 미래 메모리 성장이 어디서 나올지에 대한 더 강력한 설명이다.
DeepSeek V4.1 Flash의 KV 캐시는 시스템의 일부일 뿐이다
V4.1 Flash는 일시적인 추론 상태를 압축하지만, 모델 가중치, 학습 메모리, 네트워킹 수요, 스토리지 수요를 없애지는 않는다.
KV 캐시는 모델의 작업용 노트에 비유하는 것이 가장 적절하다. 시스템이 처음부터 모든 내용을 다시 읽지 않고 텍스트 생성을 이어갈 수 있도록, 이전 토큰에서 도출된 정보를 보관한다.
이 노트는 컨텍스트 길이가 길어질수록 비용이 커진다. 에이전트가 대규모 소프트웨어 리포지터리를 읽고, 문서를 참조하고, 여러 도구를 호출하며, 앞선 결과를 다시 검토한다면 활성 컨텍스트는 빠르게 증가할 수 있다.
DeepSeek는 여러 아키텍처 변경을 통해 이 문제를 공략한다. 인과적 인코더-디코더 구조는 이후 레이어가 재사용할 수 있는 공유 인코딩 표현을 만든다.
이 모델은 또한 Compressed Sparse Attention 2를 사용한다. 희소 어텐션은 매 생성 단계에서 모든 이전 토큰을 동등하게 처리하는 대신, 가장 많은 연산을 받을 이전 토큰을 제한한다.
계층형 인덱서는 이후 어텐션 레이어가 고려하는 후보 토큰의 범위를 좁힌다. 레이어 간 재사용은 네트워크 전반에서 중복되는 캐시 데이터를 줄인다.
마지막으로 DeepSeek는 주요 KV 데이터를 4비트 수치 형식인 FP4로 저장한다. 낮은 정밀도는 메모리 사용량을 줄이지만, 테스트가 필요한 정확도 또는 구현상 절충을 초래할 수도 있다.
이러한 기술들을 함께 적용해 보고된 토큰당 890바이트의 글로벌 캐시 사용량을 달성했다. DeepSeek가 공개한 모델 문서는 이를 V4 Flash의 약 4분의 1 수준으로 설명한다.
이 아키텍처는 별도의 메모리 풀에 슬라이딩 윈도우 정보를 따로 유지한다. 슬라이딩 윈도우 어텐션은 최근 토큰의 제한된 집합에 집중하고, 필요할 때 일부 상태를 재구성한다.
이 세부 사항은 단일 비율로 모델의 전체 하드웨어 사용량을 설명할 수 없는 이유를 보여준다. 글로벌 캐시 압축이 모든 메모리 구성 요소가 같은 비율로 줄었다는 뜻은 아니다.
모델 가중치는 여전히 저장과 접근이 필요하다. 입력 처리에는 여전히 메모리와 연산이 소모된다. 생성된 출력에는 여전히 디코딩 용량이 필요하며, 운영 서비스에는 네트워킹, 이중화, 모니터링, 예비 리소스가 필요하다.
학습은 또 다른 구분을 제시한다. KV 캐시 최적화는 주로 사용자에게 학습된 모델을 실행하는 과정인 추론을 겨냥한다. 학습과 후속 학습은 서로 다른 메모리 요구사항을 가진다.
Samsung과 SK Hynix는 하나 이상의 워크로드에 하나 이상의 메모리 유형을 판매한다. HBM은 가속기를 지원하고, 일반 DRAM은 프로세서와 서버에 사용되며, NAND는 모델, 데이터세트, 캐시된 상태, 애플리케이션 데이터를 저장한다.
따라서 V4.1 Flash는 요청당 필요한 메모리 양에 압박을 가한다. 하지만 그 요청을 둘러싼 더 광범위한 데이터 인프라를 없애지는 않는다.
개발자에게 이 개선은 여전히 실질적인 결과를 갖는다. 서비스는 가속기 메모리를 소진하기 전에 더 긴 세션이나 더 많은 동시 사용자를 지원할 수 있다.
코딩 어시스턴트는 추가 파일과 도구 결과를 계속 활용할 수 있다. 리서치 에이전트는 앞선 컨텍스트를 버리지 않고 더 많은 출처를 유지할 수 있다. 고객 지원 시스템은 더 긴 대화와 더 많은 계정 이력을 보존할 수 있다.
이러한 사용 사례는 모델 효율성을 지식 집약적 AI 워크플로와 연결한다. 캐시 메모리 비용이 낮아지더라도 검색 가능한 지식 베이스를 설계하는 팀에는 여전히 신뢰할 수 있는 검색과 컨텍스트 선택이 필요하다.
예상되는 결과는 단순히 더 작은 서버가 아니다. 운영자는 절감된 자원을 더 높은 동시성, 더 긴 컨텍스트, 더 낮은 지연 시간, 또는 더 강력한 애플리케이션에 활용할 수 있다.
바로 이 유연성 때문에 이 모델은 메모리 수요를 위협하는 동시에 뒷받침하기도 한다.
효율성과 수요는 반대 방향으로 움직이고 있다
DeepSeek은 하나의 추론 워크로드에 필요한 메모리를 줄이지만, 더 저렴해진 추론은 총 메모리 소비를 늘릴 만큼 충분한 신규 워크로드를 만들어낼 수 있다.
이는 시장 반응의 핵심적인 역전 현상이다. 투자자들은 메모리 효율 개선을 수요 약화로 해석했지만, 효율성은 기술의 적용 가능한 사용 범위를 넓힐 수 있다.
지속적인 AI 에이전트를 운용할 타당성이 없었던 기업도 운영 요건이 낮아지면 이를 도입할 수 있다. 기존 애플리케이션은 더 많은 사용자를 지원하고, 더 긴 문서를 처리하며, 에이전트를 더 오래 활성 상태로 유지할 수 있다.
각 요청의 메모리 집약도는 낮아진다. 그러나 요청의 수와 지속 시간은 증가할 수 있다.
경제학자들은 흔히 이를 반등 효과로 설명한다. 자원의 사용 비용이 낮아지면 소비가 증가해 효율성으로 인한 절감분 일부를 상쇄할 수 있다는 것이다.
AI 추론에는 이러한 반등을 뒷받침하는 여러 조건이 있다. 수요는 여전히 운영 비용, 응답 속도, 컨텍스트 한계, 서비스가 동시에 지원할 수 있는 사용자 수의 제약을 받는다.
캐시 메모리를 줄이면 이러한 제약이 완화된다. 운영자는 동일한 하드웨어에 더 많은 활성 시퀀스를 수용할 수 있고, 긴 컨텍스트를 유지하는 비용도 낮출 수 있다.
에이전트형 애플리케이션은 사용자 요청 하나에 대해 수많은 모델 상호작용을 생성하기 때문에 그 효과를 증폭한다. 에이전트는 최종 답변을 제시하기 전 계획을 세우고, 검색하고, 읽고, 작성하고, 테스트하고, 수정할 수 있다.
각 단계의 비용이 낮아지면 개발자는 더 많은 단계를 허용할 수 있다. 따라서 경제성 개선은 생성되는 총 토큰 수와 메모리 활동을 늘릴 수 있다.
DeepSeek의 자체 배포 선택도 그 방향을 가리킨다. 이 회사는 기존 플래그십 경로를 V4.1 Flash로 교체하고 있으며, 이를 저용량 작업에만 제한하지 않고 있다.
이미지 지원 역시 잠재적 사용 범위를 넓힌다. 멀티모달 입력은 더 긴 인코딩 컨텍스트를 만들고 스크린샷, 스캔 문서, 다이어그램, 인터페이스 분석과 관련한 새로운 워크로드를 만들어낼 수 있다.
메모리 공급업체에 대한 낙관론은 이러한 물량 반응에 기반한다. 업계가 훨씬 더 많은 토큰, 세션, 에이전트, 멀티모달 요청을 처리하게 된다면 토큰당 소비 감소의 중요성은 낮아진다.
최근 실적은 공급업체들이 여전히 그 견해를 지지하는 이유를 보여준다. Samsung은 2분기 기준 사상 최대 영업이익을 기록했고, SK Hynix는 분기 기준 사상 최대 매출을 기록했다.
Samsung은 AI 인프라와 에이전트형 AI 도입이 메모리 수요를 뒷받침하고 있다고 밝혔다. 경영진은 수요 증가가 생산 증가를 앞서고 있다고도 말했다.
업계 실적 보고서에 따르면 두 회사는 전 세계 메모리 칩의 약 3분의 2를 생산한다. 이들의 노출도는 단일 모델 공급업체를 훨씬 넘어선다.
비관론 역시 설득력이 있다. 아키텍처 개선이 AI 사용량 증가보다 빠르게 확산되면 클라우드 운영자는 용량 구매를 늦출 수 있다.
여러 연구소가 같은 투자 주기 동안 독립적으로 캐시를 압축하고, 활성 파라미터를 줄이며, 가속기 활용도를 높인다면 그 위험은 더 커진다.
클라우드 기업은 모델 효율성과 더 나은 스케줄링, 양자화, 배치 처리, 특화된 추론 칩을 결합할 수도 있다. 누적 절감 효과는 어느 한 가지 기술보다 더 큰 의미를 지닌다.
결과는 두 가지 속도에 달려 있다. 첫째는 AI 작업 단위당 필요한 메모리의 감소 속도다. 둘째는 사용자와 애플리케이션이 요구하는 전체 AI 작업량의 증가 속도다.
DeepSeek V4.1 Flash는 시장에 첫 번째 속도에 관한 근거를 제공한다. 두 번째 속도에 대한 결론을 내리지는 못한다.
모델의 주장이 아직 입증하지 못하는 것
DeepSeek은 신뢰할 만한 기술적 경로를 공개했지만, 외부 테스트를 통해 그 절감 효과가 실제 운영 환경에서도 유지되는지 판단해야 한다.
주요 비율은 V4.1 Flash를 이전 DeepSeek 모델과 비교한 것이다. 모든 경쟁 아키텍처나 배포 스택에 대한 보편적 비교는 아니다.
운영자마다 컨텍스트 길이, 배치 크기, 가속기, 스토리지 계층, 지연 시간 목표가 다르므로 이 한계는 중요하다. 한 구성에서 측정한 메모리 절감은 다른 환경에서는 다르게 나타날 수 있다.
890바이트 수치는 글로벌 KV 캐시도 포함한다. 실제 배포 환경에는 로컬 어텐션 상태, 가중치, 활성화 버퍼, 요청 배치 처리, 추측 디코딩, 시스템 오버헤드를 위한 추가 메모리가 필요할 수 있다.
DeepSeek은 V4.1 Flash가 여러 작업에서 V4 Pro보다 앞선다는 벤치마크 결과를 제시했다. 독립 테스터가 이를 재현하기 전까지는 회사의 주장으로 받아들여야 한다.
압축은 또 다른 의문을 낳는다. FP4 캐시 스토리지는 더 적은 비트를 사용하지만, 낮아진 정밀도는 일부 조건에서 출력에 영향을 줄 수 있다.
핵심 테스트는 모델이 짧은 벤치마크를 통과하는지 여부가 아니다. 운영자는 긴 대화, 검색 의존도가 높은 작업, 코드 수정, 시각 입력, 반복적인 도구 호출 전반에서 신뢰성을 유지하는지 알아야 한다.
희소 어텐션은 이전 토큰 가운데 어떤 항목을 고려할 가치가 있는지 선택적으로 판단한다. 이는 효율을 개선할 수 있지만, 긴 컨텍스트의 훨씬 앞부분에 중요한 세부 사항이 놓여 있을 때 오류가 나타날 수 있다.
법률 지원 에이전트는 이전 문서의 조항을 놓칠 수 있다. 코딩 에이전트는 수정 작업 이전 수천 개 토큰에서 설정된 제약 조건을 간과할 수 있다. 연구 워크플로는 오래된 출처에 딸린 단서를 잃을 수 있다.
이러한 문제는 종합 벤치마크 점수에서 보이지 않을 수 있다. 개발자에게는 긴 세션 전반의 회상률, 일관성, 오류 복구를 측정하는 작업 수준의 평가가 필요하다.
배포 접근성은 별도의 한계다. V4.1 Flash는 토큰마다 네트워크의 일부만 활성화하지만, 전체 모델은 여전히 크다.
로컬 또는 프라이빗 배포를 검토하는 조직은 모델 저장 공간, 메모리 대역폭, 라우팅 오버헤드, 호환되는 추론 소프트웨어를 고려해야 한다. 더 작은 KV 캐시가 전체 시스템을 자동으로 경량화하는 것은 아니다.
공개 가중치는 검토와 실험을 개선한다. 그러나 모든 운영자가 쉽게 구할 수 있는 하드웨어에서 DeepSeek의 서빙 경제성을 재현할 수 있다는 보장은 없다.
시장 비교 역시 불완전하다. Samsung과 SK Hynix는 V4.1 Flash로 인한 고객 수요의 중대한 변화를 언급하지 않았다. 고객들 또한 이 모델을 이유로 광범위한 조달 축소를 공개적으로 발표하지 않았다.
따라서 9월 11일의 주가 하락은 확정된 주문 취소가 아니라 투자자 해석을 나타낸다.
이미 다른 요인들도 주가에 압력을 가하고 있었다. 투자자들은 대규모 제조 투자, 향후 AI 지출 수익률, 커지는 중국 경쟁, 높은 메모리 가격의 지속 가능성에 의문을 제기해 왔다.
이처럼 더 넓은 맥락은 명확한 인과 결론을 막는다. DeepSeek은 불안정한 시기에 강력한 새 서사를 제공했고, 트레이더들은 상업적 근거가 도착하기 전에 반응했다.
매출보다 기대가 먼저 움직인다는 점에서 이 반응은 주목할 만하다. 그러나 이를 메모리 수요가 전환됐다는 증거로 오인해서는 안 된다.
DeepSeek과 AI 메모리 확장 사이클의 대결
핵심 경쟁 구도는 DeepSeek 대 Samsung 또는 SK Hynix가 아니라, 모델 효율성과 AI 소비 증가율 간의 경쟁이다.
Samsung과 SK Hynix는 DeepSeek과 직접 경쟁하지 않는다. 연구소는 모델을 구축하고 서비스하며, 제조업체는 컴퓨팅 스택 전반에서 사용되는 메모리를 공급한다.
그럼에도 이들의 유인은 서로 다른 방향으로 작용한다. DeepSeek은 더 적은 인프라 자원으로 더 많은 모델 출력을 제공할 수 있을 때 이익을 얻는다. 메모리 공급업체는 전체 용량 수요가 계속 확대될 때 이익을 얻는다.
이 관계는 집약도와 물량 간 줄다리기와 닮았다. 효율성은 각 작업의 메모리 집약도를 낮추고, 도입 확대는 작업량을 늘린다.
V4.1 Flash가 업계 전반에 유사한 설계를 촉발한다면 집약도 하락은 빨라질 수 있다. 긴 컨텍스트 추론은 여전히 비싸기 때문에 경쟁 연구소에도 캐시를 압축할 유인이 생긴다.
클라우드 공급업체도 이러한 변화를 환영할 것이다. 더 높은 요청 밀도는 활용도를 개선하고 주어진 워크로드에 필요한 가속기 수를 줄인다.
그 절감 효과는 지출 감소가 아닌 더 폭넓은 접근성을 통해 사용자에게 전달될 수 있다. 공급업체는 동일한 하드웨어 예산으로 더 많은 고객이나 더 복잡한 에이전트를 지원할 수 있다.
메모리 기업은 특히 새로운 사용량이 추가 추론 클러스터를 필요로 할 경우 이러한 확장의 혜택을 볼 수 있다. 반면 고객이 배포 시점에 대한 유연성을 더 많이 확보하면 협상력은 약화될 수 있다.
수요의 구성은 총량만큼 중요하다. 캐시 압축은 추론 중 HBM 용량에 직접 영향을 미치며, 지속 캐시 감소는 SSD 수요에 영향을 준다.
증가하는 모델 가중치, 훈련 클러스터, 멀티모달 입력, 기업 데이터는 수요를 반대 방향으로 밀어 올릴 수 있다. 균형은 HBM, DRAM, NAND 제품별로 다를 수 있다.
Samsung의 다각화된 사업은 여러 메모리 범주에 걸친 노출을 제공한다. SK Hynix는 특히 HBM 리더십과 AI 가속기 공급망과 연관되어 왔다.
이 차이는 모델 효율성에 대한 민감도를 좌우할 수 있다. 실시간 가속기 메모리를 줄이는 변화는 광범위한 반도체 매출보다 HBM 중심의 투자 논리에 더 큰 영향을 미칠 수 있다.
Micron과의 경쟁은 또 다른 층위를 더한다. 세 공급업체는 고객 요구사항이 소프트웨어 혁신에 따라 변할 수 있는 상황에서 고가의 생산능력을 얼마나 빠르게 확대할지 결정해야 한다.
너무 적게 건설하면 공급 부족 기회를 놓칠 위험이 있다. 너무 많이 건설하면 아키텍처 개선이 메모리 집약도를 낮춘 뒤 공급 과잉을 만들 위험이 있다.
DeepSeek은 이러한 계획 문제를 더 어렵게 만들었다. 칩 제조업체는 AI 사용량과 모델 설계자가 하드웨어 요구사항을 줄여 나갈 속도를 모두 예측해야 한다.
이번 출시는 2025년 초 DeepSeek R1에 대한 반응도 떠올리게 한다. 해당 모델은 경쟁력 있는 AI 시스템이 서구 시장이 가정한 수준의 지출을 필요로 하는지에 대한 의문을 제기했다.
이후 인프라 수요는 여전히 강세를 유지했다. 이는 효율적인 모델 하나를 하드웨어 성장의 종말로 간주해서는 안 된다는 경고가 된다. 다만 이번에도 같은 결과가 나올 것이라는 보장은 없다.
V4.1 Flash는 추론 경제성을 더 직접적으로 겨냥한다. 배포된 애플리케이션이 훈련 종료 후에도 지속적인 워크로드를 만들어내면서 추론의 중요성은 갈수록 커지고 있다.
이는 새 모델이 현재 주문을 바꾸지 않더라도 관련성을 지니게 한다. 대규모 용량 확장 국면에서 소프트웨어가 하드웨어 병목을 공략하는 구체적인 사례를 제시한다.
이제 투자자는 양측을 함께 평가해야 한다. 메모리 수요는 모델, 가속기, 데이터센터 수만 세어 예측할 수 없다. 아키텍처 효율성도 계산에 포함돼야 한다.
매도세의 정당성을 판단할 세 가지 신호
다음 근거는 하루 더 이어지는 주가 움직임이 아니라, 실제 배포, 메모리 기업 주문, 경쟁 모델 아키텍처에서 나와야 한다.
첫 번째 신호는 독립적인 V4.1 Flash 테스트다. 개발자들은 긴 컨텍스트, 높은 동시성, 시각 입력, 에이전트 워크플로 전반의 메모리 사용량을 지켜봐야 한다.
재현된 절감 효과는 DeepSeek의 주장을 강화할 것이다. 상당한 정확도 저하, 소프트웨어 한계, 숨겨진 메모리 오버헤드는 이를 약화할 것이다.
가장 유용한 평가는 개별 캐시 수치가 아닌 완전한 시스템을 비교하는 방식일 것이다. 처리량, 지연 시간, 출력 품질, 스토리지 요구사항, 가속기 활용도를 포함해야 한다.
두 번째 신호는 Samsung, SK Hynix, 주요 클라우드 운영자가 보고하는 고객 행동이다. 주문 약정, 재고 변화, 생산능력 계획, HBM 출하 가이던스는 효율성이 조달에 영향을 미치는지 보여줄 것이다.
추론 최적화와 연계된 구매 축소 또는 지연은 비관적 해석을 뒷받침할 것이다. 지속되는 공급 부족과 확대된 장기 계약은 물량 성장 시나리오에 힘을 실을 것이다.
분기 실적은 고객들이 지출 계획을 바꿨는지를 보여주기 때문에 하루 동안의 매도세보다 더 중요하다. 경영진의 논평 역시 출하량과 재고를 통해 검증해야 한다.
세 번째 신호는 경쟁 모델 개발사들이 유사한 캐시 압축 방식을 채택하는지 여부다. 하나의 모델은 여전히 예외적인 사례로 남을 수 있다. 그러나 공통된 아키텍처 방향은 인프라 계획을 재편할 수 있다.
다른 연구소들이 품질 저하 없이 비슷한 수준의 감소를 보고한다면, 추론 워크로드의 상당 부분에서 메모리 집약도는 낮아질 수 있다.
반대로 경쟁사들이 더 큰 활성 모델, 더 긴 컨텍스트 또는 더 무거운 멀티모달 처리 방식을 추구한다면, 추가 요구량이 DeepSeek의 절감 효과를 상쇄할 수 있다.
DeepSeek V4.1 Flash는 이미 하나의 지속적인 결과를 남겼다. 투자자들이 메모리 전망에서 모델 아키텍처를 하나의 변수로 고려하도록 만들었다.
9월 11일의 매도세는 Samsung이나 SK Hynix에 대한 판결이 아니었다. 이는 기술적 가능성에 대해 초기에 매겨진 가격이었다.
개발자와 기업 구매자들은 이제 실질적인 결과를 검증해야 한다. 낮은 캐시 사용량이 더 안정적이고 저렴한 에이전트를 만들어내는가, 아니면 단지 스택 내 다른 곳으로 비용을 옮기는 데 그치는가?
향후 분기 동안 독립적인 배포 사례, 공급업체 주문, 경쟁사 출시를 지켜봐야 한다. 이러한 신호는 DeepSeek의 메모리 효율성이 칩 수요를 줄이는지, 아니면 AI 사용량을 충분히 늘려 수요를 확대하는지를 보여줄 것이다.



