top of page

Kimi K3는 M1 Max에서 실행되지만, openai max는 잘못된 프레임이다

Kimi K3가 이제 64GB M1 Max에서 초당 0.0687토큰으로 실행된다는 보고가 나오면서, openai max 검색이 무엇을 보여줘야 하는지에 대한 관점도 달라진다. 소규모 연구 프로젝트인 Deltafin은 모델 전체 가중치를 메모리에 올리지 않고 Moonshot AI의 2조 8,000억 파라미터 모델을 실행한다. 기술적으로는 놀랍지만, 실용적인 속도는 극도로 느리다.

이 프로젝트가 2021년형 Mac을 경쟁력 있는 AI 서버로 바꾸는 것은 아니다. 완전한 로컬 설치 환경에서 토큰당 중앙값 디코딩 시간은 14.6초다. 중간 길이의 응답 하나에도 장시간이 걸릴 수 있으며, 에이전트형 코딩 세션은 아직 워크플로우라기보다 시연에 가깝다.

가능성과 사용성 사이의 이 간극이 핵심이다. Deltafin은 거대한 모델에는 거대한 메모리 용량이 필요하다는 가정에 도전한다. 그러나 OpenAI, Anthropic, Moonshot 또는 기타 인프라 제공업체가 제공하는 호스팅 시스템의 응답성에는 도전하지 않는다.

이 실험은 오히려 다른 최전선을 드러낸다. 오픈 웨이트는 독립 개발자가 스토리지, 메모리 압박, 희소 연산을 중심으로 추론을 새롭게 설계할 수 있게 한다. 그 결과물은 사용자가 기대하는 속도를 제공하지 못하더라도 모델을 실행할 수 있는 범위를 넓힌다.

Deltafin은 64GB로 2조 8,000억 파라미터를 처리한다

Deltafin은 모델 접근과 모델 상주를 분리함으로써 ‘로컬 실행’의 의미를 바꾼다.

Moonshot AI는 2026년 7월 16일 Kimi K3를 공개했다. 회사는 이를 2조 8,000억 파라미터, 네이티브 멀티모달, 100만 토큰 컨텍스트 윈도를 갖춘 모델로 설명한다. 공개된 아키텍처는 모든 토큰에 모든 파라미터를 사용하는 대신, 순전파 과정에서 1,040억 파라미터를 활성화한다.

이 설계를 전문가 혼합, 즉 MoE라고 부른다. MoE는 신경망의 일부를 특화된 파라미터 그룹으로 나누고, 각 토큰을 제한된 수의 그룹으로 라우팅한다. Kimi K3에는 896개의 라우팅 전문가가 있으며, 관련 계층마다 16개가 선택된다.

이 차이가 Deltafin을 가능하게 한다. 밀집형 2조 8,000억 파라미터 모델은 토큰마다 전체 파라미터 풀을 읽고 처리해야 한다. Kimi K3의 희소 라우팅은 런타임이 모델 라우터가 선택한 전문가만 가져오도록 한다.

Deltafin의 유지보수자는 공개된 Kimi K3 가중치가 약 1.56TB를 차지한다고 보고한다. 어텐션 구성 요소, 임베딩, 공유 전문가, 잠재 투영을 포함한 모델의 상주 스파인은 약 114GB다. 나머지 1.45TB에는 82,432개의 라우팅 전문가가 담겨 있다.

어느 그룹도 원래 형태로는 64GB 통합 메모리에 들어가지 않는다. 따라서 Deltafin은 빠른 로컬 스토리지를 메모리 계층의 또 다른 단계로 취급한다. 스파인을 계층별로 읽고, 각 토큰이 네트워크를 통과할 때 선택된 전문가를 디스크에서 불러온다.

프로젝트의 Deltafin repository는 중앙값 기준 초당 0.0687토큰의 안정적 디코딩 속도를 보고한다. 이는 토큰당 14.6초, 즉 분당 약 4.1토큰에 해당한다. 전체 모델을 실행한 여섯 차례의 측정 범위는 초당 0.0503~0.0779토큰이었다.

이 수치는 10코어 CPU, 32코어 GPU, 내장 솔리드 스테이트 스토리지를 탑재한 64GB M1 Max 한 대에서 나왔다. 전체 모델은 로컬에 저장됐다. 테스트에는 그리디 디코딩, 정확한 수치 설정, int8 스파인, 비활성화된 트레이싱이 사용됐다.

벤치마크 프롬프트는 5토큰으로 구성됐다. Deltafin은 검증된 3토큰 연속 출력을 생성했으며, 초기 디코딩 단계는 안정 속도 계산에서 제외됐다. 생성된 세 토큰에 대한 중앙값 모델 시간은 56.5초였고, 새 프로세스 기준 총 경과 시간은 64.1초에 달했다.

이는 독립적인 벤치마크나 기기 간 평균을 대표하는 결과가 아니다. 유지보수자가 한 대의 장비에서 수행한 기준 측정이다. repository는 구성과 실행 범위를 공개했지만, 광범위한 재현은 아직 제한적이다.

이러한 단서가 있더라도, 이 실험은 의미 있는 경계를 넘는다. 초기 작동 버전은 토큰당 약 20분이 필요했던 것으로 보고됐다. Deltafin의 현재 결과는 그 내부 출발점 대비 약 82배의 개선을 보여준다.

이 개선은 거의 정적인 시연을 관찰 가능한 생성으로 바꿨다. 그러나 여전히 상호작용형 대화를 제공하지는 못한다. 이 차이가 프로젝트에 관한 모든 실용적 판단을 좌우한다.

M1 Max는 참여할 수 있지만 따라잡을 수는 없는 이유

M1 Max는 유용한 연산 성능을 제공하지만, Deltafin은 근본적으로 스토리지를 통해 가중치를 이동시키는 데 제약을 받는다.

Apple은 2021년 10월 최대 64GB 통합 메모리를 지원하는 M1 Max를 발표했다. 통합 메모리는 CPU와 GPU가 하나의 공유 풀에 접근하게 해 별도 메모리 공간 사이의 일부 복사를 줄인다.

Apple은 이 칩의 메모리 대역폭이 최대 초당 400GB라고도 명시했다. 이러한 특성은 로컬 AI 소프트웨어가 시스템 메모리와 개별 GPU 메모리 사이의 경직된 분리를 피하는 데 도움이 된다. 하지만 테라바이트 규모의 모델 가중치를 64GB에 넣어주지는 않는다.

Deltafin은 불일치를 제거하는 대신 용량 문제를 우회한다. 상주 스파인을 int8로 변환해 저장 요구량을 약 114GB에서 약 60GB로 줄인다. 그러면 선택된 계층은 메모리를 통과할 수 있고, 다른 데이터는 디스크에 남는다.

라우팅 전문가는 모델 크기와 데이터 이동을 줄이기 위한 4비트 부동소수점 형식인 MXFP4 가중치를 사용한다. Moonshot은 Kimi K3가 지도 미세 조정 단계부터 양자화 인지 학습을 받았다고 설명한다. 이는 저정밀 동작이 공개 후에만 추가된 것이 아니라 학습 중에 고려됐다는 뜻이다.

공식 Kimi K3 code는 vLLM 및 SGLang 같은 서버 지향 추론 엔진을 권장한다. Deltafin은 이와 다른 경로를 택해, 일반적인 배포 대상보다 훨씬 낮은 사양의 하드웨어를 위해 네이티브 커널과 스토리지 인지 실행을 추가한다.

생성되는 토큰마다 라우터는 92개의 라우팅 계층에서 16개의 전문가를 선택한다. Deltafin은 이 과정이 토큰당 약 25.8GB의 전문가 데이터를 읽는다고 설명한다. 로컬 스토리지는 이 읽기 작업을 수초 내에 처리할 수 있지만, 네트워크 검색에는 수분이 걸릴 수 있다.

이것이 M1 Max의 대표적인 메모리 대역폭 수치가 최종 성능을 결정하지 않는 이유다. GPU는 아직 도착하지 않은 데이터를 처리할 수 없다. 디스크 지연 시간, 스토리지 처리량, 압축 해제, 가중치 준비, 동기화가 모두 핵심 경로에 들어간다.

프로젝트는 일부 작업을 겹치기 위해 백그라운드 로딩과 전문가 프리페칭을 사용한다. 메모리 매핑을 통해 런타임은 전체 파일을 반복적으로 복사하지 않고 전문가 데이터에 접근한다. 네이티브 Metal 커널은 Apple의 GPU 경로에서 선택된 전문가 연산을 수행한다.

Deltafin에는 여러 연산을 결합해 중간 데이터 이동과 실행 오버헤드를 줄이는 퓨즈드 커널도 포함된다. 이런 최적화가 중요한 이유는 작은 비효율도 토큰마다 수십 개 계층에 걸쳐 반복되기 때문이다.

그러나 동일한 라우팅과 가중치를 유지하면서 25.8GB의 전문가 읽기 요구량을 없앨 수 있는 커널은 없다. 완전한 로컬 설치는 이 트래픽을 내부 드라이브로 옮긴다. 스트리밍은 누락된 데이터를 원격 호스트에서 가져오며 지연 시간을 증폭시킨다.

Apple의 원래 M1 Max specifications는 중요한 현실 점검을 제공한다. 이 칩은 그래픽과 미디어 처리를 포함한 고성능 노트북 작업을 위해 설계됐다. 1.56TB 언어 모델의 메모리 역할을 하도록 설계된 것은 아니다.

이 결과는 장비의 아키텍처를 인상적으로 활용한 사례이지, 하드웨어 한계가 사라졌다는 증거는 아니다. Deltafin은 용량을 반복적으로 시간과 맞바꿈으로써 연산을 계속 진행시킨다.

이 상충 관계는 이 실험이 시스템 연구자에게 중요한 이유를 설명한다. ‘로드하기에는 너무 크다’는 것이 ‘실행 불가능하다’와 같지 않음을 보여준다. 동시에 실행 자체만으로는 배포 가능성을 완전하게 측정할 수 없다는 점도 보여준다.

openai max와의 비교는 가능성과 응답성의 비교다

Deltafin은 호스팅 추론 경험이 아니라, 그 배경에 깔린 가정과 경쟁한다.

openai max를 검색하는 사용자는 더 큰 모델 역량, 더 높은 추론 노력, 또는 제품의 상한을 찾고 있을 가능성이 높다. Deltafin은 다른 질문에 답한다. 의지가 강한 개발자가 단일 워크스테이션에서 실행하도록 밀어붙일 수 있는 가장 큰 오픈 모델은 무엇인가?

호스팅 AI 시스템은 서비스 계약을 위해 최적화된다. 사용자는 프롬프트 처리, 생성 토큰, 동시성, 가용성, 예측 가능한 지연 시간을 기대한다. 제공업체는 일반 사용자가 직접 관리하지 않는 가속기와 지원 인프라 전반에 이 작업을 분산한다.

Deltafin은 로컬 실행 가능성을 최적화한다. 그 목표는 극심한 메모리 제약 아래에서 Kimi K3의 공개된 가중치와 모델 경로를 보존하는 것이다. 이는 연구 목표이지, 반응성 있는 상용 엔드포인트를 대체하는 것이 아니다.

이 프로젝트는 OpenAI 호환 서버를 제공한다. 즉, HTTP 엔드포인트가 익숙한 요청 및 응답 형식을 따른다. 채팅 완성, 텍스트 완성, 모델 목록, 스트리밍 출력을 구현한다. 개발자는 호환 클라이언트를 로컬 기본 URL로 지정할 수 있다.

호환성이 동등한 동작을 의미하지는 않는다. Deltafin은 한 번에 하나의 생성 요청을 처리한다. 두 번째 동시 요청은 HTTP 429 응답을 받는다. 현재 시스템은 그리디 디코딩을 사용하므로 temperature 및 top-p 파라미터는 허용되지만 무시된다.

유지보수자는 클라이언트 타임아웃을 초 단위가 아니라 시간 단위로 설정할 것을 권장한다. 이 조언은 어떤 아키텍처 다이어그램보다 그 간극을 명확하게 보여준다. 익숙한 API는 인터페이스 차이를 숨길 수 있지만, 물리적인 대기 시간은 숨길 수 없다.

코딩 에이전트는 이 문제를 잘 보여준다. 이런 도구는 첫 유용한 작업을 요청하기 전에 긴 시스템 프롬프트, repository 컨텍스트, 도구 정의, 대화 기록을 전송하는 경우가 많다. Deltafin은 이러한 프롬프트가 입력 토큰의 초기 처리 단계인 프리필을 특히 비싸게 만든다고 경고한다.

코딩 어시스턴트는 또한 순차적인 모델 호출을 여러 번 요구할 수 있다. 한 응답은 명령을 제안하고, 다음 응답은 그 결과를 해석하며, 이후 호출은 파일을 수정하거나 테스트를 살핀다. 생성 토큰당 14.6초라면 지연 시간은 모든 단계에 걸쳐 누적된다.

Moonshot의 자체 배포는 OpenAI 호환 및 Anthropic 호환 인터페이스를 지원한다. 모델 문서에 따르면 Kimi K3는 항상 추론을 사용하며 별도의 reasoning 필드를 반환한다. 기본 추론 노력은 “max”이며, API를 통해 더 낮거나 높은 설정도 사용할 수 있다.

일상적인 Kimi K3 사용을 평가하는 사람에게는 이 공식 서비스가 관련 기준점이다. 로컬 실행, 희소 라우팅, 가중치 스트리밍 또는 재현 가능한 추론을 연구하는 사람에게는 Deltafin이 관련 기준점이다.

프라이버시는 또 다른 차이를 제공한다. 전체 Deltafin 설치 환경은 가중치를 내려받은 뒤 네트워크 접속 없이 토큰을 생성할 수 있다. 사용자가 연결된 애플리케이션과 로깅도 제어한다면 프롬프트와 생성 텍스트는 워크스테이션에 남아 있을 수 있다.

이 특성은 민감한 초안이나 독점 코드를 다루는 연구자에게 관심을 끌 수 있다. 그러나 로컬 처리가 자동으로 규제 대상 또는 프로덕션 데이터에 적합한 시스템을 만드는 것은 아니다. 운영자는 여전히 종속성, 접근 제어, 로그, 모델 라이선스, 애플리케이션 동작을 검토해야 한다.

Kimi K3 paper는 네이티브 시각 기능과 100만 토큰 컨텍스트 윈도를 갖춘 모델을 설명한다. Deltafin의 벤치마크는 전체 컨텍스트, 멀티모달 입력 또는 지속적인 에이전트형 워크로드 전반의 실용적 성능을 입증하지 않는다.

이것이 openai max 비교를 좁은 범위로 유지해야 하는 이유다. Deltafin은 프런티어급 오픈 모델을 실행할 수 있는 하드웨어의 범위를 넓힌다. 그러나 호스팅 서비스의 지연 시간, 동시성, 운영 성숙도 또는 편의성과는 견줄 수 없다.

압박을 받는 것은 상용 API보다 기존 배포 방식에 대한 가정이다. 인프라 개발자는 더 이상 RAM 용량만을 유일한 절대적 한계로 간주할 수 없다. 스토리지 인식 런타임은 또 다른 경로를 제공하지만, 그 대가로 심각한 지연 시간이 따른다.

전체 설치와 스트리밍은 서로 다른 두 가지 실험을 만든다

Deltafin의 두 가지 설치 모드는 스토리지 위치가 모델 크기만큼이나 중요하다는 점을 보여준다.

권장되는 전체 설치에는 약 1.7TB의 로컬 디스크 공간이 필요하다. Deltafin은 재개 가능한 전송을 기준으로 다운로드에 5~10시간이 걸릴 것으로 추정한다. 설치가 끝나면 추론에 네트워크 접속이 더 이상 필요하지 않다.

이 구성에서 보고된 중앙값 토큰 시간은 14.6초였다. 전체 전문가 풀을 로컬에 저장하므로, 라우팅된 각 전문가는 HTTP로 가져오는 대신 디스크에서 읽을 수 있다.

스트리밍 설치에는 약 215GB가 필요하다. 프로젝트에 따르면 초기 다운로드에는 약 30분이 걸린다. 누락된 전문가는 Hugging Face의 Kimi K3 파일에서 가져와 점차 커지는 로컬 캐시에 추가된다.

이처럼 낮은 진입 요건에는 가혹한 성능 저하가 따른다. 필요한 전문가가 이미 캐시되어 있지 않으면 토큰당 3분 이상이 걸릴 수 있다고 Deltafin은 추정한다. 생성 시작 전 프롬프트가 많은 전문가를 거치기 때문에 채팅 프리필에는 몇 시간이 걸릴 수 있다.

아주 기본적인 채팅 템플릿조차 60토큰 입력은 드문 일이 아니다. 프로덕션 어시스턴트는 흔히 수천 토큰을 전송한다. 따라서 스트리밍 모드에서는 사용자가 첫 생성 토큰을 보기 전에 상당한 시간을 전문가 다운로드에 쓸 수 있다.

향후 프롬프트가 이미 로컬에 저장된 전문가를 경유할 경우, 캐시는 반복 경로를 더 빠르게 만든다. 그러나 희소 라우팅은 입력에 따라 달라진다. 한 작업으로 워밍업된 캐시가 다른 작업에서도 동일한 전문가 패턴을 재사용한다는 보장은 없다.

Deltafin에는 기록된 라우터 트레이스를 사용해 누락된 전문가의 우선순위를 매기는 유휴 시간 워밍업 도구가 포함되어 있다. 이 메커니즘은 가능성이 높은 전문가를 미리 가져오고, 이전 캐시 항목을 더 빠른 원시 형식으로 변환할 수 있다. 네트워크 가져오기는 여전히 운영자가 명시적으로 수행하는 작업이다.

사용자는 스트리밍으로 시작한 뒤 나중에 전체 전문가 풀을 다운로드할 수도 있다. 이 과정은 재개 가능하며 기존 캐시 데이터를 보존한다. 이 업그레이드 경로는 스트리밍을 영구적인 아키텍처 선택이 아니라 체험 모드로 바꾼다.

그럼에도 전체 설치에는 여유 디스크 용량 이상의 것이 필요하다. 생성 토큰당 25.8GB를 읽어야 하므로 드라이브에 지속적인 부담이 가해진다. 장시간 실행은 일반적인 애플리케이션 사용과는 다른 스토리지 집약적 워크로드를 만든다.

SSD 역시 유한한 쓰기 내구성을 지니지만, Deltafin의 안정적인 전체 설치 경로는 주로 기존 가중치를 읽는다. 스트리밍과 캐시 변환은 쓰기를 추가한다. 실제 영향은 워크로드 길이, 캐싱 동작, 드라이브 설계 및 사용 가능한 예비 용량에 따라 달라진다.

프로젝트의 벤치마크는 내부 M1 Max 드라이브를 사용한다. 외장 드라이브, 네트워크 스토리지, 거의 가득 찬 볼륨 또는 열 제약이 있는 시스템의 결과를 동등하다고 가정해서는 안 된다. 저장장치 전반을 비교한 광범위한 결과는 리포지토리에 제시되어 있지 않다.

전체 모델 설치는 운영상 마찰도 만든다. 사용자는 테라바이트 단위의 공간을 확보하고, 종속성을 유지하며, 네이티브 라이브러리를 컴파일하고, 업데이트를 관리해야 한다. macOS에서는 호환되는 Python 환경과 Apple 개발 도구가 필요하다.

이러한 제약이 프로젝트의 가치를 무효화하는 것은 아니다. 이는 프로젝트의 대상 사용자를 규정한다. Deltafin은 설치와 측정을 가치의 일부로 여기는 연구자, 추론 엔지니어, 로컬 모델 애호가에게 적합하다.

스트리밍 모드는 또 다른 목적도 수행한다. 실행을 시작하기 전에 모든 전문가 가중치를 완전히 보유할 필요는 없다는 점을 보여준다. 이 아이디어는 계층형 스토리지, 공유 네트워크 캐시 또는 예측 기반 전문가 배치를 활용하는 미래 런타임에 영향을 줄 수 있다.

현재 수치는 한계도 드러낸다. 인터넷을 통해 전문가를 가져오면 생성은 느린 수준에서 거의 상호작용할 수 없는 수준으로 이동한다. 모델은 기술적으로 실행되지만, 대다수의 실용적인 대화는 대기 시간 때문에 무너진다.

이 벤치마크는 분석할 만큼은 실제적이지만, 일반화할 만큼 광범위하지는 않다

보고된 결과는 투명하지만, 한 대의 장비와 하나의 짧은 완료만으로 일상적인 Kimi K3 성능을 확립할 수는 없다.

Deltafin은 많은 취미용 추론 주장보다 더 많은 방법론적 세부 사항을 공개한다. 관리자는 프로세서, 메모리 용량, GPU 구성, 스토리지 위치, 수치 설정, 프롬프트, 예상 출력 및 첫 번째 토큰 처리 방식을 명시한다.

전체 모델 실행 6회는 구성 간 변동을 줄이기 위한 균형 잡힌 실행 순서를 사용했다. 보고된 값은 단일 최고 결과가 아니라 중앙값이다. 리포지토리는 동일한 장비에서 의미 있는 변동이 있음을 보여주는 범위도 제공한다.

이런 투명성은 결과의 신뢰도를 높인다. 그렇다고 독립적인 검증으로 바뀌는 것은 아니다. 프로젝트 관리자가 최적화를 개발하고 기준 벤치마크를 실행했기 때문에, 다른 운영자가 재현할 필요가 있다는 일반적인 과제가 남는다.

테스트 프롬프트도 의도적으로 작다. “The capital of France is”는 전체 순전파 경로를 실행하지만, 긴 추론, 코딩, 비전 입력, 도구 호출 또는 대규모 컨텍스트 윈도우를 대표하지는 않는다.

검증된 3토큰 연속 출력은 테스트된 구성에서 모델이 예상된 짧은 시퀀스를 생성했음을 확인한다. 작업 전반의 응답 품질을 측정하지는 않는다. 또한 확장 생성에서도 동일한 처리량이 유지되는지 보여줄 수 없다.

그리디 디코딩은 런타임이 항상 가장 높은 점수의 다음 토큰을 선택하기 때문에 정확한 재현을 쉽게 만든다. 일반적인 호스팅 애플리케이션은 다양한 출력을 만들기 위해 샘플링이나 다른 디코딩 제어를 사용할 수 있다. Deltafin은 현재 일부 샘플링 필드를 수용하지만 적용하지는 않는다.

프로젝트는 주요 벤치마크 경로에서 정확한 수치적 동작을 보고한다. 선택적 근사 모드는 더 낮은 정밀도 연산을 사용하지만, 관리자는 점수가 근소하게 차이 나는 출력은 재현성을 유지하지 못할 수 있다고 경고한다.

Kimi K3 자체도 추가적인 불확실성을 만든다. Moonshot의 공식 자료는 코딩, 추론, 시각 및 에이전트 평가 전반에서 강력한 성능을 주장한다. 이러한 주장은 특정 하니스, 설정 및 경쟁 모델 구성에 기반한다.

Deltafin은 이러한 벤치마크 주장을 검증하지 않는다. 지원되지 않는 커널 주변에 호환성 변경을 적용한 Moonshot의 공개 모델링 코드를 실행한다. 독자는 성공적인 가중치 실행과 독립적인 모델 품질 확인을 구분해야 한다.

모델 규모 역시 오해를 부를 수 있다. Kimi K3의 총 파라미터 수는 2조 8,000억 개이지만, 순전파 중 활성화되는 것은 1,040억 개다. 총 파라미터 수는 스토리지 부담을 결정하고, 활성 파라미터는 연산 부담의 일부를 더 잘 설명한다.

활성 파라미터 1,040억 개조차 워크스테이션에는 상당한 규모다. 그럼에도 희소 아키텍처 때문에 Kimi K3를 밀집형 2조 8,000억 파라미터 모델과 직접 비교하는 것은 잘못이다. 두 시스템은 매우 다른 양의 데이터를 이동하고 연산하게 된다.

더 새로운 하드웨어는 결과를 개선할 가능성이 있지만, 그 정도는 여전히 불확실하다. 더 큰 통합 메모리는 추가적인 스파인 데이터와 전문가를 유지할 수 있다. 더 빠른 스토리지와 메모리 대역폭은 데이터 이동 시간을 줄일 수 있다. 더 나은 커널은 연산 오버헤드를 낮출 수 있다.

이러한 개선이 모든 단계를 동일하게 확장하지는 않는다. 한 구성에서 스토리지가 지배적이라면, GPU만 빨라져도 이점은 제한적이다. 더 많은 메모리가 캐시 동작을 바꾼다면 성능은 원시 대역폭 증가율보다 크게 도약할 수 있다.

Deltafin은 통합 메모리 128GB를 갖춘 NVIDIA DGX Spark의 커뮤니티 결과를 인용한다. 기여자는 짧은 엔드투엔드 실행 결과를 보고했지만, 관리자는 이를 재현된 벤치마크가 아닌 단일 커뮤니티 측정치로 표기한다.

이러한 절제는 적절하다. 하드웨어 비교에는 동일한 프롬프트, 소프트웨어 리비전, 캐시 상태, 수치 경로 및 측정 방법이 필요하다. 그렇지 않으면 더 빠른 완료가 장치가 아니라 설정 차이를 반영할 수 있다.

따라서 가장 큰 위험은 Deltafin의 기준 수치가 무의미하다는 데 있지 않다. 독자가 좁은 시스템 결과를 로컬 AI 준비 상태에 대한 광범위한 주장으로 바꾸는 데 있다.

분당 4토큰의 로컬 생성은 실험과 오프라인 점검을 지원한다. 하지만 대부분의 사람이 채팅, 코드 완성 또는 자율 에이전트에서 기대하는 반응형 상호작용을 지원하지는 않는다.

0.0687 토큰 결과 이후 주목할 점

Deltafin의 의미는 이제 재현, 캐시 경제성, 그리고 이 접근 방식이 현실적인 프롬프트에서도 유지되는지에 달려 있다.

첫 번째 신호는 최신 Apple 하드웨어에서의 독립적인 성능이다. 결과에는 정확한 칩 구성, 메모리 용량, 스토리지 장치, 소프트웨어 커밋, 캐시 상태 및 디코딩 설정이 보고되어야 한다.

더 많은 메모리를 갖춘 최신 Max 또는 Ultra 시스템은 모델 작업 세트의 더 큰 비율을 유지할 수 있다. 통제된 테스트에서 처리량이 크게 개선된다면, Deltafin의 아키텍처는 고립된 M1 Max 요령이 아니라 확장 가능한 로컬 추론 경로로 보일 것이다.

향상 폭이 작게 유지된다면 스토리지 트래픽이 더 단단한 상한을 강제하고 있을 가능성이 크다. 이 결과는 상호작용형 사용의 근거를 약화시키는 한편 프로젝트의 연구 가치는 보존할 것이다.

두 번째 신호는 긴 프롬프트에서의 동작이다. Deltafin의 현재 핵심 수치는 5토큰 프롬프트 이후의 안정적인 디코딩에 초점을 맞춘다. 실제 채팅과 코딩 워크로드는 생성 시작 전에 모든 입력 토큰을 처리하는 프리필에 크게 좌우된다.

유용한 테스트에는 수천 토큰 규모의 코드 컨텍스트, 도구 정의, 대화 기록 및 반복적인 에이전트 호출이 포함되어야 한다. 첫 토큰까지 걸리는 시간은 안정적인 디코딩 속도와 별도로 보고해야 한다.

이 구분은 openai max 사용자층에 중요하다. 시스템은 생성 속도를 높일 수 있지만, 첫 응답 전까지 사용자를 몇 시간씩 기다리게 할 수 있다. 실용적인 반응성은 두 단계 모두에 달려 있다.

Kimi K3의 100만 토큰 컨텍스트는 특히 중요하다. 모델 아키텍처가 컨텍스트 길이를 지원한다고 해서 모든 런타임이 허용 가능한 메모리와 시간 제약 안에서 그 길이를 처리할 수 있다는 뜻은 아니다.

세 번째 신호는 워크로드 전반에서 전문가 캐싱이 예측 가능해지는지 여부다. Deltafin의 스트리밍 모드는 누적된 로컬 전문가, 트레이스 기반 워밍업 및 궁극적인 재사용에 의존한다. 연구자들은 다양한 작업 시퀀스의 캐시 적중률 데이터가 필요하다.

코딩 프로젝트는 유용한 전문가 하위 집합을 반복적으로 활성화해 시간이 갈수록 개선될 수 있다. 코드에서 시각 분석이나 광범위한 리서치로 전환하면 라우팅 패턴이 바뀌고 그 이점 대부분이 사라질 수 있다.

작은 캐시가 현실적인 세션에서 높은 재사용률을 제공한다면, 215GB 모드는 미리보기 이상의 의미를 가질 수 있다. 전문가 선택이 넓게 분산된 상태로 남는다면, 전체 1.7TB 설치가 유일하게 견딜 만한 로컬 경로로 남을 것이다.

소프트웨어 최적화는 이러한 테스트와 함께 계속될 것이다. Deltafin은 이미 int8 출력 헤드, 추측 디코딩 변경, 버퍼 재사용, 네이티브 커널 및 백그라운드 로딩을 통한 개선을 보고했다.

이러한 향상은 초기 런타임이 얼마나 빠르게 발전할 수 있는지를 보여준다. 동시에 현재의 초당 0.0687토큰 수치는 영구적인 상한이 아니라 시간이 지난 기준점으로 봐야 함을 시사한다.

하지만 향후 헤드라인은 벤치마크 규율을 지켜야 한다. 변경된 프롬프트, 더 짧은 출력, 워밍업된 캐시, 근사 수치 모드 또는 다른 전문가 수는 비교 조건을 바꾸면서 속도를 향상시킬 수 있다.

선택되는 전문가 수를 줄이는 것은 전문가 데이터 이동을 줄이므로 명백한 속도 조절 수단이다. Deltafin은 이 제어 기능을 제공하지만, 전문가 수가 적으면 출력과 모델 품질이 달라질 수 있다. 그러한 실행 결과를 기본 top-16 경로와 동등한 것으로 제시해서는 안 된다.

Moonshot의 지속적인 가중치와 코드 공개 역시 중요합니다. 공식 Kimi K3 model은 개발자들이 Deltafin과 같은 실험을 가능하게 하는 파일에 접근할 수 있도록 합니다. 런타임 호환성은 향후 모델 개정과 문서화에 따라 달라질 것입니다.

개발자에게 즉각적인 교훈은 호스팅 모델을 M1 Max로 대체하라는 것이 아닙니다. 어떤 제약이 절대적인지 다시 검토하라는 것입니다. 지연 시간을 감수할 수 있다면 스토리지 인식 추론은 가용 메모리보다 훨씬 큰 모델도 실행할 수 있습니다.

기업 구매자에게 이 프로젝트는 로컬 제어와 프로덕션 적합성의 차이를 분명히 보여줍니다. 데이터 레지던시, 모델 접근성, 응답 시간, 동시성, 유지보수, 라이선스는 여전히 각각 별도의 결정 사항입니다.

지식 노동자에게 이 결과는 로컬 시스템이 점점 더 큰 모델에 접근할 수 있는 미래를 시사합니다. 오늘날에는 출력을 기다리는 것보다 관리하는 일이 훨씬 쉽습니다. 느린 로컬 실행을 실험하는 팀은 프롬프트, 구성, 결과, 의사결정을 검색 가능한 엔지니어링 지식으로 보존해야 합니다.

Deltafin은 데이터 센터를 오래된 노트북 안에 압축해 넣은 것이 아닙니다. 그곳에 들어갈 수 없어야 하는 모델을 통과하는, 세심하게 관리된 경로를 구축했습니다. 토큰당 14.6초가 걸리더라도 이 결과가 중요한 이유가 바로 여기에 있습니다.

다음 질문은 측정할 수 있습니다. 독립 개발자들이 이 수치를 재현한 뒤, Kimi K3의 기본 연산을 바꾸지 않고 이를 줄일 수 있을까요? 그러한 결과가 나오기 전까지 openai max는 여전히 잘못된 경쟁 대상입니다. Deltafin이 겨루는 대상은 불가능한 실행과 비실용적인 실행 사이의 경계입니다.

 
 

무료로 시작하세요

개인 지식 관리 기능을 갖춘 로컬 우선 AI 어시스턴트

더 나은 AI 경험을 위해

현재 remio는 Windows 10+ (x64)M-Chip Macs만 지원합니다.

​머릿속에 검색창을 추가하세요

remio에게 물어보기만 하면 됩니다

모든 것을 기억하세요

정리는 필요 없습니다

bottom of page