PrismML Bonsai 2 27B, 로컬 AI를 축소하다—그러나 가장 어려운 테스트는 여전히 중요하다
PrismML은 9월 17일 Bonsai 2 27B를 출시하며, 270억 파라미터 모델을 소비자용 하드웨어에서 구동할 수 있는 5.9GB 패키지로 압축했다. 회사는 PrismML Bonsai 2 27B가 풀 프리시전 버전의 종합 벤치마크 성능 가운데 98.2%를 유지한다고 밝혔다.
이 조합은 로컬 AI의 계산식을 바꾼다. 개발자들은 그동안 여유롭게 탑재되는 소형 모델과 더 강력한 추론 능력을 지닌 대형 모델 사이에서 선택해야 했다. Bonsai 2는 27B급 멀티모달 시스템을 노트북과 소비자용 그래픽 카드의 메모리 범위에 넣음으로써 이러한 절충안에 도전한다.
다만 가중치를 탑재하는 일은 첫 번째 시험에 불과하다. PrismML의 종합 결과는 벤더가 보고한 수치이며, 일부 패키징 형식은 5.9GB보다 많은 공간을 차지하고, 현재 모델은 커스텀 런타임 구성 요소에 의존한다. 가장 큰 의문은 압축된 로컬 모델이 길고 도구 중심적인 작업에서도 신뢰성을 유지할 수 있는지다.
PrismML Bonsai 2 27B, 27B급 AI를 5.9GB에 담다
이번 출시는 PrismML이 기본 27B 아키텍처를 바꾸지 않고 언어 모델의 설치 공간을 줄였다는 점에서 중요하다.
Bonsai 2는 텍스트와 이미지를 처리하는 멀티모달 모델 Qwen3.8-27B에서 파생됐다. PrismML은 아키텍처를 유지하면서 언어 모델 가중치 대부분을 삼진 표현으로 변환했다.
삼진 가중치는 음수 1, 0, 양수 1의 세 가지 값만 사용한다. 공유 스케일 값은 런타임이 이러한 압축 값을 추론 중 유용한 수치 연산으로 변환할 수 있게 한다.
이 표현 방식은 단순히 파라미터를 삭제하거나 모델을 더 작은 아키텍처로 교체하는 것과 다르다. Bonsai 2에는 여전히 약 270억 개의 파라미터가 포함되지만, 각 압축 가중치는 일반적인 16비트 값보다 훨씬 적은 저장 공간을 요구한다.
PrismML의 출시 발표에 따르면 이 모델은 Google v5 TPU를 사용해 학습한 278억 파라미터 모델이다. 더 상세한 모델 자료에는 언어 백본, 임베딩 레이어, 출력 헤드, 비전 타워를 포함해 총 273억6000만 개의 파라미터가 있다고 기재돼 있다.
공개된 GGUF 패키지 중 가장 작은 것은 PrismML의 PTQ1_0 형식을 사용한다. 이는 언어 구성 요소를 약 5.95GB에 저장하며, 풀 프리시전 참조 모델은 약 54GB다.
PQ2_0이라는 두 번째 GGUF 패키지는 약 7.21GB를 차지한다. Apple 기기용 MLX 언어 가중치는 해당 컨테이너가 추가 스케일 정보를 저장하기 때문에 약 7.67GB를 사용한다.
압축되지 않은 0.92GB 비전 타워를 추가하면 전체 MLX 패키지는 8.60GB에 이른다. 따라서 5.9GB라는 대표 수치는 다운로드 가능한 모든 구성의 크기가 아니라 가장 작은 텍스트 모델 패키징을 뜻한다.
이 구분이 성과를 무색하게 하지는 않는다. 더 큰 패키지조차 풀 프리시전 모델의 메모리 요구량보다 훨씬 적다. 다만 구매자와 개발자가 특정 다운로드에 대해 무엇을 기대해야 하는지에는 영향을 준다.
문서에 따르면 모델은 262,144토큰의 컨텍스트 용량을 유지한다. 컨텍스트 윈도는 모델이 한 번의 상호작용에서 처리할 수 있는 텍스트 또는 기타 토큰화된 정보의 양이다.
Bonsai 2는 Qwen3.8-27B의 하이브리드 어텐션 아키텍처도 보존한다. 레이어의 약 4분의 3은 선형 어텐션을 사용하며, 이는 긴 프롬프트와 관련된 메모리 증가를 제한한다.
PrismML은 Apache 2.0 라이선스로 가중치를 공개했다. 회사는 llama.cpp 기반 배포용 GGUF 빌드와 Apple 하드웨어용 MLX 버전을 제공한다.
이러한 가용성은 개발자에게 클라우드 전용 서비스보다 더 많은 제어권을 제공한다. 팀은 파일을 검사하고, 자체 환경에서 추론을 실행하며, 모든 프롬프트를 외부 공급자에게 보내지 않고 모델을 테스트할 수 있다.
이번 출시는 2026년 7월에 나온 PrismML의 첫 Bonsai 27B 모델을 기반으로 한다. 이전 세대가 회사의 압축 접근법을 확립했다면, Bonsai 2는 이를 더 새로운 Qwen 기반 모델에 적용했다.
새 출시는 주장하는 종합 성능 유지율을 약 95%에서 98.2%로 끌어올렸다. 더 중요한 점은 PrismML의 메시지가 대형 모델을 로컬에 탑재하는 데서 진지한 업무에 충분한 품질을 보존하는 방향으로 옮겨갔다는 것이다.
로컬 27B 모델이 더 작은 대안에 압박을 가하는 이유
Bonsai 2는 로컬 배포를 위해 8B급 모델로 낮춰야 한다는 가정에 압박을 가한다.
로컬 모델 사용자는 일반적으로 메모리, 응답 속도, 출력 품질이라는 세 가지 연결된 제약 조건의 균형을 맞춘다. 모델 크기를 키우면 성능이 향상될 수 있지만, 저장 공간과 메모리 대역폭, 런타임 요구 사항도 함께 늘어난다.
기존 양자화는 더 적은 비트로 모델 가중치를 표현해 이러한 요구 사항을 줄인다. 그러나 과도한 양자화는 특히 확장된 추론이나 정확한 지시 준수가 필요한 작업에서 성능을 불균등하게 훼손할 수 있다.
PrismML은 자사의 삼진 접근법이 이 곡선을 바꾼다고 주장한다. 모델 카드는 핵심 표현의 실제 평균이 가중치당 1.72비트라고 보고한다.
PrismML의 14개 벤치마크 사고 모드 평가에서 5.9GB Bonsai 빌드는 평균 84.78점을 기록했다. 풀 프리시전 Qwen3.8-27B 참조 모델의 점수는 86.32점이었다.
기존 IQ2_XXS 빌드는 같은 비교에서 9.4GB를 차지했고 72.59점을 기록했다. 더 큰 UD-Q4_K_XL 빌드는 17.6GB를 사용하면서 85.18점에 도달했다.
이 수치는 좁지만 중요한 주장을 뒷받침한다. PrismML의 테스트 구성 내에서 Bonsai 2는 기존 저비트 비교 대상보다 종합 품질을 훨씬 더 많이 보존했다.
압축 덕분에 더 많은 기기에서 전체 언어 모델을 빠른 메모리에 유지할 수 있다. 가중치가 더 느린 시스템 메모리로 넘어가면 추론은 대화형 사용에 지나치게 느려질 수 있다.
PrismML은 Nvidia GeForce RTX 5090에서 초당 최대 143개의 생성 토큰을 보고했다. Apple 측정치에는 M5 Max에서 약 초당 47토큰, M5 Pro에서 28.7토큰이 포함된다.
이 결과는 하드웨어별 수치이며 회사가 제시한 것이다. 프롬프트 길이, 패키징 형식, 런타임, 열 조건이 모두 처리량에 영향을 미치므로 보편적인 속도로 간주해서는 안 된다.
그럼에도 배포 범위는 의미가 있다. 개발자는 워크스테이션에서 비공개 코딩 어시스턴트를 실행할 수 있고, Apple 노트북은 유능한 로컬 리서치 또는 문서 모델을 호스팅할 수 있다.
이는 소형 범용 모델에 압박을 가한다. 8B 모델은 시작 시간, 메모리 오버헤드, 구형 하드웨어 전반의 지원 측면에서 여전히 장점이 있다. 그러나 압축된 27B 모델이 같은 기기에 들어간다면, 메모리 크기만으로 이를 선택해야 할 이유는 약해진다.
클라우드 공급자는 다른 압박에 직면한다. 로컬 추론은 네트워크 지연 시간을 없애고 프롬프트를 조직의 보안 경계 안에 유지할 수 있다.
독점 소스 코드를 다루는 엔지니어링 팀을 생각해 보자. 로컬 모델은 저장소를 원격 추론 서비스로 전송하지 않고도 파일을 검토하고, 테스트를 생성하며, 기술 문서를 검색할 수 있다.
같은 논리는 개인 기록, 내부 회의 노트, 규제 대상 문서에도 적용된다. 팀은 검색과 생성을 원본 자료 가까이에 유지하면서 로컬 모델을 검색 가능한 지식 베이스와 결합할 수 있다.
많은 까다로운 작업에서는 클라우드 모델이 여전히 더 바람직할 것이다. 클라우드 모델은 더 강력한 기능, 관리형 확장성, 성숙한 운영 지원을 제공할 수 있다.
따라서 당면 과제는 로컬 AI가 클라우드를 대체하는 것이 아니다. 로컬 모델이 일상적이고 비공개적이며 지연 시간에 민감한 업무에서 더 큰 비중을 처리할 만큼 충분히 유능해지는 것이다.
삼진 압축은 더 작은 설치 공간을 만드는 핵심 메커니즘이다
Bonsai 2는 커스텀 커널이 직접 처리하는 소형 3값 코드로 언어 가중치 대부분을 저장해 메모리 트래픽을 줄인다.
표준 풀 프리시전 추론은 일반적으로 각 가중치를 16비트로 저장한다. 수백억 개의 파라미터를 지닌 밀집 모델에서는 런타임 상태를 고려하기 전부터 이러한 값이 큰 메모리 설치 공간을 만든다.
Bonsai 2는 각 압축 가중치에 세 가지 값 중 하나를 할당한다. PrismML은 128개 가중치를 하나의 공유 16비트 스케일로 묶어, 실효 표현을 가중치당 약 1.71비트로 낮춘다고 설명한다.
소수의 고정밀 텐서는 모델 전체 평균을 1.72비트로 높인다. PrismML에 따르면 이 텐서들은 언어 모델의 약 0.098%를 차지한다.
변환에는 삼진 할당 전에 적용되는 수학적 변환인 Hadamard 회전도 사용된다. 이는 그렇지 않으면 저비트 양자화의 정확도를 낮출 수 있는 비정상적으로 큰 값을 재분배한다.
런타임에서는 입력이 네트워크를 통과하며 생성하는 중간 값인 활성화에 일치하는 변환이 적용된다. 패키징된 가중치는 다시 풀 프리시전으로 확장되지 않고 압축 상태를 유지한다.
이 설계가 중요한 이유는 로컬 추론이 흔히 메모리 대역폭에 의해 제한되기 때문이다. 프로세서는 토큰을 생성하는 동안 메모리에서 가중치를 반복적으로 이동시키므로, 단계당 이동하는 바이트를 줄이면 속도와 에너지 사용량을 개선할 수 있다.
런타임 저장소는 여러 Bonsai 세대에서 CUDA, Metal, Vulkan, ROCm 및 CPU 지향 배포를 지원한다. 또한 로컬 서빙, 비전, 도구 통합 기능도 제공한다.
Bonsai 2 자체는 출시 시점에 호환성 제약이 있다. 필요한 Hadamard 활성화 변환이 아직 표준 llama.cpp 프로젝트에 반영되지 않았다.
사용자는 현재 PrismML의 포크 또는 해당 설정 스크립트가 설치하는 바이너리에 의존해야 한다. 이는 회사의 구현과 출시 주기에 대한 의존성을 만든다.
패키징 형식 간 차이도 또 다른 층위를 더한다. PTQ1_0은 더 조밀한 저장 방식을 사용해 대표 크기인 5.95GB에 도달하는 반면, PQ2_0은 각 삼진 값을 2비트 슬롯에 배치한다.
더 조밀한 패키징은 메모리 트래픽을 줄이지만, 디코딩에는 더 많은 연산이 필요하다. PrismML의 측정 결과는 어느 형식도 모든 그래픽 프로세서에서 항상 더 빠르지는 않다는 점을 보여준다.
Apple MLX 버전에는 또 다른 절충안이 있다. 해당 컨테이너는 각 그룹에 대해 스케일과 바이어스를 모두 저장하므로 언어 모델 패키지 크기가 7.67GB로 늘어난다.
따라서 개발자는 자동으로 가장 작은 파일을 다운로드하기보다 실제 런타임에 따라 형식을 선택해야 한다. 최적의 빌드는 사용 가능한 메모리, 지원되는 커널, 프로세서 세대, 프롬프트 처리 요구 사항에 따라 달라진다.
비전 시스템 역시 대표 압축 수치의 범위 밖에 남아 있다. PrismML은 Qwen의 0.92GB 비전 타워를 삼진 가중치로 변환하지 않고 풀 프리시전으로 포함한다.
이 선택은 완전한 멀티모달 패키지가 5.9GB 텍스트 수치보다 더 많은 저장 공간을 차지하는 이유를 설명하는 데 도움이 된다. 또한 추가 양자화 손실로부터 비전 품질을 보호할 수 있다.
실질적으로 Bonsai 2는 어디서나 실행되는 단순한 초소형 파일이 아니다. 그 이점은 호환되는 저비트 커널에 좌우되는, 모델과 런타임이 조율된 시스템이다.
이 점은 이번 출시를 일반적인 사후 학습 양자화 업로드보다 기술적으로 더 흥미롭게 만든다. 동시에 생태계 채택을 이야기의 핵심 요소로 만든다.
98.2% 주장은 더 면밀히 읽을 필요가 있다
종합 벤치마크 결과는 고무적이지만, Bonsai 2가 모든 기능이나 워크플로의 98.2%를 보존한다는 뜻은 아니다.
PrismML의 공개 발표는 20개 벤치마크 제품군에서 83.9의 종합 점수를 인용한다. 이를 Qwen3.8-27B의 85.4점과 비교해, 보고된 98.2% 성능 유지 수치를 산출했다.
상세 모델 카드는 서로 다른 14개 벤치마크 집계를 제시한다. 여기서 Bonsai 2는 84.78점을 기록했으며, 풀 프리시전의 86.32점 대비 약 98.2%에 해당한다.
두 계산 모두 회사가 보고한 수치다. 서로 다른 벤치마크 세트와 총점을 하나의 독립적으로 재현된 시험 결과인 것처럼 합쳐서는 안 된다.
성능은 범주별로도 달라진다. 14개 벤치마크 결과에서 Bonsai 2는 네 가지 수학 테스트에서 96.57점을 기록했으며, 풀 프리시전은 97.06점이다.
코딩 범주에서는 89.42점으로 기준 점수인 89.07점을 소폭 웃돈다. 지시 이행 성능도 81.25점에서 82.66점으로 상승했다.
이러한 작은 개선이 압축이 기본 모델을 향상시킨다는 사실을 증명하지는 않는다. 벤치마크 표본 구성, 채점 변동, 디코딩 동작은 소폭의 역전을 만들어낼 수 있다.
더 큰 손실은 지식, 추론, 비전에서 나타난다. Bonsai 2는 지식·추론 통합 범주에서 79.86점을 기록했으며, 기준 모델은 85.55점이다.
비전 평균은 71.36점에서 66.19점으로 하락했다. 이미지에서 텍스트 인식을 평가하는 OCR Bench v2에서 Bonsai 2는 56.88점, 기준 모델은 60.99점을 기록했다.
이 차이는 문서 비중이 높은 워크플로에서 중요하다. 모델은 수학과 코드에서는 강점을 유지할 수 있지만, 스크린샷, 스캔 양식, 차트 또는 세밀한 시각적 증거를 해석할 때 정확도를 잃을 수 있다.
에이전트형 결과 역시 신중하게 해석해야 한다. Bonsai 2는 도구 호출 벤치마크인 BFCL v3에서 74.92점을 기록했으며, 풀 프리시전은 76.74점이다.
이는 집계상으로는 비교적 작은 격차다. 그러나 하나의 도구 호출 테스트만으로 장시간 에이전트 루프 전반의 신뢰성을 입증할 수는 없다.
에이전트형 시스템은 실수를 증폭시킨다. 파일 선택, 명령 또는 중간 결론이 조금만 부정확해도 이후 모든 단계가 달라질 수 있다.
긴 컨텍스트 용량도 비슷한 구분을 요구한다. 262,144개 토큰 지원은 아키텍처와 런타임이 해당 양을 받아들일 수 있다는 뜻이다. 모든 위치에서 일관된 기억이나 추론을 보장한다는 의미는 아니다.
이 지점에서는 독립 테스트가 가장 중요하다. 검토자들은 Bonsai 2와 풀 프리시전 Qwen을 대상으로 동일한 프롬프트 세트, 런타임 버전, 컨텍스트 크기, 디코딩 설정을 비교해야 한다.
초기 실사용 보고는 이미 엇갈린다. 한 사용자는 8GB M2 Mac mini에서 모델을 완전히 실행하며 초당 약 7.6토큰을 기록했다고 보고했으며, 이는 기본적인 탑재 가능성 주장을 뒷받침한다.
다른 초기 사용자들은 복잡한 프롬프트와 장시간 추론에서의 동작에 의문을 제기했다. 이 보고들은 일화적이고 하드웨어 의존적이며, 안정적인 품질 프로필을 확립하기에는 아직 이르다.
SiliconANGLE의 보도는 성능 및 효율성 수치를 회사의 주장으로 적절히 규정한다. 독립 평가가 성숙할 때까지 이 구분은 분명히 유지돼야 한다.
PrismML은 공개 가중치와 재현 가능한 파일을 갖춘 이례적으로 압축적인 릴리스를 분명히 선보였다. 하지만 모든 까다로운 워크로드가 겨우 1.8%의 성능 손실만 겪는다는 점은 아직 입증하지 못했다.
로컬 AI는 프라이버시를 높이지만, 배포에는 여전히 비용이 든다
Bonsai 2는 더 많은 작업을 로컬에 유지할 수 있게 하지만, 셀프 호스팅은 운영 책임을 제공업체에서 사용자에게 이전한다.
가장 명확한 활용 사례는 비공개 문서 처리다. 사용자는 원본 자료를 업로드하지 않고도 로컬 노트를 요약하거나, 내부 파일에서 정보를 추출하거나, 민감한 지식 컬렉션을 검색할 수 있다.
소프트웨어 개발도 또 다른 논리적 대상이다. 로컬 호스팅 코딩 어시스턴트는 워크스테이션의 기존 접근 경계 안에서 저장소를 검사하고, 패치를 제안하며, 개발 도구를 호출하고, 테스트를 생성할 수 있다.
멀티모달 지원은 이미지 기반 작업을 더한다. 팀은 인터페이스 스크린샷을 분석하고, 문서에서 텍스트를 추출하거나, 다이어그램을 서면 지침과 결합할 수 있다.
하지만 비전 벤치마크 격차는 이러한 시나리오에 검증이 필요하다는 뜻이다. 중요한 광학 문자 인식 작업을 일반 집계 점수에만 의존해서는 안 된다.
로컬 추론은 제3자 노출을 줄일 수 있지만, 애플리케이션을 자동으로 안전하게 만들지는 않는다. 모델 서버는 여전히 잘못 구성되거나 네트워크에 노출되거나, 과도한 파일 및 명령 권한을 부여받을 수 있다.
PrismML의 문서에 따르면 데모 서버는 기본적으로 로컬 주소에 바인딩된다. 사용자가 이 주소를 변경하면 서비스가 해당 장비 밖으로 노출될 수 있다.
도구를 사용하는 에이전트는 추가 위험을 초래한다. 파일을 수정하거나 명령을 실행할 수 있는 모델에는 권한 경계, 로깅, 사람의 검토가 필요하다.
팀은 모델 업데이트도 관리해야 한다. 클라우드 제공업체는 인프라를 중앙에서 교체할 수 있지만, 로컬 배포 환경에서는 장치별로 서로 다른 바이너리, 가중치 버전, 구성 설정이 누적될 수 있다.
커스텀 런타임 요구사항은 이 부담을 키운다. 사용자가 지원되는 경로를 통해 이를 받으려면 보안 수정과 호환성 변경 사항이 PrismML의 포크에 먼저 반영돼야 한다.
하드웨어 적합성도 전체 애플리케이션 기준으로 평가해야 한다. 모델 가중치는 메모리 소비의 한 부분일 뿐이다.
런타임에는 작업 메모리가 필요하고, 키-값 캐시는 컨텍스트 상태를 저장하며, 멀티모달 구성 요소는 추가 자원을 소비한다. 따라서 긴 프롬프트는 명목상 호환되는 장비도 편안한 한계를 넘길 수 있다.
배터리 구동 환경은 또 다른 절충점을 제시한다. PrismML은 M5 Pro에서 디코딩 중 GPU 전력 약 27.5와트, CPU와 GPU를 합쳐 34.1와트를 기록했다고 보고했다.
이 측정치에는 모든 시스템 구성 요소가 포함되지 않으며, Nvidia 보드 측정치와 직접 비교할 수 없다. 그럼에도 로컬 추론이 공짜가 아니라는 점은 보여준다.
최선의 배포 방식은 하이브리드일 수 있다. 일상적이고 민감한 작업은 온디바이스에 유지하고, 예외적으로 어려운 작업은 명시적인 규칙에 따라 더 강력한 관리형 모델로 넘길 수 있다.
이 방식은 조직이 데이터가 언제 장비를 벗어나는지 통제하게 해준다. 또한 품질이 프라이버시나 지연 시간보다 중요한 작업을 압축 모델에 억지로 맡기지 않아도 된다.
결정은 매개변수 수만이 아니라 측정된 작업 성능을 따라야 한다. 팀은 기존 서비스를 대체하기 전에 자체 코드, 문서, 이미지, 도구 실행 순서를 테스트해야 한다.
Bonsai 2는 가중치와 실행 리소스를 공개했기 때문에 이러한 테스트를 더 쉽게 만든다. 남은 과제는 운영상 절감 효과가 통합 및 유지보수 비용을 상회한다는 점을 입증하는 일이다.
Bonsai 2 27B 출시 후 주목할 점
독립 평가, 업스트림 런타임 지원, 지속적인 프로덕션 도입이라는 세 가지 신호가 Bonsai 2가 장기적인 로컬 AI 선택지가 될지를 결정할 것이다.
첫 번째 신호는 독립적인 벤치마크 재현이다. 가장 가치 있는 테스트는 동일한 조건에서 Bonsai 2를 풀 프리시전 Qwen3.8-27B 및 기존 양자화 모델과 비교하는 것이다.
평가자는 평균 점수 이상을 보고해야 한다. 작업별 실패, 응답 길이, 추론 루프, 시각적 정확도, 긴 컨텍스트 회상은 압축이 동작을 어디서 바꾸는지 드러낼 것이다.
에이전트형 코딩은 특히 주목할 만하다. 많은 도구 호출, 저장소 탐색, 테스트 실행을 요구하는 벤치마크는 고립된 코드 완성보다 더 나은 스트레스 테스트를 제공한다.
Bonsai 2가 이러한 평가 전반에서 풀 프리시전에 근접한 성능을 유지한다면, PrismML의 지능 밀도 주장은 훨씬 강해진다. 큰 품질 하락이 나타난다면 모델의 최적 활용 범위는 더 단순하거나 허용 오차가 큰 작업으로 좁아질 것이다.
두 번째 신호는 주류 런타임에서의 지원이다. PrismML은 Hadamard 활성화 변환이 업스트림에 반영되지 않았기 때문에 Bonsai 2가 현재 llama.cpp 포크를 필요로 한다고 말한다.
널리 사용되는 프로젝트에 채택되면 설치 마찰과 한 공급업체의 바이너리에 대한 의존도가 줄어든다. 또한 구현이 더 많은 검토, 최적화, 하드웨어 테스트에 노출된다.
더 폭넓은 런타임 지원은 벤치마크 품질만큼 중요할 수 있다. 기술적으로 인상적인 형식이라도 개발자가 익숙한 도구로 배포할 수 없다면 어려움을 겪게 된다.
세 번째 신호는 시연을 넘어선 실제 도입이다. 다운로드 수는 초기 단서를 제공하지만, 반복 가능한 애플리케이션과 유지되는 통합이 더 나은 증거를 제공한다.
유용한 지표로는 안정적인 코딩 어시스턴트, 비공개 리서치 시스템, 로컬 멀티모달 검색, 그리고 평가 이후에도 이어지는 엔터프라이즈 파일럿이 있다. 실패 보고도 압축 모델이 아직 준비되지 않은 워크로드를 식별하기 때문에 똑같이 가치 있다.
경쟁도 더욱 치열해질 것이다. 기존 4비트 모델은 사용자가 더 많은 메모리를 보유할 때 이미 강력한 품질을 제공하며, 더 작은 네이티브 모델은 보급형 하드웨어에서 여전히 실행하기 쉽다.
Bonsai 2는 이러한 선택지를 없애지 않는다. 더 큰 기반 모델과 이례적으로 공격적인 압축을 결합해 곡선 위에 새로운 지점을 제시한다.
개발자에게 다음 단계는 실용적인 테스트다. 적절한 패키지를 다운로드하고, 대상 장비에서 작은 벤치마크를 재현한 뒤, 권한을 확대하기 전에 실제 프롬프트를 평가해야 한다.
엔터프라이즈 구매자는 작업 수준의 정확도, 런타임 지원 약속, 명확한 보안 모델을 요구해야 한다. 98.2%라는 수치를 포괄적인 서비스 수준 보장으로 받아들여서는 안 된다.
PrismML Bonsai 2 27B는 이미 기본적인 결과를 확립했다. 27B급 모델이 가장 작은 언어 전용 형식에서 6GB 미만을 차지할 수 있다는 점이다. 남은 질문은 실제 작업이 길어지고, 시각적이며, 에이전트형이 될 때 이 밀도가 신뢰성을 유지하느냐는 것이다.
비공개 로컬 모델이 워크플로를 개선할까, 아니면 유지보수와 품질 측면의 절충이 그것이 제공하는 통제의 이점을 넘어설까? 이제 답은 유능한 모델이 탑재되는지보다, 탑재된 뒤 어떤 일이 벌어지는지에 더 크게 달려 있다.



