top of page

Kog, 더 깊은 GPU 최적화로 AI 추론 가속 가능성에 베팅

Kog가 특수 칩 중심의 통념에 정면으로 도전하며 Google News에 올랐다. 이 Paris 스타트업은 에이전틱 AI가 반드시 표준 데이터센터 GPU를 포기할 필요는 없다고 주장한다. 모델, 추론 소프트웨어, 하드웨어를 더 긴밀히 조율하면 복잡한 AI 워크플로가 요구하는 응답성을 제공할 수 있다는 설명이다.

이 주장은 AI 인프라를 둘러싼 확산하는 가정을 겨냥한다. 에이전트는 계획 수립, 도구 사용, 결과 평가, 오류 수정 과정에서 많은 모델 호출을 생성한다. 이런 패턴은 느린 추론을 비용 높고 답답한 문제로 만들 수 있으며, AI 모델 서빙에 특화된 프로세서의 필요성을 강화한다.

Kog는 반대 경로를 택하고 있다. GPU를 교체하는 대신, GPU가 잠재력을 충분히 발휘하지 못하게 하는 소프트웨어 오버헤드의 여러 층을 제거하려 한다. 특수 하드웨어와 더 깊은 GPU 최적화의 경쟁은 이제 에이전틱 AI를 정의하는 핵심 인프라 질문 중 하나가 되고 있다.

Kog가 GPU 추론을 더 깊이 파고드는 이유

Kog는 개별 런타임 개선을 넘어 모델, 추론 엔진, GPU를 하나의 최적화 문제로 다루고 있다.

이 회사의 입장은 8월 14일 보도가 익숙한 하드웨어에서 더 많은 추론 성능을 끌어내려는 시도를 다룬 뒤 더 넓은 관심을 받았다. GPU inference story는 Kog의 작업을 통념에 반하는 아이디어로 조명했다. 애플리케이션이 빠르고 반복적인 모델 응답을 요구하더라도 GPU가 본질적으로 에이전틱 애플리케이션과 맞지 않는 것은 아닐 수 있다는 것이다.

이 구분은 추론이 단일하고 균일한 워크로드가 아니기 때문에 중요하다. 소비자용 챗봇은 긴 답변을 내놓기 전 잠시 멈추는 것을 감수할 수 있다. 반면 코딩 에이전트나 음성 인터페이스는 사용자에게 보이는 하나의 작업을 완료하기 전 여러 차례의 순차적 결정을 내려야 하는 경우가 많다.

지연은 그 사슬 전체에 걸쳐 누적될 수 있다. 에이전트가 다음 작업을 시작하기 전에 하나의 모델 응답을 기다린다면, 개별 응답 지연 시간을 줄이는 것만으로도 전체 워크플로를 단축할 수 있다.

Kog의 해법은 추론 엔진에서 시작한다. 이는 사용자나 애플리케이션이 요청을 보낼 때 학습된 모델을 실행하는 소프트웨어다. 대부분의 프로덕션 엔진은 모델 실행을 커널이라고 부르는 다수의 GPU 연산으로 나눈다. 커널은 프로세서에서 특정 계산을 수행하는 저수준 프로그램이다.

많은 커널을 실행하고 조율하면 오버헤드가 발생한다. 데이터는 메모리 위치 간에 이동해야 할 수 있고, 프로세서는 동기화해야 하며, 호스트 시스템은 반복적으로 작업을 스케줄링한다. 각각의 지연은 그 자체로는 작아 보이지만, 지연에 민감한 생성 작업에서는 누적 비용이 눈에 띄게 된다.

Kog는 디코드 시퀀스를 하나의 지속형 커널 안에 배치해 이러한 오버헤드를 줄였다고 말한다. 디코드는 언어 모델이 출력 토큰을 하나씩 생성하는 단계다. 지속형 커널은 각각의 작은 연산 뒤 제어권을 반환하는 대신 GPU에서 계속 활성 상태를 유지한다.

Kog는 5월 기술 프리뷰에서 AMD MI300X GPU 8개를 사용해 하나의 요청에서 초당 3,000개 이상의 출력 토큰을 기록했다고 밝혔다. Nvidia H200 GPU 8개에서는 초당 2,100개 토큰을 보고했다. Kog의 inference preview에 따르면, 이 테스트는 speculative decoding 없이 FP16 정밀도의 20억 파라미터 모델을 사용했다.

Speculative decoding은 더 작은 모델이 토큰 후보를 제안하고, 더 큰 모델이 이를 묶음 단위로 검증하는 방식이다. 생성 속도를 높일 수 있지만 비교에 또 다른 변수를 추가하기도 한다. 이 기법을 제외함으로써 Kog는 보고한 결과를 주로 자사의 모델 및 런타임 설계에 귀속하고 있다.

이 스타트업은 저지연 디코딩을 중심으로 설계한 23억 파라미터 코딩 모델 Laneformer 2B도 개발했다. 이는 부수적인 프로젝트가 아니라 전략의 핵심 부분이다. Kog는 자사 엔진이 가장 잘 처리하는 실행 패턴에 맞춰 모델 아키텍처를 최적화하고 있다.

이 설계에는 통신을 연산 및 가중치 이동과 겹치게 하려는 지연형 텐서 병렬화가 포함된다. 텐서 병렬화는 모델의 계산을 여러 GPU에 분할한다. 이 방법은 더 큰 총 컴퓨팅 용량을 제공하지만, GPU 간 통신이 병목이 될 수 있다.

Kog의 접근법은 이러한 통신을 다른 유용한 작업 뒤에 숨기려 한다. 이 회사는 사실상 GPU 비효율이 부분적으로는 스케줄링 문제라고 주장하는 셈이다. 더 나은 순서 배치는 종속 연산 사이의 멈춤을 줄이면서 프로세서를 계속 가동할 수 있다.

이 결과는 여전히 회사가 보고한 벤치마크다. 더 큰 모델, 더 긴 프롬프트, 다수의 동시 사용자 또는 프로덕션 트래픽에서 동등한 성능을 입증하는 것은 아니다. 다만 이 스타트업이 기존 모델 위에 또 하나의 서빙 계층을 추가하는 대신 더 깊이 파고드는 이유를 보여준다.

이 작업은 기사 전체의 핵심 긴장도 만들어낸다. Kog가 이러한 성과를 소규모 공동 설계 모델을 넘어 확장할 수 있다면, 특수 추론 하드웨어는 가장 강력한 논거 일부를 잃게 된다. 반대로 성과가 좁은 구성에 크게 의존한다면, 해당 하드웨어의 논거는 여전히 유효하다.

Google News가 GPU 대 맞춤형 칩 논쟁을 조명하다

Kog의 이야기가 중요한 이유는 실시간 에이전트에 새로운 프로세서 아키텍처가 필요하다는 믿음에 압박을 가하기 때문이다.

특수 추론 기업들은 합리적인 관찰에서 출발한다. GPU는 범용 병렬 프로세서로 설계된 반면, 언어 모델 디코딩은 예측 가능한 수학적 및 메모리 접근 패턴을 지닌다. 목적에 맞춰 설계된 칩은 이 워크로드에 필요하지 않은 하드웨어 기능을 제거할 수 있다.

Groq, Cerebras, SambaNova, Etched는 각각 이러한 전략의 한 형태를 추구해 왔다. 아키텍처는 다르지만, 공통된 약속은 추론 지연 시간, 처리량, 메모리 이동 또는 에너지 사용을 더 엄격하게 제어하는 것이다.

Groq는 연산을 예측 가능하게 스케줄링하는 프로세서로 알려졌다. Cerebras는 하나의 실리콘 조각에 이례적으로 큰 컴퓨팅 용량을 배치하는 웨이퍼 스케일 시스템을 만든다. Etched는 transformer 모델 전용으로 설계된 칩에 집중해 왔다.

이들 설계는 하드웨어 수준에서 워크로드를 공략한다. Kog는 데이터센터에 이미 구축된 GPU를 유지하면서 소프트웨어와 모델 아키텍처를 통해 유사한 이점을 얻으려 한다.

이 때문에 Google News 전반에서 Kog가 등장한 일은 일반적인 벤치마크 발표보다 더 큰 의미를 지닌다. 이 회사는 고객이 또 다른 인프라 스택에 투자하기 전에 소프트웨어가 범용 하드웨어와 맞춤형 실리콘 사이의 격차를 좁힐 수 있는지 시험하고 있다.

하드웨어 전환은 벤치마크 속도 이상의 영향을 미친다. 운영자는 공급, 배포 도구, 모니터링, 모델 호환성, 엔지니어링 역량, 기존 클러스터와의 통합을 고려해야 한다. Nvidia의 강점은 실리콘만이 아니라 GPU 프로그래밍용 소프트웨어 플랫폼인 CUDA에도 있다.

AMD는 대안으로 ROCm 소프트웨어 스택을 구축해 왔다. AMD MI300X 하드웨어에서 보고된 Kog의 성능은 저수준 추론 엔지니어링이 비Nvidia GPU의 경쟁 논리도 강화할 수 있음을 시사한다. 이 결과는 공급업체 선택의 유연성을 더 원하는 클라우드 제공업체와 기업에 중요할 수 있다.

따라서 압박은 여러 집단에 가해진다. 특수 칩 벤더는 공격적인 GPU 최적화 이후에도 성능 우위가 유지된다는 점을 보여야 한다. Nvidia는 자사 플랫폼의 매력인 폭넓은 호환성을 지키면서 추론 소프트웨어를 계속 개선해야 한다.

AMD는 다른 과제에 직면해 있다. 경쟁력 있는 하드웨어와 개별 기술 시연을 신뢰할 수 있는 프로덕션 환경으로 전환해야 한다. Kog의 엔진이 여러 모델과 실제 워크로드에서 일관되게 작동한다면, 이 회사는 AMD의 논거를 도울 수 있다.

추론 소프트웨어 기업들도 압박을 받고 있다. 널리 사용되는 엔진은 이미 연속 배칭, 커널 융합, 양자화, 프리픽스 캐싱, speculative decoding 같은 기법을 적용한다. Kog는 더 깊은 아키텍처가 이러한 기존 시스템이 빠르게 재현할 수 없는 성과를 만든다는 점을 입증해야 한다.

연속 배칭은 요청을 동적으로 결합해 GPU가 한 번에 더 많은 작업을 처리하도록 한다. 이는 시간당 완료되는 총 작업량을 측정하는 처리량을 개선할 수 있다. 그러나 처리량이 하나의 요청에 대한 최저 지연 시간을 보장하지는 않는다.

이 차이는 에이전트에서 특히 중요하다. 고처리량 서버는 많은 독립 요청을 효율적으로 처리할 수 있지만, 하나의 다단계 에이전트는 여전히 긴 순차 과정 동안 기다릴 수 있다. Kog는 그 개별 워크플로의 경험에 집중하고 있다.

이 전략은 학습 경제성에서 추론 경제성으로의 더 광범위한 전환을 반영한다. 모델 학습은 크지만 범위가 제한된 프로젝트다. 반면 서빙은 요청 수, 출력 길이, 각 작업 안에 숨겨진 모델 호출 수와 함께 증가하는 지속적 비용을 발생시킨다.

에이전트는 하나의 사용자 지시가 계획 수립, 검색, 도구 선택, 코드 실행, 검증, 수정으로 이어질 수 있기 때문에 이러한 비용을 증폭시킨다. 각 단계에는 또 다른 추론 호출이 포함될 수 있다. 따라서 더 빠른 생성은 사용자 경험과 운영 모델 모두를 바꿀 수 있다.

그렇다고 모든 에이전트가 GPU에 의해 제한되는 것은 아니다. 도구 호출, 네트워크 요청, 데이터베이스, 외부 API가 전체 완료 시간을 지배할 수 있다. 일부 워크플로는 토큰 생성보다 소프트웨어 시스템을 기다리는 데 더 많은 시간을 보낸다.

Kog의 논지는 모델 디코딩이 핵심 경로에 놓일 때 가장 강력하다. 코딩, 음성, 시뮬레이션, 대화형 추론 애플리케이션이 여기에 해당할 수 있다. 비동기적으로 실행되는 백그라운드 리서치 작업은 즉각적인 토큰 전달보다 총비용과 처리량을 더 중시할 수 있다.

특수 칩의 과제 역시 워크로드에 따라 달라진다. transformer 추론에 최적화된 프로세서는 모델이 그 가정에 부합할 때 탁월할 수 있다. 고객이 다양한 아키텍처, 학습 작업, 멀티모달 워크로드 또는 빠르게 변화하는 연구 코드를 실행해야 할 때는 범용 GPU가 우위를 유지한다.

이 때문에 핵심 경쟁은 단순히 Kog와 한 칩 제조업체의 대결이 아니다. 더 깊은 GPU 최적화와 하드웨어 특화의 경쟁이다. 두 경로 모두 더 빠르고 경제적인 추론을 목표로 하지만, 복잡성을 스택의 서로 다른 부분에 배치한다.

모델과 런타임이 하나의 시스템이 되다

Kog의 핵심적인 전환은 소프트웨어가 범용 대상처럼 GPU를 다루지 않을 때 범용 GPU도 특수 추론 하드웨어처럼 동작할 수 있다는 점이다.

전통적인 모델 개발은 연구와 배포를 분리하는 경우가 많다. 연구자는 모델 품질을 위해 아키텍처와 학습을 최적화한다. 이후 인프라 팀이 완성된 모델을 이용 가능한 서빙 환경에 맞춘다.

이러한 분업은 팀이 독립적으로 움직이게 하지만, 성능을 충분히 끌어내지 못할 수 있다. 모델에는 여러 GPU에서 조율하기 비용이 많이 드는 연산이 포함될 수 있다. 서빙 엔진은 그러한 연산이 가장 빠른 실행 경로와 충돌하더라도 이를 유지해야 한다.

Kog는 공동 설계를 사용하고 있다. 이는 모델과 런타임을 서로의 제약 조건에 맞춰 함께 구축하는 것을 뜻한다. Laneformer는 메모리 접근, 동기화, GPU 간 통신에 영향을 주는 아키텍처 결정에 대해 회사가 통제권을 갖게 한다.

회사의 Laneformer model은 이러한 철학을 구체적으로 보여준다. Kog는 모델 가중치와 코드를 공개해 외부 개발자가 아키텍처를 검토하고 이 주장의 일부를 시험할 수 있도록 했다.

지속 커널 설계는 더 낮은 수준에서 같은 논리를 따른다. 전통적인 실행 방식은 정규화, 어텐션, 행렬 연산 및 기타 단계를 위해 별도의 커널을 실행할 수 있다. 퓨전은 연산을 결합해 데이터가 프로세서에 더 가까이 머물도록 하고, 반복적인 스케줄링을 피한다.

Kog는 이 아이디어를 한 단계 더 밀어붙여 디코드 과정을 하나의 GPU 상주 프로그램 안에 유지한다. 목표는 연산 사이의 중단을 없애고 시퀀스를 더 직접적으로 관리하는 것이다.

이는 특수 목적 프로세서와 연관된 장점과 닮아 있다. 목적에 맞춰 설계된 하드웨어는 범용성을 제한하고 데이터 이동을 통제함으로써 예측 가능성을 확보하는 경우가 많다. Kog는 좁지만 깊이 최적화된 소프트웨어 경로를 통해 유사한 규율을 부여하려 하고 있다.

보고된 초당 3,000토큰 결과가 눈길을 끄는 이유는 단일 요청 생성에 초점을 맞췄기 때문이다. 많은 추론 벤치마크는 대규모 배치 전반의 총처리량을 강조한다. 이 지표는 공급자에게 중요하지만, 하나의 대화형 요청이 얼마나 오래 기다리는지는 가릴 수 있다.

배치 크기 1은 더 어려운 활용률 문제를 만든다. 시스템은 모든 GPU 유닛을 계속 바쁘게 유지하기 위해 수많은 동시 사용자를 활용할 수 없다. Kog의 모델과 런타임은 이 조건에서 더 뚜렷해지는 유휴 시간을 줄이도록 설계됐다.

하지만 속도만으로 유용한 에이전트 성능이 결정되지는 않는다. 모델 역량도 여전히 중요하다. 빠르게 생성하는 소형 모델이라도 오류를 내거나, 작업을 반복하거나, 더 강력한 모델의 검증이 필요하다면 전체적으로 더 오래 걸릴 수 있다.

이는 토큰 지연 시간과 작업 지연 시간 사이의 중요한 차이를 만든다. 토큰 지연 시간은 텍스트가 얼마나 빨리 나타나는지를 측정한다. 작업 지연 시간은 시스템이 사용자의 실제 목표를 완료하는 데 걸리는 시간을 측정한다.

초당 3,000토큰을 생성하지만 잘못된 도구를 선택하는 에이전트는 더 빠른 해결책을 제공한 것이 아니다. 잘못된 중간 단계를 더 빨리 생성했을 뿐이다. Kog의 더 근본적인 베팅은 결국 작업 수준에서의 이점을 보여줘야 한다.

Kog는 기술 자료에 따르면 더 큰 타사 mixture-of-experts 모델을 지원할 계획이다. mixture-of-experts 모델은 각 토큰마다 매개변수의 일부 하위 집합을 선택적으로 활성화한다. 이는 연산량을 줄일 수 있지만, 전문가를 라우팅하고 분산하는 과정에서 새로운 통신 과제가 생긴다.

널리 사용되는 외부 모델을 지원한다면 Kog의 주장은 구매자에게 더 관련성 높아질 것이다. 기업들은 그 모델이 좁은 작업을 탁월하게 수행하지 않는 한, 대개 하나의 소형 모델을 중심으로 인프라를 선택하지 않는다.

호환성은 고객이 애플리케이션을 재설계하지 않고 엔진을 도입할 수 있는지도 결정한다. OpenAI 호환 인터페이스는 API 통합을 단순화할 수 있지만, 모델 지원, 관측 가능성, 스케줄링, 장애 복구 역시 프로덕션 준비 상태를 좌우한다.

이 지점에서 기존 GPU 소프트웨어는 여전히 만만치 않다. Nvidia는 자사 하드웨어에서 추론을 최적화하는 TensorRT-LLM 및 기타 라이브러리를 개발한다. vLLM 및 SGLang 같은 오픈소스 프로젝트는 대규모 커뮤니티, 폭넓은 모델 지원, 프로덕션 피드백의 혜택을 받는다.

Nvidia는 TensorRT를 자사 프로세서에서 실행을 최적화하도록 설계된 고성능 추론 시스템으로 설명한다. 해당 추론 소프트웨어는 지원 모델 전반에 그래프 최적화, 저정밀도, 커널 선택을 적용한다.

따라서 Kog는 계속 움직이는 표적과 경쟁한다. 그 기술이 일반적이고 재현 가능하다면 더 큰 플랫폼도 유사한 아이디어를 도입할 수 있다. 기술이 독점적이거나 Laneformer에 밀접하게 묶여 있다면 Kog는 차별화를 얻지만 호환 가능한 시장은 더 작아진다.

Kog의 기회는 그 양극단 사이에 있을 가능성이 높다. Kog는 클라우드 사업자나 AI 팀이 재현하고 싶어 하지 않는 어려운 저수준 작업을 엔진으로 패키징할 수 있다. 가치는 하나의 벤치마크 최고점이 아니라 하드웨어 세대 전반에서 지속되는 실행 품질에서 나올 것이다.

모델-런타임 조합은 엄격한 응답성 요구 사항을 가진 애플리케이션 개발자에게도 매력적일 수 있다. 음성 시스템은 대화의 리듬을 유지하려면 낮은 지연이 필요하다. 코딩 에이전트는 생성과 실행을 반복적으로 순환해야 한다. 모든 모델 호출이 사용자를 방해하면 대화형 창작 도구도 성능이 떨어진다.

지식 집약형 에이전트는 또 다른 차원을 추가한다. 문서를 수집하고, 컨텍스트를 결합하며, 답변을 제시하기 전에 여러 차례 추론을 수행할 수 있다. 이런 시스템을 구축하는 팀은 생성 속도가 체인의 한 부분만 해결하기 때문에 전체 AI 워크플로를 검토해야 한다.

추론이 유일한 병목이 아닐 때에도 Kog의 주장은 유용하다. 최적화되지 않은 스택을 근거로 GPU가 부적합하다고 단정하기보다, 팀이 각 단계를 측정하도록 장려한다.

더 깊은 교훈은 소프트웨어가 항상 맞춤형 하드웨어를 이긴다는 것이 아니다. 하드웨어 비교는 그 위에서 구동되는 소프트웨어의 품질에 달려 있다는 점이다. 스케줄링이 부실한 GPU는 GPU의 최종 한계를 보여주는 증거가 아니다.

Kog의 벤치마크가 결론내리지 못하는 것

Kog는 신뢰할 만한 기술적 방향을 제시했지만, 공개 수치만으로는 주류 에이전트 워크로드 전반에서의 프로덕션 우위를 아직 입증하지 못했다.

첫 번째 한계는 모델 규모다. Laneformer는 23억 개의 매개변수를 갖는 반면, 많은 까다로운 에이전트 애플리케이션은 훨씬 더 큰 모델을 사용한다. 더 큰 시스템은 메모리 용량, 통신, 캐시 관리에 더 큰 부담을 준다.

하나의 노드에 소형 모델이 들어갈 때 잘 작동하는 기술도 가중치와 중간 데이터가 더 많은 장치에 걸쳐 분산되면 다르게 동작할 수 있다. 통신 비용은 증가하고, 엔진이 이를 숨길 기회는 줄어든다.

Kog는 대형 타사 mixture-of-experts 모델 지원이 예정돼 있다고 밝혔다. 비교 가능한 결과가 나오기 전까지 가장 강한 해석은 제한적일 수밖에 없다. 이 회사는 모든 프로덕션 모델이 할 수 있는 일이 아니라, 공동 설계한 스택이 특정 테스트에서 무엇을 할 수 있는지를 보여줬다.

두 번째 한계는 워크로드 형태다. Kog는 하나의 요청과 낮은 지연 시간을 강조한다. 상용 추론 서비스는 가변적인 프롬프트 길이, 다수 사용자, 트래픽 급증, 긴 컨텍스트, 취소, 변화하는 출력 제한도 처리해야 한다.

배치 크기 1에 최적화된 엔진은 더 높은 동시성에서 트레이드오프에 직면할 수 있다. 구매자에게 중요한 질문은 하나의 요청이 극도로 빠르게 실행될 수 있는지가 아니다. 클러스터를 경제적으로 활용하면서도 유용한 지연 시간을 유지할 수 있는지다.

세 번째 한계는 벤치마크 비교 가능성이다. 초당 토큰 수는 모델 아키텍처, 어휘, 정밀도, 출력 조건, 하드웨어 수, 측정 방식에 따라 달라진다. 이런 변수를 맞추지 않고 보고된 두 수치를 비교하면 잘못된 확신을 만들 수 있다.

8개 GPU에서 실행되는 소형 모델은 하나의 맞춤형 프로세서에서 실행되는 더 큰 모델과 직접 비교할 수 없다. 많은 요청을 처리하는 고처리량 서버와도 직접 비교할 수 없다. 각 구성은 서로 다른 운영상의 질문에 답한다.

네 번째 한계는 출력 품질이다. 공동 설계는 효율을 높일 수 있지만, 아키텍처는 여전히 애플리케이션의 정확도 요구 사항을 충족해야 한다. 코딩 모델에는 단순히 빠른 텍스트 생성이 아니라 신뢰할 수 있는 코드 생성과 추론이 필요하다.

공개 평가는 관련 코딩 작업에서 Laneformer를 비슷한 규모의 모델과 비교해야 한다. 또한 에이전트가 계획을 세우고, 코드를 실행하고, 오류를 만나고, 접근 방식을 수정할 때 그 속도가 종단 간 완료 시간을 줄이는지도 측정해야 한다.

다섯 번째 한계는 비용이다. Kog는 엔진이 더 빠르고 저렴하다고 설명하지만, 속도가 총 서빙 비용을 자동으로 결정하지는 않는다. 하나의 요청이 빠르게 완료되더라도 8개의 고급 GPU는 상당한 용량을 소비한다.

유용한 비교에는 하드웨어 구매 또는 임대 가정, 에너지 소비량, 평균 활용률, 동시성, 장애율, 운영 인력이 필요하다. 그 후 결과는 생성 토큰당 비용만이 아니라 완료된 작업당 비용으로 표현해야 한다.

여섯 번째 한계는 프로덕션 성숙도다. 기업에는 인증, 모니터링, 용량 관리, 서비스 수준 목표, 모델 업데이트, 보안 제어, 장애 시 예측 가능한 동작이 필요하다. 기술 프리뷰는 이 완전한 운영 영역을 포괄하지 않는다.

이러한 단서는 아키텍처를 무효화하지 않는다. 오히려 Kog가 다음으로 제시해야 할 증거를 정의한다. 이 회사는 논쟁을 이론적 주장에 머물게 하지 않고, 검증 가능한 엔지니어링 질문의 집합으로 옮겼다.

독립적인 재현이 가장 강력한 검증을 제공할 것이다. Kog는 기술 설명과 모델 아티팩트를 공개했지만, 외부 팀이 비교 가능한 AMD 및 Nvidia 시스템에서 결과를 재현하려면 충분한 코드와 구성 세부 정보가 필요하다.

경쟁사도 유용한 압력 테스트를 제공한다. Groq와 Cerebras는 조건을 맞춘 환경에서 작업 지연 시간, 처리량, 에너지 사용량, 모델 가용성을 비교할 수 있다. 기존 GPU 엔진은 유사한 퓨전 또는 지속 실행이 Kog의 우위를 좁히는지 시험할 수 있다.

Infinity는 또 다른 소프트웨어 중심 접근 방식을 보여준다. 하나의 깊이 통합된 모델-런타임 스택을 구축하는 대신, 이 스타트업은 서로 다른 칩에서 저수준 코드를 작성하고 조정하는 에이전트를 개발하고 있다. 해당 자동화된 커널 작업은 AI 자체가 인프라 최적화 루프에 진입하고 있음을 보여준다.

이 경로는 한때 희소한 시스템 전문성이 필요했던 기술의 확산을 가속할 수 있다. 또한 Kog의 우위가 더 빠른 커널을 작성하는 방법을 아는 데만 의존할 수 없다는 뜻이기도 하다. 이 회사에는 반복 가능한 플랫폼, 독점적인 실행 노하우, 또는 엔지니어링을 지속적인 고객 가치로 전환하는 유통 경로가 필요하다.

하드웨어 공급업체에 의존하는 데에는 전략적 위험도 있다. AMD와 Nvidia는 자체 컴파일러, 런타임, 레퍼런스 엔진을 개선할 수 있다. 또한 선호하는 소프트웨어 스택에 유리한 새로운 하드웨어 기능을 공개할 수 있다.

Kog는 공급업체 전반에서 작업함으로써 이 위험을 상쇄할 수 있다. AMD MI300X와 Nvidia H200 시스템 모두에서의 결과는 이식성이 계획의 일부임을 시사한다. 그럼에도 각 플랫폼에서 최대 성능을 끌어내려면 흔히 서로 다른 저수준 작업이 필요하다.

회사의 작은 규모는 빠른 이동에 도움이 될 수 있지만, 지원할 수 있는 모델, 구성, 고객 환경의 수는 제한한다. 폭넓은 호환성에는 한 번의 성공적인 최적화 캠페인이 아니라 지속적인 엔지니어링이 필요하다.

따라서 구매자는 이 벤치마크를 최종 구매 판단이 아니라 유망한 신호로 취급해야 한다. 적절한 다음 단계는 구매자의 모델, 프롬프트 분포, 동시성, 작업 수준 성공 기준을 사용하는 워크로드별 평가다.

Kog는 하나의 오해에 도전하고 있지만, 보편적으로 그 반대가 참이라는 점을 증명한 것은 아니다. GPU는 피상적인 소프트웨어 스택이 시사하는 것보다 에이전트 추론에 훨씬 더 적합할 수 있다. 그렇다고 모든 워크로드에서 모든 특수 목적 프로세서를 능가한다는 뜻은 아니다.

Kog의 GPU 베팅을 결정할 세 가지 신호

Kog의 사례는 향후 몇 달 동안 더 큰 모델 결과, 독립적인 프로덕션 테스트, 고객 도입을 통해 강화되거나 약화될 것이다.

첫 번째 신호는 널리 사용되는 타사 mixture-of-experts 모델에서의 성능이다. Kog는 이 지원이 자사 방향성의 일부라고 밝혔으며, 이 테스트는 소형 공동 설계 모델이 제공하는 보호막을 제거할 것이다.

비교는 정밀도, 컨텍스트 길이, 출력 길이, 하드웨어, 동시성을 일치시켜야 한다. 첫 토큰까지의 지연 시간, 출력 속도, 총 작업 시간, 처리량, 메모리 사용량, 에너지 소비량을 보고해야 한다.

강력한 결과는 지속 커널과 지연 병렬성 아이디어가 Laneformer를 넘어 일반화된다는 점을 보여줄 것이다. 성능이 급격히 떨어진다면 Kog의 현재 우위가 모델 아키텍처를 통제하는 데 크게 의존한다는 점을 시사할 것이다.

두 번째 신호는 독립적인 프로덕션 평가다. 클라우드 제공업체, 엔터프라이즈 AI 팀 또는 벤치마킹 그룹은 가변적인 트래픽과 장시간 실행되는 에이전트 워크플로에서 이 엔진을 테스트해야 한다.

이 평가는 실패 사례, 요청 취소, 프롬프트 캐싱, 긴 컨텍스트, 혼합 워크로드를 포함해야 한다. 또한 최대 토큰 생성량에만 집중하기보다 인프라 단위당 완료된 작업 수를 측정해야 한다.

프로덕션 환경의 증거는 GPU가 인터랙티브 에이전트에 여전히 적합하다는 Kog의 주장을 강화할 수 있다. 엔진이 통제된 시연에서만 속도를 제공한다면, 특수 하드웨어와 기존 서빙 시스템이 운영 측면에서 더 강한 근거를 유지하게 된다.

세 번째 신호는 기술 프리뷰를 넘어선 의미 있는 배포다. 실명이 공개된 고객, 지원되는 클라우드 환경 또는 반복 배포 가능한 셀프호스팅 패키지는 Kog가 최적화 작업을 접근 가능한 제품으로 전환할 수 있음을 보여줄 수 있다.

고객 도입은 또한 어떤 시장이 이 시스템을 가장 높이 평가하는지도 드러낼 것이다. 클라우드 GPU 제공업체는 기존 플릿의 경제성을 개선하기 위해 이를 사용할 수 있다. 에이전트 개발자는 응답 시간을 줄이기 위해 도입할 수 있다. 기업은 익숙한 하드웨어를 계속 사용할 수 있다는 점을 가치 있게 볼 수 있다.

대형 로고보다 이러한 배포의 성격이 더 중요하다. 엄격한 지연 시간 요건을 가진 소규모 코딩 또는 음성 애플리케이션은 측정된 사용량이 없는 광범위한 파트너십보다 더 나은 기술적 증거를 제공할 수 있다.

Google News의 관심은 Kog의 논지를 더 넓은 대중에게 소개할 수 있지만, 이 아이디어의 지속성을 결정하는 것은 반복적으로 재현되는 결과다. 이 스타트업은 하나의 명확한 주장을 제시한다. 소프트웨어 스택에 여전히 개선 여지가 있기 때문에 GPU는 에이전틱 추론의 기반으로서 아직 끝나지 않았다는 것이다.

개발자들은 이제 에이전트가 실제로 어디에서 대기하는지 물어야 한다. 디코딩이 지배적이라면 더 깊은 추론 최적화를 직접 테스트할 가치가 있다. 데이터베이스, 도구 또는 취약한 모델 판단이 지배적이라면 토큰 생성 속도를 높여도 전체 문제는 해결되지 않는다.

다음 단계는 측정 가능하다. 동일한 워크로드에서 Kog의 향후 대형 모델 결과를 특수 칩 및 기존 GPU 엔진과 비교하라. 그런 다음 작업 완료율, 신뢰성, 인프라 사용량을 추적하라. 이 증거는 Kog가 폭넓게 유용한 경로를 찾았는지, 아니면 인상적이지만 좁은 성능 정점에 도달했는지를 보여줄 것이다.

 
 

무료로 시작하세요

개인 지식 관리 기능을 갖춘 로컬 우선 AI 어시스턴트

더 나은 AI 경험을 위해

현재 remio는 Windows 10+ (x64)M-Chip Macs만 지원합니다.

​머릿속에 검색창을 추가하세요

remio에게 물어보기만 하면 됩니다

모든 것을 기억하세요

정리는 필요 없습니다

bottom of page