top of page

RP2040 드로잉 모델은 정확한 프로그램을 실행하지만, AI는 호스트에 남는다

1일 전
10분 분량

RP2040 드로잉 모델은 12,670회의 하드웨어 테스트를 위해 컴팩트한 프로그램을 생성했지만, 825,344개 파라미터를 갖춘 트랜스포머는 마이크로컨트롤러에서 실행되지 않았다. 대신 호스트 컴퓨터가 드로잉 바이트코드를 생성해 Raspberry Pi Pico로 전송했고, Pico는 이를 결정론적으로 실행했다.

이 구분은 프로젝트의 가치와 한계를 모두 규정한다. 이는 작은 기기가 유용한 생성형 모델을 로컬에서 실행할 수 있다는 또 하나의 주장이 아니다. 불확실한 신경망 생성과 정확하고 제한된 실행을 분리하는 실험이다.

이 시스템은 일반적인 픽셀 생성 방식을 뒤집는다. 작은 트랜스포머가 실행 가능한 설명을 작성한 뒤, 예측 가능한 동작을 하는 최소한의 장치에 이를 넘길 수 있는지를 묻는다. 하드웨어 결과는 유난히 깔끔해 보이지만, 모델이 낯선 구조를 조합하는 능력은 훨씬 덜 확실하다.

RP2040 드로잉 모델은 생성과 실행을 분리한다

핵심 결과는 온디바이스 신경망 추론이 아니라 역할 분담이다.

프로젝트의 공개 저장소에 따르면, 825,344개 파라미터를 갖춘 자기회귀 트랜스포머는 호스트 컴퓨터에서 실행된다. 이 모델은 각 예제마다 약 100바이트의 드로잉 바이트코드를 생성한다.

바이트코드는 다른 프로그램이 해석하는 컴팩트한 명령 형식이다. 여기서는 가상 펜 이동, 선 그리기, 곡선 계산, 정수 변환 적용, 제한된 시퀀스 반복 등의 작업을 설명한다.

호스트는 해당 프로그램을 Raspberry Pi Pico로 전송한다. 작은 가상 머신, 즉 VM이 Pico의 RP2040 마이크로컨트롤러에서 명령을 실행한다. 이후 표준 직렬 통신 인터페이스인 UART를 통해 기하 좌표를 다시 스트리밍한다.

최종 이미지는 이처럼 반환된 좌표로 만들어진다. Pico는 트랜스포머 가중치를 저장하지 않으며, 행렬 연산이 많은 신경망 추론을 실행하지도 않고, 텐서 런타임도 필요로 하지 않는다. 생성된 프로그램을 해석할 뿐이다.

825,344개 파라미터 모델은 런타임 메모리를 고려하기 전에도 일반적인 숫자 형식으로 수 메가바이트가 필요할 수 있기 때문에, 이 경계는 중요하다.

프로젝트 저자는 이러한 주장을 명시적으로 피한다. 원문 토론에 따르면 트랜스포머는 호스트에 남고, Pico는 그 출력을 저장하고 실행한다.

공개된 데모 모델은 고양이, 버스, 꽃, 범선, 자전거의 다섯 가지 범주를 다룬다. 이를 개방형 텍스트-이미지 시스템으로 제시하지는 않는다.

이처럼 좁은 범위 덕분에 결과를 더 쉽게 해석할 수 있다. 이 실험은 광범위한 시각 지식을 주장하지 않으면서 표현 방식, 프로그램 생성, 제한된 실행을 연구한다.

모델은 색상 픽셀 격자가 아니라 명령을 출력한다. 이는 확률적 AI와 결정론적 임베디드 소프트웨어 사이에 유용한 인터페이스를 만든다.

픽셀 생성기는 보이는 결과에 직접 확정적으로 반영된다. 반면 프로그램 생성기는 다른 시스템이 검증, 제한, 실행 또는 거부할 수 있는 시퀀스를 제안한다.

이 차이가 이 글의 핵심 긴장을 만든다. 하드웨어 실행은 정확하고 경제적으로 보이지만, 정확한 실행이 생성된 프로그램이 의도한 드로잉을 표현한다는 보장은 없다.

Pico는 부실한 자전거 프로그램도 완벽하게 실행할 수 있다. VM이 적절한 제한을 적용한다면 형식이 잘못되었거나 지나치게 긴 시퀀스도 안정적으로 거부할 수 있다.

다시 말해, 실행 정확성과 생성 정확성은 별개의 속성이다. 프로젝트는 둘 다 측정했고, 그 결과는 서로 다른 방향을 가리킨다.

정확한 실행이 가장 강력한 결과다

Pico는 레퍼런스 인터프리터와 일관되게 일치했지만, 측정치는 프로젝트 자체 테스트 산출물에서 나온 것이다.

저자는 하드웨어 스윕 과정에서 생성된 프로그램 12,670개를 실행했다고 보고한다. 반환된 모든 트레이스는 Python 레퍼런스 VM과 정확히 일치했다.

트레이스는 프로그램이 생성하는 순서 있는 기하 구조다. 정확한 일치는 단순히 비슷해 보이는 그림을 만드는 것이 아니라, 장치와 레퍼런스가 동일한 좌표를 반환했다는 뜻이다.

프로젝트의 실험 기록은 12,670개 트레이스 전체에서 허용 오차 없는 동등성을 보고한다. 또한 QEMU 기준선에 대해 적합성 프로그램 120개 중 120개가 통과했다고 명시한다.

이는 독립 재현 결과가 아니라 당사자가 제시한 결과다. 그럼에도 저장소에는 기술 검토에 필요한 인터프리터, 테스트 구조, 캡처된 트레이스, 문서가 포함돼 있다.

보고에 따르면 C 인터프리터는 플래시 메모리 1,862바이트를 차지한다. 이 수치는 바이트코드 저장 공간과 주변 전송 하니스를 제외하고 VM만을 대상으로 한다.

구현에는 VM 상태를 위해 정적으로 할당된 RAM이 없다. 측정 구성에서 최대 스택 사용량은 492바이트였다.

의도적으로 RP2040 클록을 12MHz로 낮춘 상태에서, 드로잉당 평균은 7,334사이클로 보고됐다. 이는 측정된 QuickDraw 프로그램 기준 약 0.611밀리초에 해당한다.

저자는 실행된 명령 하나당 1.959사이클도 보고한다. 이 측정치는 인터프리터 작업에 관한 것이며, 호스트에서 프로그램을 생성하는 데 필요한 시간은 포함하지 않는다.

또한 호스트에서 장치로의 전송 시간과 디스플레이 작업도 제외한다. 독자는 0.611밀리초를 엔드투엔드 생성 지연 시간으로 해석해서는 안 된다.

RP2040은 264kB 온칩 SRAM을 갖춘 듀얼코어 Arm Cortex-M0+ 마이크로컨트롤러다. Raspberry Pi는 RP2040 문서에서 최대 클록 속도를 133MHz로 제시한다.

이 칩에는 하드웨어 부동소수점 장치가 없다. 곡선과 변환은 흔히 분수 좌표를 사용하기 때문에, 이 제약은 그래픽 코드에서 종종 복잡성을 키운다.

이 VM은 고정소수점 표현을 통해 부동소수점 연산을 피한다. 고정소수점은 분수 값을 스케일된 정수로 저장해 구현 전반에서 예측 가능한 결과를 낸다.

곡선 계산기는 2의 거듭제곱 단계 수를 활용한다. 이 제약 아래에서 관련 3차 Bézier 계수는 분모가 알려진 이진 분수로 표현할 수 있다.

구현은 정수 계산 과정에서 이러한 값을 보존할 수 있도록 충분한 분수 비트 수를 선택한다. 이 설계는 측정된 기하 경로에서 플랫폼 간 반올림 차이를 제거한다.

결정론적 산술은 비교도 유난히 엄격하게 만든다. 테스트에는 이미지 유사도 점수나 각 정점 주변의 허용 오차가 필요 없다.

레퍼런스와 장치는 같은 트레이스를 출력하거나 그렇지 않다. 이 이분법적 결과는 시각적 유사성에 대한 주관적 평가보다 감사하기 쉽다.

물리적 테스트는 호스트 시뮬레이션이 놓친 문제 유형을 적어도 하나 드러냈다. 프로젝트 문서는 베어메탈 시작 과정에서 발생하는 주변장치 클록 초기화 경쟁 상태를 설명한다.

이는 실제 실리콘에서 테스트하기로 한 결정을 뒷받침한다. 인터프리터는 수학적으로 정확할 수 있지만, 전송 또는 시작 시퀀스는 실제 보드에서 여전히 신뢰할 수 없을 수 있다.

그럼에도 현재 증거에는 분명한 경계가 있다. 저자는 테스트 벤치에 적절한 전류 측정 장비가 없어 드로잉당 에너지를 측정하지 않았다.

저장소에는 학습된 체크포인트도 포함되지 않는다. 사용자는 VM을 실행하고 기록된 캡처를 재생할 수 있지만, 실시간 모델 생성에는 별도로 확보한 체크포인트가 필요하다.

이러한 한계가 실행 결과를 지우지는 않는다. 다만 외부 검토자가 즉시 재현할 수 있는 것과 여전히 저자의 자료에 의존하는 것을 규정한다.

프로그램은 픽셀이 제공할 수 없는 제어를 제공한다

실행 가능한 출력은 모델의 행동을 제한된 런타임이 검사하고 통제할 수 있는 대상으로 바꾼다.

드로잉 프로그램은 연산, 제어 흐름, 기하 구조를 드러낸다. 래스터 이미지는 픽셀의 최종 배치만 드러낸다.

이 차이는 소형 장치에서 중요하다. 런타임은 종료 전에 허용되는 최대 명령 수인 연료 한도를 적용할 수 있다.

루프 중첩, 호출 깊이, 변환 깊이, 좌표 범위, 출력량도 제한할 수 있다. 이러한 제약은 모델이 결함 있는 시퀀스를 생성하더라도 생성된 동작을 유한하게 만든다.

프로젝트의 VM은 완성된 드로잉을 저장하는 대신 정점을 스트리밍한다. 이는 작업 메모리 부담을 줄이고 실시간 제어를 위해 설계된 장치의 특성에 부합한다.

이 접근법은 계획과 실행을 분리하는 다른 시스템과 닮았다. 더 큰 장치가 비용이 큰 추론을 수행하고, 더 작은 컨트롤러가 컴팩트한 중간 표현을 따른다.

이 패턴은 이미 로보틱스, 컴퓨터 수치 제어, 플로터, 임베디드 인터페이스에 나타난다. 여기서 이례적인 요소는 100만 개 미만의 파라미터를 가진 트랜스포머가 중간 프로그램을 생성한다는 점이다.

드로잉 바이트코드는 이 실험에 특히 적합하다. 선, 곡선, 반복 모티프는 눈에 보이는 결과를 만들면서도, 그 실행은 범용 프로그래밍 언어보다 단순하게 유지된다.

형식이 잘못된 이미지 예측은 보기 좋지 않은 이미지를 만든다. 형식이 잘못된 프로그램은 종료, 유효성, 런타임 안전성에 관한 추가 질문을 제기한다.

VM은 의도적으로 제한된 명령어 집합으로 이 질문들 일부에 답한다. 임의 메모리 접근이나 범용 운영체제 서비스를 제공하지 않는다.

따라서 이 시스템은 일반적인 생성 코드보다 도메인 특화 언어에 더 가깝다. 도메인 특화 언어는 위험하거나 모호한 연산을 줄인 채 좁은 작업을 지원한다.

그 결과는 제한된 계약이다. 모델은 드로잉을 제안하고, 인터프리터는 고정된 규칙 아래에서 그 바이트가 무엇을 의미하는지 결정한다.

이 계약은 스케치를 넘어선 기회를 만든다. 유사한 구성은 도구 경로, 펜 플로터 명령, LED 패턴, 단순 애니메이션 또는 제한된 인터페이스 레이아웃을 표현할 수 있다.

하지만 이러한 응용에는 각자의 검증이 필요하다. Pico에서 정확한 기하 구조가 나온다고 해서 물리 장비의 안전한 모터 움직임이나 신뢰성 있는 제어가 입증되는 것은 아니다.

대상 도메인에 따라 중요한 오류도 달라진다. 약간 잘못된 꽃은 무해하지만, 잘못된 액추에이터 경로는 장비를 손상시킬 수 있다.

따라서 프로젝트에서 가장 강력하게 전이 가능한 아이디어는 아키텍처에 있다. 확률적 생성은 신뢰할 수 있는 실행 경계 밖에 둘 수 있다.

임베디드 구성 요소는 작고, 테스트 가능하며, 결정론적으로 유지될 수 있다. 프로그램을 제안한 모델의 복잡성을 그대로 물려받을 필요가 없다.

이 분리는 개발자가 실패를 디버깅하는 방식도 바꾼다. 생성된 바이트를 검사하고, Python에서 재생하고, 트레이스를 비교하며, 장치별 동작을 분리할 수 있다.

픽셀 파이프라인은 종종 신경망 활성화 내부에 구조를 숨긴다. 프로그램 파이프라인은 명시적인 운용 의미를 지닌 산출물을 남긴다.

이 산출물은 로그로 남기고 버전 관리할 수 있다. 장치가 이를 받기 전에 알려진 규칙에 따라 검사할 수도 있다.

엔지니어링 팀의 관점에서 이는 이미지 생성기보다 컴파일러 파이프라인에 가깝다. 모델은 불확실한 프런트엔드 역할을 하고, VM은 엄격한 실행 백엔드 역할을 한다.

이 비유를 지나치게 확장해서는 안 된다. 전통적인 컴파일러는 잘 정의된 소스 텍스트를 번역하지만, 이 트랜스포머는 학습된 분포에서 프로그램을 샘플링한다.

그럼에도 이 경계는 가치가 있다. 생성된 출력이 할 수 있는 일을 전통적인 소프트웨어 구성 요소가 통제할 수 있게 해준다.

소형 모델의 프로그램 생성은 여전히 조합에서 실패한다

인터프리터는 정확히 실행하지만, 트랜스포머는 낯선 관계를 정확하게 안정적으로 생성하지 못합니다.

프로젝트 실험은 낮은 예측 손실이 신뢰할 수 있는 샘플 프로그램으로 자동 연결되지는 않는다는 점을 보여줍니다. 이 격차가 이 작업을 완성된 시스템이 아니라 연구로 봐야 하는 핵심 이유입니다.

기본 평면 자기회귀 모델은 드로잉당 489.2비트의 수렴된 테스트 손실을 보고합니다. 테스트 손실은 예측 불확실성을 측정할 뿐, 샘플링된 드로잉이 원하는 기하학적 관계를 만족하는지는 측정하지 않습니다.

저자는 동일한 대략적 파라미터 예산 아래에서 여러 표현 방식을 테스트했습니다. 여기에는 바이트, 개별 비트, 타입 지정 토큰, 상대 좌표 델타가 포함됐습니다.

합성 프로그램 코퍼스에서는 비트 표현이 바이트와 거의 비슷한 성능을 보였습니다. 보고된 차이는 드로잉당 마이너스 0.67비트였으며, 불확실성은 플러스마이너스 0.77비트였습니다.

Google의 Quick, Draw data에서 가져온 사람이 그린 스케치에서는 결과가 달라졌습니다. 여기서 비트 수준 모델링은 드로잉당 11.58비트의 페널티를 보였고, 불확실성은 플러스마이너스 0.60비트였습니다.

비트는 평가 시퀀스 길이도 8배로 늘렸습니다. 이 실험은 2억 5,400만 개의 비트 토큰을 처리한 반면, 바이트 토큰은 3,200만 개였습니다.

보고된 평가 시간은 바이트의 4분에서 비트의 48분으로 늘었습니다. 문서화된 설정에서는 8배를 넘는 속도 저하입니다.

이 대조는 더 작은 어휘가 항상 작은 모델에 도움이 된다는 단순한 주장을 약화시킵니다. 두 기호로 된 알파벳은 임베딩 비용을 줄이지만, 네트워크가 바이트 경계와 필드 구조를 다시 찾아내도록 강제합니다.

합성 패턴에서는 그 복원이 감당할 만했던 것으로 보입니다. 더 다양한 사람 스케치는 같은 결과를 내지 못했습니다.

타입 지정 토큰은 또 다른 트레이드오프를 가져왔습니다. 연산 코드와 피연산자 역할을 더 명시적으로 묶지만, 더 큰 어휘는 작은 파라미터 예산의 상당 부분을 차지합니다.

한 와이드 모델에서는 임베딩 테이블이 전체 파라미터의 22퍼센트를 차지했습니다. 이 구성은 비교 대상보다 드로잉당 4.87비트 더 나쁜 성능을 보였습니다.

깊고 좁은 모델은 어휘 비용을 더 효과적으로 흡수했습니다. 이는 백만 개 미만 규모에서 표현 방식과 아키텍처가 강하게 상호작용한다는 점을 시사합니다.

가장 드러나는 실패는 반복 기하학과 관련돼 있었습니다. 모델은 학습 중 등장한 범위 안에서는 예측 가능한 반복을 학습했습니다.

이미 알려진 모티프의 두 번째 복사본을 만났을 때 모델의 놀라움은 74퍼센트 감소했습니다. 한 보고된 구성에서는 복구 지표가 0.807에 도달했습니다.

그러나 학습 최대 반복 횟수보다 정확히 한 번 많은 다섯 번째 복사본에서 성능은 무너졌습니다. 모델은 추상적인 루프 규칙이 아니라 반복 횟수 분포를 학습한 것으로 보입니다.

프로젝트는 교사 강제 조건에서의 기하학적 호환성도 테스트했습니다. 교사 강제는 실제 선행 시퀀스를 제공한 뒤 다음의 올바른 요소를 평가합니다.

그 설정에서 호환되는 연속 항목은 목표 바이트당 4.28비트라는 큰 이점을 받았습니다. 보고된 보정 유의수준은 0.001이었습니다.

자유 샘플링은 매우 다른 결과를 냈습니다. 테스트된 조합 도형에서 정확한 완성은 약 1퍼센트의 경우에만 성공했습니다.

더 단순한 평면 단계 사례의 성공률은 7퍼센트에서 13퍼센트였습니다. 모델은 문맥이 주어지면 호환되는 연속 항목을 인식할 수 있었지만, 전체 연속 항목을 스스로 구성하는 경우는 드물었습니다.

이 단절은 현대 생성 모델링의 핵심 문제입니다. 토큰 수준의 선호는 설득력 있어 보일 수 있지만, 자율 샘플링 중 작은 국소 오류가 누적됩니다.

샘플링된 모든 출력은 다음 예측의 문맥 일부가 됩니다. 잘못된 좌표, 연산 코드 또는 길이 결정 하나가 시퀀스를 학습 중 접한 조건에서 멀어지게 할 수 있습니다.

RP2040은 그 의미론적 실패를 수정할 수 없습니다. 생성된 프로그램을 정확하게 실행할 수는 있지만, 정확한 실행은 그 오류도 그대로 보존합니다.

계층적 계획은 우도보다 길이 문제를 더 잘 해결한다

명시적 구조를 추가하면 종료는 개선됐지만, 프로젝트의 핵심 손실 지표에서는 드로잉의 확률이 낮아졌습니다.

저자는 동일한 825,344개 파라미터 예산에서 평면 트랜스포머와 계층적 설계를 비교했습니다. 이 시스템들은 먼저 스트로크 요약을 예측한 뒤, 각 스트로크의 세부 바이트코드를 생성했습니다.

한 플래너는 자기회귀 방식을 사용했습니다. 다른 하나는 반복적인 디노이징 단계를 통해 노이즈를 구조화된 예측으로 점진적으로 변환하는 확산 방식을 사용했습니다.

두 계층적 변형은 평면 모델보다 드로잉당 대략 40~55비트 낮은 성능을 보였습니다. 정확한 페널티는 플래너 유형과 연산 예산에 따라 달랐습니다.

따라서 이 실험은 계층적 계획이 동일 규모에서 우도를 개선할 것이라는 가설을 기각했습니다. 더 명시적인 구조에는 측정 가능한 모델링 비용이 따랐습니다.

그럼에도 플래너는 출력 길이를 더 정확하게 제어했습니다. 길이 분포 오류는 구성에 따라 1.8~3.5바이트였습니다.

평면 모델의 해당 격차는 7.0~13.6바이트였습니다. 이 모델은 너무 일찍 종료하거나 허용된 최대 길이까지 계속 생성할 가능성이 더 높았습니다.

이는 사소한 구현 세부 사항이 아닙니다. 생성된 프로그램은 유용한 명령이 되기 전에 합리적인 경계에서 종료되어야 합니다.

평균 우도가 더 좋은 모델도 조기 종료에 너무 많은 확률을 할당하면 불편한 샘플을 생성할 수 있습니다. 길고 반복적인 꼬리 부분을 생성할 수도 있습니다.

계층 구조는 스트로크 수를 로컬 스트로크 구성과 분리했습니다. 이 명시적 결정은 전체 우도가 떨어졌음에도 생성 길이의 분포를 개선했습니다.

확산은 공유된 요약 표현에서 자기회귀 플래너보다 뚜렷한 이점을 제공하지 못했습니다. 종료 개선은 디노이징이 아니라 계층 구조에서 비롯됐습니다.

이후 명령어 세트 실험에서도 비슷한 패턴이 나타났습니다. 명시적인 반복 및 변환 연산은 제한적인 직접 압축만 제공했습니다. 모델이 이미 반복 기하학을 낮은 놀라움으로 예측하고 있었기 때문입니다.

하지만 더 짧은 시퀀스는 문맥 활용과 종료를 개선했습니다. 보고된 생성 길이 오류는 9~11퍼센트 범위로 떨어졌습니다.

비슷한 평면 모델은 41~112퍼센트의 오류를 보였습니다. 이는 자체 실험 측정치이지만, 의미 있는 설계상의 긴장을 보여줍니다.

표현 방식은 전통적인 테스트 손실에서 이기지 못하더라도 생성을 개선할 수 있습니다. 반대로 낮은 손실이 샘플링 중 잘 형성된 프로그램을 보장하지는 않습니다.

이 긴장은 향후 평가에 반영돼야 합니다. 연구자들은 유효성, 정확한 관계 완성, 종료, 신규성, 실행 동작을 위한 지표가 필요합니다.

시각적 품질도 여전히 중요하지만, 그것만으로는 충분하지 않습니다. 두 드로잉은 비슷해 보일 수 있지만 프로그램의 길이, 구조, 재사용 방식은 크게 다를 수 있습니다.

암기는 또 다른 미해결 문제입니다. 작은 모델은 이를 생성하는 변환을 학습하지 않은 채 친숙한 모티프를 재현할 수 있습니다.

리포지터리는 위치, 근접성, 빈도, 좌표 집합에 대한 통제 방법을 문서화합니다. 이 검사는 관계 실험을 강화하지만, 전체 학습 코퍼스에 걸친 신규성을 해결하지는 못합니다.

더 강력한 릴리스에는 체크포인트, 학습 매니페스트, 생성 샘플, 최근접 이웃 분석, 재현 가능한 엔드투엔드 스크립트가 포함될 것입니다.

여러 독립 학습 시드도 어떤 동작이 초기화 변화 이후에도 유지되는지를 분명히 해줄 것입니다. 일부 분포 밖 반복 결과는 이미 시드 간에 눈에 띄게 달랐습니다.

현재 프로젝트는 부정적 결과를 숨기지 않고 보고합니다. 이는 소형 모델이 기호적 추론자처럼 행동하지 않기 시작하는 지점을 실패 사례가 보여주기 때문에 유용합니다.

다음으로 검증해야 할 사항

다음 이정표는 더 큰 갤러리가 아니라, 명시적 관계가 보지 못한 프로그램 생성까지 개선한다는 증거입니다.

프로젝트의 현재 방향은 copy-or-emit 동작을 추가하는 것입니다. 모델은 일반 바이트를 생성하거나, 아핀 변환과 함께 이전 소스 구간을 참조할 수 있습니다.

아핀 변환은 직선을 보존하면서 기하학을 이동, 회전, 반사 또는 크기 조절할 수 있습니다. 이 시스템에서는 지원되는 연산이 정수 기반으로 유지되며, 기존 스타일의 VM에서 실행 가능할 것입니다.

이 제안은 교사 강제 격차를 직접 겨냥합니다. 모델은 이미 호환 가능한 관계 문맥에 민감한 것으로 보이지만, 자유 샘플링은 그 관계를 정확하게 완성하는 경우가 드뭅니다.

명시적 동작은 변환된 모티프를 재현하는 데 필요한 개별 결정 수를 줄일 수 있습니다. 하나의 올바른 관계가 취약한 여러 좌표 예측을 대체할 수 있습니다.

가장 먼저 지켜볼 신호는 보지 못한 조합에서의 성능입니다. 모델은 익숙한 반복 도형을 단순히 압축하는 것이 아니라, 학습에서 제외된 정확한 관계를 생성해야 합니다.

평가는 동일한 파라미터 및 학습 예산에서 평면 생성과 copy-or-emit 동작을 비교해야 합니다. 정확한 자유 생성 성공은 교사 강제 선호만큼이나, 아니 그보다 더 중요합니다.

보지 못한 관계의 완성이 보고된 1퍼센트 수준을 실질적으로 웃돈다면 이 메커니즘의 신뢰성은 높아집니다. 우도만 개선된다면 핵심 생성 문제는 남아 있습니다.

두 번째 신호는 하드웨어 스윕의 독립적 재현입니다. 프로젝트는 소스 코드와 캡처된 아티팩트를 제공하지만, 현재 모델 체크포인트를 함께 제공하지는 않습니다.

외부 개발자는 인터프리터를 다시 빌드하고, 적합성 테스트 모음을 실행하고, 생성된 프로그램을 Pico로 전송하며, 비트 단위까지 동일한 트레이스를 재현할 수 있어야 합니다.

그 과정은 컴파일러 설정, 클록 구성, 전송 오버헤드, 완전한 메모리 회계를 보고해야 합니다. 인터프리터 플래시 사용량과 총 펌웨어 크기도 구분해야 합니다.

성공적인 재현은 실행 주장을 강화할 것입니다. 불일치는 결과가 툴체인, 보드 리비전 또는 문서화되지 않은 설정 세부 사항에 의존하는지를 파악하는 데 도움이 될 것입니다.

세 번째 신호는 엔드투엔드 리소스 측정입니다. 현재의 0.611밀리초 수치는 호스트 추론이나 직렬 전송이 아니라 12 MHz에서의 VM 실행을 다룹니다.

실용적 시연은 생성 시간, 검증 시간, 전송 시간, 실행 시간, 렌더링 시간을 구분해야 합니다. 에너지 측정은 임베디드 단계의 비용도 분명히 해줄 것입니다.

이 측정이 프로젝트를 온디바이스 AI로 바꾸지는 않습니다. 다만 분할 아키텍처가 유용한 시스템 트레이드오프를 제공하는지 보여줄 것입니다.

이러한 테스트 이전에도 더 큰 교훈은 이미 신뢰할 만해 보입니다. 소형 생성 모델은 실행 가능한 중간 표현을 만들 수 있고, 초소형 결정론적 런타임은 좁은 운영 규칙을 강제할 수 있습니다.

여전히 불분명한 점은 모델이 익숙한 조합 밖에서도 올바른 구조를 생성할 수 있는지입니다. 하드웨어의 정확성은 그 문제의 마지막 단계만 해결합니다.

따라서 RP2040 드로잉 모델을 평가하는 개발자는 두 가지 별도 질문을 해야 합니다. Pico는 모든 유효한 명령을 정확하게 실행하는가, 그리고 트랜스포머는 의도한 프로그램을 안정적으로 작성하는가?

이용 가능한 증거는 첫 번째 질문에 강력한 자체 답변을 제공합니다. 두 번째 질문에는 훨씬 더 신중한 답변을 제시합니다.

copy-or-emit 실험, 재현 가능한 체크포인트의 릴리스, 독립적인 Pico 실행을 지켜보십시오. 이 세 가지 테스트가 이것이 재사용 가능한 설계 패턴이 될지, 아니면 교훈적인 연구 프로토타입으로 남을지를 결정할 것입니다.

 
 

무료로 시작하세요

개인 지식 관리 기능을 갖춘 로컬 우선 AI 어시스턴트

더 나은 AI 경험을 위해

현재 remio는 Windows 10+ (x64)M-Chip Macs만 지원합니다.

업무를 위한 AI 파트너
remio와 더 많은 일을 해내세요

계획하고, 만들고, 완성하세요
모든 일을 한곳에서

bottom of page