top of page

TinyGPU v2.0 已在硅片上运行,但其“最小 GPU”主张面临更大考验

Tom Hardware 报道称,TinyGPU v2.0 现已在实体硅片上运行,将约 24 万个晶体管组合成一颗可工作的 3D 图形处理器。设计者 Pongsagon Vichit 展示了该芯片在 Tiny Tapeout 制造批次完成后输出图形的画面。这使该项目从 FPGA 实验转变为已制造出来的专用集成电路,即 ASIC。

这一成果之所以重要,是因为制造过程会暴露软件仿真和 FPGA 测试可能掩盖的问题。时钟行为、信号时序、内存访问以及板级集成,都必须经受实体硬件的考验。Vichit 的视频表明核心管线能够运行,但现有演示尚不足以回答所有性能或可靠性问题。

这并不是 Nvidia、AMD 或 Intel 的微型挑战者。TinyGPU v2.0 以低分辨率和有限色深渲染刻意简化的场景。它真正要跨越的,是有趣的 FPGA 原型与可重复运行的实体硅片之间的鸿沟。越过这道鸿沟,为项目带来的技术价值远超其帧率本身。

下一个问题围绕 TinyGPU v3.0 展开。Vichit 正在开发一套可编程程度更高的设计,具备像素着色器特性,并修复已知的 v2.0 限制。这一路线图提高了难度,因为每一项新增能力都会消耗逻辑资源、内存带宽和验证工作量。

Tom Hardware 称 TinyGPU 通过了硅片测试

关键变化并不在于 TinyGPU 能显示简单的 3D 图形,而在于这颗已制造的芯片据称实现了其数字设计所承诺的功能。

Vichit 此前曾在 Basys3 FPGA 板上测试 TinyGPU v2.0。FPGA 是一种可配置芯片,让设计者能在将硬件逻辑固化为固定版图之前进行测试。这一阶段表明,该架构可以渲染模型、接收控制器输入并驱动 VGA 显示器。

制造 ASIC 则会失去这种灵活性。逻辑会成为晶体管和连线的实体排列。设计缺陷无法通过向同一芯片加载新配置来修正。重大错误通常需要再进行一次制造批次。

根据 8 月 4 日的硅片测试报道,返还的 TinyGPU v2.0 硅片在测试中生成了真实图形。报道将这一结果描述为 Tiny Tapeout 生产批次完成后一次成功的真实环境演示。

这些证据支持的结论比完整的产品认证更为有限。一段视频可以表明主要功能在某一测试配置下正常运行,但不能证明制造良率、电压容限、长时间稳定性,或多颗样品之间的性能表现。

这些区别在半导体报道中很重要。工程师常将首批返还版本称为 A0 硅片。A0 能产生有用输出具有重要意义,因为许多硬件错误在流片后都会变得代价高昂。流片是指完成的芯片版图进入制造的节点。

据称,演示中的管线可处理变换、光照、光栅化和显示输出。变换会将模型坐标转换为屏幕上的位置。光栅化决定每个三角形覆盖哪些像素。光照则根据选定的光线方向调整表面的可见颜色。

设计者的项目文档介绍了一套运行在 25 MHz 下的架构,制造形态约使用 24 万个晶体管。它支持最多包含 1,000 个三角形的模型,但实际速度取决于场景复杂度和启用的功能。

文档中的显示目标为 320 × 240 像素、4 位色。4 位色在相应的调色板方案中可提供 16 种可能的颜色值。与现代图形相比,这种能力极为有限,但足以展示可辨识的平滑着色或贴图对象。

该项目还依赖外部 QSPI 内存。QSPI 是一种通过多条信号线传输数据的串行接口。TinyGPU 使用这类外部硬件存放模型数据、帧缓存和深度信息,因为这些内容会占用过多的片上面积。

Vichit 的配置包括 VGA 输出模块、QSPI 硬件、游戏手柄接口和 SNES 控制器。用户可旋转模型、更改其缩放比例,或调整方向光。这些控制让演示成为交互式体验,而非固化在电路中的固定动画。

Tom Hardware 此前曾在设计制造前报道过该项目,当时披露的晶体管估算值接近 20 万个。目前的 24 万个数字反映了 Vichit 所述的已制造实现。随着综合和物理布局将源逻辑转换为实际标准单元,估算值可能发生变化。

因此,这一结果消除了一个不确定性,同时留下若干未解问题。TinyGPU v2.0 不再只是仿真或 FPGA 层面的主张。据称它已是可工作的硅片,但仍是一颗实验芯片,而非通过认证的商用 GPU。

一颗 24 万晶体管 GPU,本质上是对约束条件的研究

当 TinyGPU 的限制被视为设计要求,而非与桌面显卡相比时令人尴尬的差距,它才真正变得有趣。

现代独立 GPU 包含数十亿个晶体管、大量缓存、专用计算模块、视频引擎和大型内存接口。TinyGPU v2.0 不具备这种规模。比较两者的标称性能,对理解 Vichit 所选择解决的工程问题帮助不大。

他要解决的问题是压缩。该架构必须在极小的逻辑预算内,保留足够多传统图形管线的能力,以完成 3D 几何的变换与绘制。每一个寄存器、乘法器、缓冲区和控制状态,都在争夺同一块有限的硅片面积。

定点运算有助于控制这一预算。定点数为整数和小数部分预留预定的位数。它们所需的电路少于通用浮点运算,但设计者必须谨慎管理数值范围和精度。

该管线还采用平面着色和一盏动态方向光。平面着色会为一个三角形赋予一致的光照值,而不是对每个顶点或像素计算平滑变化。这种选择减少了计算量,同时保留可见的 3D 形态。

背面剔除会移除背向摄像机的三角形。这些表面通常不可见,因此跳过它们可以节省光栅化工作。这是一项标准图形技术,在晶体管和时钟预算有限时尤其重要。

8 位深度缓冲区记录每个位置上应显示在前方的表面。没有深度测试,后绘制的三角形可能会错误遮挡更近的几何体。有限的精度适合这类紧凑场景,但对于许多更大的环境而言并不足够。

4 位双缓冲保留独立的绘制表面和显示表面。一个缓冲区可在准备下一帧时显示。交换两者可减少可见撕裂,即更新期间同时出现两帧局部内容的现象。

这些特性使 TinyGPU v2.0 不仅仅是一个硬连线的图案生成器。该芯片接收模型数据,并通过可辨识的阶段处理几何体。不过,它仍然是固定功能设计,在场景规模、输出质量和支持的效果方面有着严格边界。

据报道,在合适场景下,帧率范围约为 7.5 至 15 帧每秒。代码库还记录了一个带纹理、包含 1,000 个三角形的示例,帧率为 6.5 FPS。这些数字描述的是不同工作负载,因此不应被视为相互冲突的通用基准。

帧率取决于三角形数量、可见面积、纹理处理、内存延迟和其他场景细节。一个小物体的像素处理需求可能低于覆盖大部分显示区域的几何体。任何严肃比较都需要相同的模型、设置、时钟和输出条件。

这种基准测试背景仍不完整。硅片视频确认了可见运行效果,但没有提供覆盖广泛的性能测试套件。它也无法证明录制测试中是否验证了每一项文档所列功能。

这正是“最小 GPU”标签需要谨慎对待的原因。“GPU”并没有单一的晶体管门槛,不同的独立业余项目实现了图形功能的不同子集。有些仅绘制基础图元,另一些则包括变换、纹理、光照或可编程阶段。

因此,这一称号是有用的简写,而非标准化奖项。TinyGPU 更站得住脚的特点,在于它将已制造的硅片与紧凑、自包含的 3D 管线结合在一起。读者应评估已记录的功能,而非仅依赖这一最高级表述。

这种组合也带来教育价值。源代码以 Verilog 公开,这是一种用于定义数字电路的硬件描述语言。开发者可以了解图形概念如何转化为状态机、算术单元和内存事务。

对学生而言,熟悉的视觉输出是进入芯片设计的一扇门。旋转模型比抽象波形更容易理解。然而,每一帧可见画面仍依赖于大型芯片同样使用的时序、验证和物理设计规范。

Tiny Tapeout 将原型鸿沟变成主要竞赛

TinyGPU 的核心胜利,在于跨越了通常令小型硬件项目难以进入已制造硅片领域的成本与协调门槛。

芯片制造通常更适合能够填满大面积芯片并管理专业工程流程的组织。独立设计者很少需要一整片晶圆。即便极小的实验电路,也伴随着准备、封装、验证和制造要求。

共享晶圆项目通过将许多小型设计放在同一颗制造芯片上,改变了这种局面。每位贡献者获得一块规定的 tile 面积。共享基础设施负责通用接口、选择逻辑,以及通过演示板提供访问能力。

这种模式类似于共享交通工具。每个设计只占用可用载具的一部分,因此没有参与者需要为整趟行程买单。这个类比并不完全准确,但它解释了为何多项目晶圆已成为教育和实验的重要资源。

TinyGPU v2.0 使用 4 × 4 的分配,等于 16 个 Tiny Tapeout tile。就该平台紧凑的设计模式而言,这已是一个大型项目。这样的分配仍迫使 Vichit 做出选择,而桌面 GPU 团队可以用多得多的硅片资源来解决同类问题。

该项目还施加了接口限制。外部内存、视频输出和控制器输入都必须通过可用引脚和受支持的扩展板传递。这些约束对架构的影响,与晶体管数量同样直接。

这一过程早在制造前就已开始。Vichit 必须用可综合的 Verilog 描述电路,也就是工具能够转换成实际逻辑的代码。自动化检查随后会验证接口、时序假设和物理布局要求。

综合将设计映射为标准单元库。布局为这些单元分配物理位置。布线则在遵守制造规则的同时,用金属连线将它们连接起来。完成的版图随后会与其他项目一同进入共享流片。

仿真在整个流程中仍然至关重要。测试平台会在制造前提供输入,并检查预期输出。FPGA 原型验证则增加了另一层验证:它通过带有真实外设的可重构硬件运行类似逻辑。

但这两个步骤都无法完美预测硅芯片的表现。FPGA 的布线、存储块和时序与 ASIC 工艺不同。实体芯片还会引入时钟、复位、电源和信号完整性方面的行为,而简化测试可能遗漏这些问题。

这正是为何流片后的实际输出比又一段 FPGA 演示视频更有分量。该结果表明,工具流程、共享平台、开发板连接、外部内存和图形逻辑能够协同工作。任何关键环节的故障,都可能导致无法显示可见画面。

Tiny Tapeout 的历史成果提供了有用背景。早期流片已将处理器、信号发生器、显示设备、加速器和实验性模拟电路置入共享硅片。该平台并非专门面向图形,因此 TinyGPU 也成为其通用设计模式的一项压力测试。

图形流水线结合了算术运算、时序控制、内存访问和严格的显示时序。失去同步可能破坏整幅图像。能够成功协调这些部分,使该项目成为比简单计数器或闪烁灯更丰富的展示。

不过,共享流片并不会消除工程风险。它重新分配了基础设施,并降低了参与门槛。设计者仍需对功能正确性、时序、资源使用以及周边硬件的行为负责。

该平台也无法让受限电路表现得像规模更大的电路。TinyGPU 的分辨率、色彩深度、时钟频率和场景预算,仍直接源自其设计选择。可访问性并不会抹除面积与能力之间的关系。

因此,受到挑战的是关于“谁能够制造有趣处理器”的传统假设。TinyGPU 并不会挑战 Nvidia 的产品路线图。它挑战的是这样一种观念:定制图形硅芯片只属于大公司或大学实验室。

这种转变的影响不止于 GPU。小型开放芯片让开发者能够在最终的实体介质中测试非传统加速器、接口和教学处理器。有些想法会失败,但这些失败能够成为可见且可复现的工程证据。

TinyGPU v2.0 演示未能证明什么

实际输出证明了基本功能,但并不能证明完整基准性能、量产就绪状态,或无可争议的世界纪录。

首个不确定性在于测试范围。公开视频可以展示一个模型出现在显示器上并响应输入,却无法揭示每条算术路径、每种内存条件、每个三角形朝向或每个控制状态是否都能正确运行。

全面验证需要多个测试场景和可重复的测量结果。审查者还需要了解硅芯片样品、时钟稳定性、电压、温度、复位和长时间运行等信息。这些结果尚未随初始报告一同提供。

第二个不确定性涉及性能。所称的 7.5 至 15 FPS 范围看似与早期 FPGA 预期一致,但工作负载会显著影响结果。基准测试需要固定的模型、摄像机、纹理、视口和测量方法。

该芯片对外部 QSPI 内存的依赖进一步增加了解读难度。内存延迟可能使不同流水线阶段停顿或受限。该代码仓库甚至记录了针对所连接内存模块的可调延迟设置。

这并不会削弱项目本身。外部内存是合理的架构选择,尤其是在片上存储会占据主导面积时。它仅意味着,“独立 GPU”不应被理解为无需任何配套硬件的单一组件。

GPU 仍需要内存、时钟、电源、视频连接和输入硬件。商业处理器同样依赖周边系统。这里的“独立”意味着图形流水线运行在已制造的逻辑中,而非 FPGA 或微控制器内部。

第三个不确定性是 Vichit 所记录的视口故障。在 v2.0 中,延伸到可见视口之外的几何体可能令 GPU 冻结,并迫使系统复位。视口定义了场景应显示的矩形屏幕区域。

对于通用 3D 渲染而言,这是一个重大限制。摄像机经常会让物体部分移出屏幕。图形处理器应当裁剪或拒绝相关几何体,而不会锁死其流水线。

Vichit 表示 TinyGPU v3.0 解决了这一问题。在该版本发布并经过测试之前,修复仍属于路线图的一部分。这一限制也说明,为硬件增加可编程性或灵活性会提高验证要求。

第四个疑问涉及“世界最小”的描述。Vichit 早期的 首个 GPU 设计使用约 16,000 个逻辑门,且只能渲染两个带纹理的三角形。其他微型图形电路做出了不同取舍,因此很难直接排名。

早期芯片的目标是以 60 FPS 输出 640 × 480 画面,听起来比 v2.0 更快。然而,它处理的场景要小得多,也不具备 v2.0 处理最多包含 1,000 个三角形模型文件的能力。

这种表面上的倒退说明,为何单维度比较并不成立。更高的分辨率或帧率并不自动意味着架构能力更强。TinyGPU v2.0 可接受丰富得多的几何体,但以更低的显示帧率运行。

现代 GPU 则代表了另一端的极限。其数十亿个晶体管支持大规模并行算术、复杂调度、可编程着色器、缓存层级和高带宽内存。TinyGPU 有意移除了其中大部分系统。

与当前游戏显卡相比,Nvidia 的 GeForce 256 是更相关的历史参照。它于 1999 年推出,帮助将硬件变换与光照确立为 GPU 的核心功能。TinyGPU 在实验性规模上复现了相关概念。

然而,共用术语并不意味着能力范围可比。GeForce 级硬件面向商业游戏、软件兼容性和持续的客户工作负载。TinyGPU 是一个开放学习项目,用以说明部分机制。

Tom Hardware 恰当地将该设备定位为爱好者成就,而非购买替代方案。最有价值的解读应遵循这一界限。它的意义在于可见的硅芯片和架构上的节约,而非消费级性能。

如果项目能提供可复现的测试文件、记录的时钟条件,以及多枚芯片的测试结果,其证据将更加有力。独立开发者届时可将硬件行为与仿真和 FPGA 输出进行比较。

开源使这一过程成为可能,但仅仅发布并不能完成它。源代码允许审查;可重复的硬件测试则让审查转化为更有力的验证。

TinyGPU v3.0 将检验可编程性是否适合同一微小尺寸限制

下一版本必须在不失去使 v2.0 实现可用硅芯片的严谨简洁性的前提下增加灵活性。

Vichit 的公开路线图将 TinyGPU v3.0 描述为从固定流水线转向可编程像素处理。像素着色器是一段为像素计算输出颜色的小程序。它能够实现固定光照和纹理规则无法表达的效果。

据称由 Vichit 发布的公开帖子描述了一种受早期 DirectX 8 像素着色器启发的设计。拟议中的核心通过单指令多数据执行并行处理四个像素。SIMD 指一条指令同时作用于多个数据元素。

据报道,该设计采用紧凑的指令集和有限数量的临时寄存器。掩码执行提供了一种受限方式,用于处理条件行为。这些选择旨在保留可编程性,同时避免引入现代着色器架构的复杂性。

这正是值得关注的机制。可编程性可以用可复用的算术和控制逻辑替代多个固定电路。但它也可能需要指令存储、解码、寄存器、调度以及更广泛的冒险测试。

v3.0 还必须解决视口问题。Vichit 曾讨论近裁剪面和远裁剪面剔除,以及保护带裁剪。保护带裁剪允许坐标超出可见区域,之后再由后续阶段将像素限制在屏幕内。

如果该机制有效,部分可见的物体将不再导致处理器冻结。这一改进将使摄像机移动和一般场景更具实用性。它还会解决一个已有明确记录的 v2.0 弱点,而非为了功能本身而增加功能。

目前最重要的是三个信号。

首先,Vichit 需要发布稳定的 v3.0 架构和可综合实现。功能描述可能会在逻辑优化过程中发生变化。公开代码仓库将揭示实际的指令格式、流水线和资源使用情况。

其次,该设计需要使用同时对裁剪和着色器执行施压的场景,提供可复现的 FPGA 结果。在简单效果下维持帧率并不足够。测试应让几何体跨越屏幕边界,同时运行深度处理和外部内存访问。

第三,v3.0 最终还需要另一次硅芯片成果。FPGA 成功将验证大部分逻辑,但 v2.0 的核心启示是,制造代表着另一道独立门槛。可用的 A0 硅芯片将强化新架构的主张。

任何阶段的失败仍会产生有用信息。超出单元区域预算将揭示可编程性的面积成本。时序问题将识别出慢路径。视觉错误则可能暴露精度或内存排序假设的问题。

因此,即便 v3.0 错过计划中的 2026 年发布窗口,路线图仍然重要。芯片进度取决于设计成熟度和共享制造机会。延期本身带来的信息不如延期背后的原因多。

读者也不应将 v3.0 视作必然出现的产品线。目前没有公布的消费市场、驱动生态或商业软件栈。该项目当前的定位是开放硬件开发和公开实验。

这一重点让 Vichit 能够做出商业 GPU 厂商无法做出的选择。不需要兼容现有游戏。驱动支持可以保持有限。设计可以优先考虑透明性和可视化教育,而非通用性能。

与此同时,可编程性将引发更严格的比较。一旦处理器运行着色器指令,开发者就会询问指令限制、分支行为、纹理访问、精度和吞吐量。每一个答案都会带来新的验证义务。

v2.0 的成就为该路线图提供了可信度,因为其前代产品已实现硅芯片,并据报道输出了图形画面。但这并不保证 v3.0 能够装得下、运行或成功制造。硬件进展具有累积性,却也毫不宽容。

对于关注 Tom Hardware 报道的开发者而言,下一步最好是审视开放设计,而非聚焦于最高级表述。将代码仓库规格与未来的基准测试、测试场景和硅芯片视频进行比较。

TinyGPU 的持久价值将取决于其他人能否复现、研究并扩展其技术。一次成功演示能够吸引关注;有记录的验证则会将这种关注转化为可复用的工程知识。

关注 v3.0 是否能让每项功能与其硬件成本之间仍保持清晰关系。如果着色器灵活性、裁剪和并行像素处理依然易于理解,这个项目就能保留其最强大的优势。

最有价值的小型 GPU,并不一定是晶体管数量最少的那一个,而是其约束条件能够揭示图形硬件实际工作方式的那一个。TinyGPU v2.0 已在硅片上达到了这一点。

如今,v3.0 必须证明:同样的清晰度能否在更具可编程性的流水线中延续。这项检验,而非与桌面 GPU 的较量,将决定该项目的下一个篇章。

 
 

免费开始

一款本地优先的AI助手,具备个人知识管理功能

为了获得更好的人工智能体验,

remio 目前仅支持Windows 10+ (x64)M-Chip Mac

在你的大脑里添加一个搜索栏

Ask remio

记住一切

​无需整理

bottom of page