top of page

Vox Deorum: LLMs 玩策略游戏—1,408 Civilization V 实验揭示涌现人格

已更新:6月17日

Beyond Scripted AI: How Vox Deorum Brings LLM Civilization V Gameplay to Life

策略游戏长期以来一直深受一个问题的困扰:其“人工智能”并非真正的智能。它只是一系列通过作弊来保持竞争力的 if/else 脚本。最近的一个突破性项目 Vox Deorum 通过将大语言模型直接注入到 Sid Meier's Civilization V 的决策循环中,改变了这一动态。

通过弥合游戏状态与生成模型之间的鸿沟,Vox Deorum 让玩家能够对抗一个会思考的 LLM Civilization V 对手, 规划并进行谈判。最近涉及 OSS-120B 和 GLM-4.6 等不同模型之间超过 1,408 场自动化对局的测试显示,虽然这些 AI 智能体尚未击败特级大师,但它们正在生存、进化,并展现出传统游戏脚本无法复制的独特个性。

为本地 LLM Civilization V 对局配置 Vox Deorum

Setting Up Vox Deorum for Local LLM Civilization V Matches

在分析来自 1,000 多场游戏实验的数据之前,我们需要解决实际操作层面的问题。你究竟如何在你自己的机器上运行一个 LLM Civilization V 智能体?根据目前的社区测试和 Beta 0.4.6 文档,安装过程需要特定的方法以避免技术瓶颈。

安装与架构

Vox Deorum 并不是一个独立的游戏;它作为一个桥梁运行。其架构将 Civ 5 连接到 Community Patch DLL,后者与 Bridge Service 通信,接着连接到 MCP (Model Context Protocol) 服务器,最后连接到 LLM。首先,你需要一份包含所有扩展包的正版 Civilization V。安装程序(目前仅限 Windows)会处理必要的依赖项,包括 Node.js 和 Python。

配置稳定性与同步失败 (Desync)

来自早期采用者的一个关键用户体验反馈涉及网络稳定性。虽然系统在技术上支持标准的多人游戏协议,但将游戏状态发送给 LLM 所需的大量数据传输经常会导致同步问题(“Desyncs”)。

解决方法:在“Hotseat”模式下运行比赛。这会强制游戏在本地机器上按顺序处理回合,从而消除由 LLM 处理时间引起的网络延迟。

处理 Token 负载

一个常见的障碍是海量的数据量。一场 LLM Civilization V 比赛会生成巨大的 Prompt。你不仅是在发送文本;你还在发送地图数据。

  • 矩阵难题: 将原始的 56x36 地图矩阵输入模型,每次提示词会消耗超过 40,000 个 token。对于大多数本地硬件来说,这是不可持续的。

  • 事件解决方案: Vox Deorum 通过“事件”和战术区域描述来隐式地描述地图,而不是采用暴力破解式的坐标网格,从而解决了这一问题。

本地硬件现状

你并不需要 H100 集群才能开始。用户已经成功在本地运行了较小参数的模型(如 OSS-20B)。如果你拥有一块显存充足的优秀 GPU,就可以在自己的硬件上托管 AI 对手。对于那些比起隐私更看重速度的用户,系统允许通过 WebUI 配置连接到外部 API(如 OpenRouter)。

LLM Civilization V 性能测试:OSS-120B 对比 GLM-4.6

最近的核心 Vox Deorum实验让两个重量级选手在游戏环境中展开对决:OSS-120B 和 GLM-4.6。结果打破了 LLM 只会因幻觉而导致失败的假设。两款模型的生存率均达到 97.5% 左右,实际上与标准算法机器人的 97.3% 生存率持平。

好战者 vs. 建设者

最引人入胜的发现不是它们生存了下来,而是它们如何进行游戏。

  • OSS-120B(侵略者):该模型表现出明显的倾向于统治的“个性”。与基准相比,其统治胜利(Domination victories)增加了 31.5%。它主动忽视文化,文化胜利(Cultural victories)下降了 23%。

  • GLM-4.6(战略家):相比之下,GLM-4.6 保持了平衡的态势,在征服和文化之间权衡取舍。

这表明,在 AI 中的“个性”LLM Civilization V 上下文 不仅仅是润色文本——它是模型训练数据的一种涌现属性。OSS-120B 将获胜条件解释为一个需要用武力解决的问题,而 GLM 则看到了多种路径。

意识形态偏见

两个模型在统计学上都表现出对“秩序”意识形态的显著偏好,选择它的频率比“自由”高出约 24%。在游戏机制中,秩序有利于广阔的帝国和生产——与自由意识形态中侧重专家的细微差别相比,这些概念或许更容易与 LLM 规划的逻辑结构保持一致。

Vox Deorum 中智能的成本

The Cost of Intelligence in Vox Deorum

运行一个 LLM Civilization V 代理并不是免费的,无论你支付的是电费还是 API 额度。测试显示了巨大的数据消耗。在游戏后期,单回合可能需要处理 53,000 个输入 token。虽然输出 token 保持相对稳定(约 1,500 个),但随着历史记录的累积,上下文窗口呈线性增长。

根据 2025 年底通过 OpenRouter 的定价,一场完整的标准速度游戏成本约为 0.86 美元。这听起来很低,但对于扩展这项技术的开发者来说,带宽才是真正的杀手。将游戏状态中的“事实”(Facts)提取为 Markdown(描述城市、单位和规则)在计算上非常昂贵。未来的 Vox Deorum可能需要转向“增量更新”或基于向量的记忆,以避免在每次单位移动时都重新发送整个世界状态。

Vox Deorum 的未来:记忆与自主性

目前的 LLM Civilization V 实现方案面临“鱼的记忆”问题。 模型看到当前状态,做出移动,然后到下一回合就忘记了为什么做出那个移动。它完全依赖于上下文窗口。用户反馈和开发者路线图指出了下一次进化的三个关键领域:

  1. 自我反思: 实现一个循环,让 AI 批判 其前一轮的表现,然后再进行新的一轮。

  2. 分层代理: 与其让一个 LLM 控制一切,不如让一个“将军”代理发布高层指令(“占领那座城市”),而由更小、更廉价的模型来执行具体的战术单位移动。

  3. 人格角色扮演: 玩家希望感觉自己是在与亚历山大大帝对话,而不是 ChatGPT。利用聊天功能来强化特定的外交人格是用户的高优先级需求。

结论

Vox Deorum 证明了脚本化的、作弊型 AI 正在走向终结。 虽然我们仍处于优化阶段——还在与 token 限制和上下文窗口作斗争——但能够在本地运行一场 LLM Civilization V 对局,代表着一次巨大的飞跃。这些模型不仅仅是在玩游戏;它们正在形成意识形态,根据其内部逻辑选择暴力或和平,并让我们得以窥见一个每个 NPC 都拥有独立思想的未来。

常见问题

运行 Vox Deorum 避免卡顿的最佳方式是什么?

最稳定的方法是使用 "Hotseat"(热座)模式。这通过强制游戏在本地机器上按顺序处理回合逻辑,而不是通过网络协议,从而防止网络去同步(desync)错误。

我可以在自己的电脑上运行 LLM Civilization V 对手吗?

可以,较小的模型如 OSS-20B 已验证可在消费级硬件上运行。然而,对于像 OSS-120B 这样的大型模型,你可能需要使用 API 服务或高端多 GPU 配置。

AI 在没看到地图的情况下是如何知道地图样貌的?

Vox Deorum将地图数据转换为基于文本的“事件”和战术区域描述。它避免发送原始地图矩阵(否则每回合将消耗超过 40,000 个 token),而是依赖于隐式的描述性数据。

LLM 的表现真的比标准 AI 更好吗?

目前,LLM 的生存率(约 97.5%)与standard AI相似,但在胜利分数上并不能稳定击败后者。它们的优势在于不可预测且不作弊的游戏玩法,而非优化的数值最大化。

LLM 在 Civilization V 中更倾向于哪种意识形态?

测试显示其对“秩序”意识形态有明显的偏好。像 GLM-4.6 和 OSS-120B 这样的模型选择“秩序”的频率比“自由”高出约 24%,这可能是由于其侧重于生产力的加成。

Vox Deorum 兼容多人游戏吗?

从技术上讲是可以的,因为它使用了标准的游戏协议。然而,由于 LLM 处理时间带来的延迟,实时多人游戏容易出现不同步现象,因此建议采用 Hotseat(热座模式)或单人模式。

 
 

免费开始

一款本地优先的AI助手,具备个人知识管理功能

为了获得更好的人工智能体验,

remio 目前仅支持Windows 10+ (x64)M-Chip Mac

在你的大脑里添加一个搜索栏

Ask remio

记住一切

​无需整理

bottom of page