AI 或许能帮助修复芝加哥的 311 系统,但无法取代问责机制
- Aisha Washington

- 8月6日
- 讀畢需時 13 分鐘
Tom Dowling 向 Google News 提出了一项犀利主张:利用 AI 将芝加哥已有 27 年历史的 311 系统从其被记录在案的“黑洞”中拉出来。
这项主张紧随 2026 年 2 月的一次审计。审计发现,居民在报告坑洼路面、损坏路灯、鼠患或其他问题后,往往无法得知后续发生了什么。一个请求可能被标记为已完成、已取消或已关闭,却没有有用的解释。
曾担任市长 Lori Lightfoot 顾问、并曾任 TaxProper 首席执行官的 Dowling 认为,现代 AI 能够改善这一体验。它可以对报告进行分类、识别重复投诉、分派工作、汇总案件历史,并发送更清晰的更新信息。
这一观点值得关注。芝加哥的 311 服务每年收到 220 万至 230 万份请求。即使是小幅改进,也可能影响数十万次居民与市政府之间的互动。
但审计所描述的不仅是技术问题。报告记录了分散服务网络中部门做法不一致、责任归属不清、人员有限以及问责薄弱等问题。
AI 可以让信息在该网络中流动得更快。它无法决定哪个部门必须采取行动,无法强制工作人员更新记录,也无法解释为何承诺的工作从未完成。
因此,真正的较量并非 AI 与旧软件之间的对抗,而是自动化效率与行政问责之间的对比。芝加哥两者都需要,否则更智能的界面只会掩盖同样悬而未决的失败。
为什么芝加哥的 311 审计成为 Google News 热点
眼下的关键并非芝加哥缺少数字工具,而是其现有工具往往无法完整呈现市政工作的实际情况。
芝加哥于 1999 年推出全面的 311 系统。2018 年末,该市迁移至 Salesforce,同时推出 CHI311 网站和移动应用程序。
如今,居民可以通过电话、网站、移动应用程序或市议员办公室提交请求。他们会收到追踪编号,并可查看公开状态信息。
这个看似简单的界面背后,是复杂的工作流程。Salesforce 会将每项服务请求分派至相应部门,而该部门可创建一个或多个关联工单。
服务请求会一直保持开启状态,直至关联工单关闭。理论上,这一结构类似包裹追踪,沿途的每项操作都应可见。
芝加哥监察长办公室发现,现实经常偏离这一模式。其 311 audit 认定,公开信息助长了困惑与不信任。
审计并未声称市政府雇员忽视每一项请求。它发现,居民往往无法确定部门采取了哪些行动、案件为何发生流转,或某个状态到底意味着什么。
一项请求可能在不同部门产生多份工单。然而,公众最初只能看到第一份工单及其预计服务时间。
该预计时间被称为服务级别协议,即 SLA。它描述预期响应时段,但芝加哥各部门对 SLA 的计算和应用方式并不相同。
部分线上预估基于有限公开数据形成的动态平均值。另一些则采用静态时间表,可能无法反映当前工作量或完整的请求生命周期。
各部门对状态标签的使用也不一致。一项请求可能在没有可见工作的情况下显示“已完成”,或在未向居民解释的情况下被标记为“已取消”。
重复投诉也造成了另一种困惑。Salesforce 能够识别某些重复请求,特别是在报告包含完全相同地址时。
各部门也可以手动将请求归类为重复。审计发现,工作人员有时会关闭这些请求,却不说明另一个请求已涵盖同一问题。
这种区别对居民而言很重要。被关闭的重复请求可能意味着高效整合,但当系统未提供解释时,它看起来完全像是被驳回。
社区成员和选区工作人员多次将这种体验形容为“黑洞”。这一说法概括了内部处理与公众理解之间的脱节。
该市的 CHI311 portal 承诺,居民可以提交、追踪并查询非紧急服务。审计显示,追踪信息的可靠程度仍取决于各部门的数据录入。
这正是 Dowling 的观点能够通过 Google News 传播的原因。AI 为大规模处理分类、汇总、搜索和重复沟通提供了易于理解的工具。
机会确实存在。不过,审计提出了一项严格考验:任何技术方案都必须改善底层记录,而不只是让不可靠的记录更容易阅读。
AI 可以修复信息层
当 AI 将杂乱的居民报告转化为结构化工作,并将碎片化记录转化为易懂更新时,它便能发挥可信作用。
居民很少会按照市政府的官方分类体系描述市政问题。有人可能报告“破损路缘旁有水冒泡”,却不知道哪个部门负责处理。
语言模型可以识别可能的类别、提取地点、询问缺失细节,并推荐正确的服务类型。人工操作员可以审核不确定的案件。
这一流程能够解决常见的受理问题。错误分类可能在任何一线工作人员看到请求之前,就将其送往错误部门。
AI 还可以识别语义相近的报告。语义匹配比较的是含义,而非要求词语或地址完全一致。
十位居民可能以十种不同方式描述同一根倒下的树枝。模型可以将这些报告归组,同时保留每位居民接收更新的订阅。
这种方式优于简单的重复检测。它还可以告知居民,其报告已并入一个活跃案件,而不是被悄然关闭。
案件汇总是另一项有用的应用。芝加哥的父子层级结构可能将重要细节分散在一项服务请求和多份工单中。
AI 可以根据这些记录生成通俗易懂的时间线。摘要可以说明哪个部门收到案件、记录了何种行动,以及哪些事项仍在等待处理。
每一句话仍必须由系统数据支撑。模型绝不应为了填补缺失字段而编造解释。
自动化通知提供了风险较低的机会。基于规则的系统可以在责任归属变化、SLA 到期或工作人员记录现场结果时触发消息。
随后,AI 可以将经批准的状态代码转化为更清晰的表述。它应保留底层代码,并向居民标明消息是否由机器生成。
这些工具还可以帮助市政人员搜索程序规范。经过审慎治理的 AI knowledge base 可以检索相关政策,而不会取代官方来源。
这一能力很重要,因为审计发现培训和系统使用并不一致。据报道,部分选区和部门员工靠自学掌握 Salesforce 的使用方法。
一个共享助手可以在案件处理过程中呈现定义、分派规则和关闭要求。它可减少 40 多个部门及合作机构之间的无意不一致。
其他城市提供了有价值的先例。洛杉矶市审计长的一项评估介绍了市政服务系统中的语音识别、对话代理和 AI 辅助分派。
该 Los Angeles review 提到旧金山使用基于 AI 的工具来识别正确的服务部门,也介绍了其他地区用于处理常规请求的语音系统。
这些例子并不能证明芝加哥会取得同样的成果。它们表明,市政 AI 不必从一个不受限制的公共聊天机器人开始。
更聚焦的部署可以从分类、重复建议、政策检索和通知草稿开始。工作人员仍将保留对最终分派和关闭的决定权。
这种设计针对的是 AI 相对擅长处理的工作。它还会产生可衡量的产出,包括分派准确率、重复识别精度、转派频率和通知速度。
Dowling 的核心洞见在此处最具说服力。芝加哥已经拥有庞大的数字记录和云端案件系统,但居民仍难以理解处理流程。
AI 可以将描述连接到类别,将记录连接到解释。它可以减少报告与可理解回应之间的行政摩擦。
最佳结果不会让人觉得充满未来感。居民会提交问题、获得正确的案件编号、看到现实的预期,并理解每一次状态变化。
这将是一项有意义的转变。但它也只是问题的信息层。
真正的对手是缺失的问责机制
当无人对数据质量、承诺准确性或最终服务结果负责时,再快的系统也会失效。
监察长发现,芝加哥的中央分析能力极为有限。审计确认,仅有两名工作人员服务于 40 多个市政府部门、关联机构及外部合作伙伴。
这些员工负责培训、技术支持、报告配置和其他行政需求。他们缺乏开展深入、全市范围运营分析的能力与权限。
由此产生的矛盾正是 Google News 讨论的核心。芝加哥 311 的使命包括利用信息改善服务并高效管理资源。
然而,审计发现,没有任何市级机构负责跨部门开展这项工作。技术会记录活动,但组织责任依然分散。
围绕服务倡导部门的争议尤其清楚地暴露了这一缺口。公开的市政府资料曾描述一个承担广泛分析和绩效职责的部门。
OEMC 回应称,该部门已多年不存在。其表示,相关职责已被纳入现有岗位,但这些岗位的能力有限。
监察长指出,在审计期间,工作人员仍将自己称为该部门成员。其网页在现场调查期间也仍可访问。
这一分歧并非无关紧要的命名问题。它显示出对于谁负责系统最重要职能之一的疑问。
AI 无法消除这种不确定性。模型可以标记逾期请求,但无法要求部门负责人解释积压情况。
它可以检测异常的关闭模式,却无法判定这些模式反映的是高效工作、培训不足,还是试图改善报告绩效的做法。
它可以起草更新,但当现场工作人员未录入相关信息时,无法生成真实细节。自动化汇总之后,缺失的运营数据依然缺失。
芝加哥各部门对字段的定义和使用方式也不同。审计发现,“已完成”“已关闭”“已取消”和“无原因”等状态的处理方式并不一致。
不同部门在不同层级计算服务预期。有些关注完整请求,另一些则将目标附加到单项工单。
除非该市先明确权威定义,否则基于这些记录训练的 AI 系统将学习并延续这种不一致。自动化既能扩大模糊性,也能扩大清晰度。
同样的问题也影响资源配置。仪表盘或许能显示某个区域反复出现的投诉,但一个部门仍需要人员、设备、资金和权限来作出响应。
如果领导层把分类改进当作服务改进,公众信任可能会进一步下降。居民评价 311,看的是坑洼是否修复、隐患是否清除,而不只是模型准确率。
因此,可信的改革需要有一个对完整服务流程负责的明确主体。该机构必须定义字段、验证 SLA、审查部门绩效,并公布纠正措施。
监察长建议定期召开部门会议、提供更清晰的公众指引、加强培训,并进行人员配置分析。这些都是治理措施,而非 AI 功能。
OEMC 同意,更有结构化的协作将有所帮助。它还表示,人员配置决策与现有预算和运营考量相挂钩。
预算约束是真实存在的,但采购 AI 并不能消除这些约束。一个正常运作的系统仍需要人员维护分类体系、审核错误、处理申诉和监督供应商。
据监察长采访的工作人员称,芝加哥曾举行使用 311 数据的全市绩效会议。这些会议已多年未再举行。
现代版本可以将 AI 辅助分析与直接的管理压力结合起来。部门领导将审查积压案件、结案模式、转办情况和社区间差异。
这将形成缺失的反馈闭环。模型识别模式,管理者调查原因,部门采取行动,居民看到有据可查的结果。
没有这个闭环,AI 就会成为居民与决策者之间的又一层隔阂。界面变得更流畅,而责任主体却更难定位。
AI 提案必须证明什么
芝加哥应以经核实的服务结果来评估任何 311 AI 系统,而不是聊天机器人的流畅程度、供应商演示,或自动化互动的数量。
生成式 AI 通过根据学习到的模式预测可能的序列来生成文本。它并不具备独立判断城市维修队是否完成工作的能力。
当居民请求供暖援助、庇护服务、老年人健康检查,或涉及公共安全的维修时,这一局限就会变得危险。
一个自信但错误的回答可能会把人引向错误的服务。它也可能在底层记录并非如此时,告诉居民案件已经解决。
美国国家标准与技术研究院将这种行为称为“虚构”。其生成式 AI 概况描述了会自信地呈现错误或内部不一致内容的系统。
芝加哥可以通过限制模型可说的内容来降低这一风险。每一条面向公众的回复都应从获批系统中检索事实,并引用相关案件字段。
检索并不能消除错误。模型可能选择错误的记录、误读状态,或遗漏重要限定条件。
因此,高影响类别需要更严格的控制。某些请求应直接转交给受过培训的工作人员,不进行自主优先级排序或结案。
市政府还必须测试公平性。投诉记录反映了谁了解 311、谁信任它、谁拥有数字化访问条件,以及谁会反复报告未解决的问题。
投诉更多并不总意味着实际需求更多。投诉较少也不能证明一个社区的问题更少。
优化系统可能偏向拥有更丰富历史数据的地区。它可能在表面上显得数字效率更高,同时强化既有的服务差距。
芝加哥应按地域、语言、无障碍需求、渠道和服务类型评估路由与优先级排序。在隐私允许的情况下,错误率需要公开报告。
居民还需要一条简单途径来质疑自动化决定。人们应能请求人工复核,而无需重新启动整个案件。
隐私同样需要受到重视。报告可能包含地址、照片、电话号码,以及对弱势群体或物业状况的描述。
市政府应明确模型可访问哪些字段、提示词和输出如何保留,以及供应商系统是否会将这些信息用于训练。
安全审查必须涵盖提示词注入、未经授权的数据检索,以及嵌入提交文本中的虚假指令。公众输入本质上并不可信。
采购应要求独立测试和详细的事件报告。芝加哥不应仅依赖模型供应商提供的性能声明。
审计还指出了一个更基础的前提:一致的数据定义。当各部门对结案类别含义存在分歧时,AI 评估就会变得不可靠。
在启动前,芝加哥应发布共享数据字典。每一种状态、结果、转办、重复案件标记和 SLA 都应有一个统一的操作定义。
各部门可以保留专门的工作流程。但其公开报告仍必须映射到一组通用且易于理解的状态。
随后,试点应建立基线。可用指标包括错误路由、转办频率、未解决的重复案件、逾期更新、重新开启的请求以及居民满意度。
市政府应将 AI 辅助案件与按现行流程处理的类似案件进行比较。它应同时测试平均表现和最坏情况下的失败。
仅看完成速度并不充分。一个系统可以通过快速结案来改善这项指标,即使实际工作仍未完成。
芝加哥必须将速度与经核实的结果结合起来。审计可抽样检查已完成案件,将记录与现场证据比对,并就未解决状况联系居民。
这一审慎标准并不否定 Dowling 的提案。它让该提案在运营层面更加严肃。
当 AI 在保留人工责任的同时提升可理解、准确的服务时,它才配得上发挥作用;如果它只是在未改变的官僚体系外包装出更好的语言,它就失败了。
芝加哥应从三项可衡量的测试开始
下一步应是一个有限且公开的试点,围绕路由质量、如实更新和可追责的部门响应展开。
第一个信号是,芝加哥是否为 311 绩效设立了明确的负责人。该负责人需要拥有跨参与部门的权限。
仅设立一个新头衔还不够。该机构应公布数据定义、审查 SLA、调查反复出现的失败,并报告纠正行动。
如果芝加哥建立这一职能,Dowling 的论点就会更有力。AI 将拥有能够把模型输出转化为运营改变的管理架构。
如果职责仍然分散且不正式,提案就会被削弱。自动化发现将触及审计已识别出的同样组织缺口。
第二个信号是开展受控的路由和重复检测试点。芝加哥应选择若干请求量高、风险较低且历史记录可靠的服务类别。
试点应比较人工决定与 AI 建议。工作人员应记录错误匹配、错误路由、转办以及需要升级处理的案件。
报告被归为重复案件的居民应收到主案件编号及其当前状态。他们也应保留质疑该匹配的途径。
真正的改进意味着,在不恶化各社区或语言群体结果的前提下,减少不必要的转办和无法解释的结案。
失败则会呈现不同面貌。系统可能缩短处理时间,却增加误分类、掩盖本地模式,或拒绝为居民保留独立案件记录。
第三个信号是公开状态信息是否变得准确。芝加哥应在生成自然语言说明之前,先定义一套标准状态。
一条有用的更新应说明负责部门、描述已记录的行动、披露尚未完成的工作,并提供下一个预期里程碑。
当市政府没有预估时间时,应如实说明。诚实的不确定性比基于薄弱数据生成的精确日期更值得信赖。
芝加哥可以衡量获得及时更新的请求比例、重新开启案件的比率,以及显示完成时间与实际完成时间之间的差异。
该市公开的服务数据集为外部分析提供了基础。任何 AI 试点都应保留或提升这种透明度。
这些测试应按顺序进行。治理优先,受控自动化随后,面向公众的扩展则取决于经核实的结果。
芝加哥不应从一个承诺回答一切的全市聊天机器人开始。在修复底层记录之前,这种做法会带来最大的声誉风险。
一个范围有限的助手仍可带来可见价值。它可以帮助居民选择正确的请求类型,并解释既有、已核实的案件历史。
它应明确表明自己是自动化系统,并展示其回答所依据的源记录。不确定性应导向人工复核,而不是编造确定性。
呼叫中心员工和选区工作人员应参与系统设计。他们了解数字化请求与现场工作之间出现的失效模式。
居民也应参与,尤其是使用无障碍服务或英语以外语言的居民。他们的经验可以揭示汇总指标所掩盖的错误。
在扩大范围之前,独立审查人员应评估试点。他们的发现应同时涵盖技术表现和城市实际响应的质量。
Google News 的关注可能让 AI 看起来像是核心事件。更重要的问题是,芝加哥是否利用这种关注来重建问责机制。
Dowling 说得对:AI 可以改善一个每年处理超过 200 万项请求的系统。分类、重复检测、搜索和沟通都是切实可行的应用。
然而,这个“黑洞”的出现并非因为芝加哥缺乏流畅的软件,而是因为居民看不到责任归属、处理进展或可靠解释。
芝加哥应在每个试点阶段后问一个问题:居民获得的是更准确的服务,还是仅仅更多自动化沟通?
这一区别应指导采购、人员配置和公开报告。它也应决定项目是否扩展到最初类别之外。
对于通过 Google News 关注此事的读者而言,有意义的里程碑不会是一项 AI 公告,而是芝加哥缩小记录活动与实际完成工作之间差距的证据。
请关注是否出现明确的绩效负责人、已公布的状态定义,以及独立测量的试点结果。这些信号结合起来,将表明芝加哥建设的不仅是一层对话界面。
AI 可以照亮穿越 311 的路径。芝加哥的领导者仍必须决定谁来走这条路、谁来解决问题,以及当什么都没有发生时由谁来回应。


