top of page

Pangram 融资 900 万美元以扩展 AI 内容检测

Pangram 获得了 900 万美元融资,而 TechCrunch 最新的内容测试揭示了其最新 AI 检测模型的潜力与局限。这家纽约初创公司还推出了用于文本检测的 Pangram 4,并以研究预览形式开放 Pangram Image。

这一组合让一则普通的融资消息成为对更大命题的一次检验。随着生成模型让作者身份愈发难以判断,Pangram 押注于组织将愿意付费识别合成媒体。然而,每一次分类结果都可能影响学生、作者、研究人员、出版商或员工。

核心冲突并非 Pangram 与某一家竞争对手之间的较量,而是统计检测与人们日益期待软件能够对作者身份给出确定结论之间的矛盾。Pangram 表示其提升了混合内容检测能力,但独立审视表明,即使分类器准确,也无法裁定每一场争议。

GPTZero、Copyleaks、Originality.ai 和 Winston AI 都在追逐同样的需求。随着 OpenAI、Anthropic、Google、Meta 及其他开发商推出的模型生成更自然的内容,它们面对的是同一个不断变化的目标。Humanizer 程序则通过改写生成内容以掩盖其来源,进一步增加了复杂性。

Pangram 的融资为其将这场竞争从文本扩展到图像提供了资源。更艰巨的挑战在于:当软件存在不确定性、底层政策各不相同、错误又会带来真实后果时,如何建立对检测结果的正确解读方式。

Pangram 的融资扩大了检测押注

Pangram 正在为一个更广泛的作者身份检测平台融资,而不仅仅是更新一款文本检查工具。

据最初的融资报道,这轮 900 万美元融资由 Menlo Ventures 领投,Haystack、ScOp、Script Capital 和 Cadenza 也参与其中。Pangram 在宣布融资的同时发布了两款模型,使产品扩展成为这笔投资故事的核心。

Pangram 4 是该公司的下一代文本分类器。分类器是一种将输入归入不同类别的模型,例如人类撰写、AI 辅助或 AI 生成。该公司称,Pangram 4 在检测辅助写作以及同时包含人类和机器生成段落的文档时,准确率超过 99%。

这一说法很重要,因为混合文档比未经改动的聊天机器人输出更难处理,也更为常见。作者可能先起草一篇文章,再让模型修改若干段落,然后再次编辑结果。二元标签无法很好地描述这一过程。

Pangram 表示,其新模型在识别经过 AI humanizer 处理的内容方面也有所提升。这类服务会改变生成文本,使检测器更难识别其来源。它们让检测变成一场对抗性竞争,双方都会适应对方最新的方法。

图像预览将这场竞争延伸到语言之外。Pangram 表示,Pangram Image 会研究像素级分布,也就是构成图像的数值中的统计模式。不同于绑定单一生成器的水印检查工具,该模型旨在检测来自不同图像系统的输出。

该预览版还可生成热力图,显示哪些区域看似为合成内容。这项功能针对合成案例,包括真实照片中屏幕或印刷表面上出现 AI 生成图片的情况。Pangram 计划在研究预览期结束后进行更广泛的发布。

这一扩展让 Pangram 面对更大的潜在问题空间,但也成倍增加了验证负担。文本、照片、插画、截图和编辑过的合成内容表现各不相同。某一种内容类型上的表现,对另一种类型的表现说明有限。

Pangram 带着异常高的公众关注度进入这一扩展阶段。其检测结果已经影响了围绕图书、新闻、学术工作和网络帖文的讨论。由于用户可能在审视分数的生成方式之前,就把一个带颜色的分数当作证据,因此每一次错误的后果都更为严重。

因此,这轮融资支持的是两款产品以及一项治理挑战。Pangram 必须改进检测,同时让客户理解,模型输出是一种基于概率的信号,而不是关于文档或图像如何创建的完整记录。

这一区别构成了故事的核心张力。更好的检测能够提升信心和采用率,而更广泛的采用也会增加基于仍不完美结果作出重大决定的数量。

为什么 TechCrunch 的内容测试很重要

TechCrunch 的内容实验展示了一款能力出色的模型,但其句子级判断仍会随着常规编辑而变化。

记者 Rebecca Bellan 使用由 ChatGPT 和 Claude 生成的文章测试了 Pangram 4。检测器能够轻易识别完全由 AI 生成的报道,并且在人工编辑后通常仍能继续识别它们。在这些测试中,要求聊天机器人规避检测的提示词并未可靠地击败该模型。

当人类与机器的贡献混合时,结果变得更加复杂。Bellan 将自己的一篇文章交给 ChatGPT 和 Claude 润色。Pangram 返回了 13% 的 AI 辅助评分,并识别出部分被修改的措辞,但它也将一些由人类撰写的句子标记为辅助生成。

在经由模型辅助修改前,原文曾获得完全由人类撰写的结果。这一对比表明,Pangram 检测到了文档的真实变化。然而,被高亮的段落与导致该变化的编辑内容并不完全对应。

第二项实验将个人 newsletter 文本拆分为人类撰写和生成内容两部分。研究人员要求 ChatGPT 和 Claude 在续写时模仿作者既有的文风。Pangram 通常能够区分原始部分与合成续写部分。

这些测试并不构成受控基准测试。它们只涉及少量文档、提示词、模型和编辑模式。不过,它们展示了客户将面对的实际问题:被高亮的句子究竟是证据,还是更广泛审查中的一个组成部分。

Pangram 表示,大约每 10,000 份人类文档中会有一份被错误分类为 AI 内容。这是公司提供的比率,其相关性取决于受测领域、文档长度、模型版本、决策阈值以及真实客户输入的分布。

该公司公开的检测方法描述了一套迭代训练流程。Pangram 从人类和合成文档入手,找出分类器处理错误的困难样本,将这些样本加入训练集,然后重新训练模型。

Pangram 将其中一部分方法称为合成镜像。对于一份人类文档,它会生成一份在主题、长度、风格和语气上与原文匹配的机器撰写版本。其目的是防止分类器依赖表面的主题或体裁差异。

作为另一部分方法的困难负样本挖掘,会在大型人类数据集中搜索被模型错误标记的文档。这些边缘案例随后成为训练材料。目标是在类似材料到达客户之前,让分类器学习识别不常见的人类写作。

Pangram 早期的技术报告评估了横跨十个文本领域和八个语言模型的 1,976 份文档。报告作者称,其错误率显著低于若干对比系统,尽管该报告由 Pangram 的创始人撰写。

该论文还报告称,在进行困难负样本挖掘后,按领域加权的假阳性率为 0.02%。结果因领域而异,这进一步说明单一的总体准确率数字无法描述每一种部署场景。

这正是 TechCrunch 内容测试的重要性超出其样本规模的原因。它揭示了模型整体表现出色与模型能否正确解释某一具体句子之间的解读鸿沟。客户面对的是个案,而不是基准平均值。

真正的竞争是检测与确定性之间的竞争

Pangram 可以提高作出正确判断的概率,但无法将作者身份转化为可直接观测的事实。

文本检测器不会还原一份文档完整的编辑历史。它会学习已知人类样本和生成样本之间的统计差异,然后估计新内容更符合哪一类。这种机制可以很有用,但并非绝对可靠。

Pangram 表示,它不依赖隐藏水印或复制的元数据。其分类器转而学习语言模型反复出现的风格选择。这使系统能够评估来自不同生成器的输出,包括已经失去原始技术元数据的内容。

这种灵活性带来了无法避免的动态目标问题。模型开发商持续调整训练数据、对齐方法、采样行为和写作风格。针对昨天输出训练的检测器,必须泛化到从未见过的系统和版本。

Humanizer 则从另一个方向给模型施压。它们的目的,是去除分类器与生成写作关联的信号。一些工具会引入生硬的措辞或语法变化,以可读性换取更低的检测分数。

Pangram 的早期研究认为,镜像样本和困难的人类文档能够提升泛化能力。该公司还为报告的错误维护反馈循环。这些方法可以减少反复出现的错误,特别是在拥有足够代表性数据时。

不过,类别本身依然存在争议。“AI 辅助”可能包括校对、改写、创意生成、翻译、研究支持或大规模重新生成。两家机构可能观察到相同的工作流程,却应用完全不同的政策。

出版商可能允许语法修正,但禁止生成段落。大学课程可能允许头脑风暴,同时要求学生保留草稿。雇主可能鼓励模型辅助写作,只要事实经过人工核实。

检测器无法解决这些政策差异。它只能估计文本是否类似由模型生成或修改的材料。因此,负责任的决定需要额外证据,包括版本历史、笔记、引用、访谈以及创作者的说明。

随着检测进入日常内容工作流,这一局限变得更加重要。组织已经使用 AI 知识库 来整合笔记、文档和模型生成的摘要。最终文本可能反映许多人类和机器的贡献。

可靠的来源证明会直接记录这些贡献。检测则是在来源证明丢失或被隐瞒后,从完成的成品反向推断。这使它对筛查很有价值,但作为证据则较弱。

图像检测中也存在同样的问题。像素分布可以揭示与合成相关的模式,但缩放、压缩、截图、滤镜和实体再拍摄都会改变这些模式。被检测出的区域也无法说明是谁生成了它,或其使用是否违反规则。

Pangram 的跨模型方法与在创作过程中附加凭证或水印的来源证明技术形成对比。检测可以评估来自众多来源、且未标注来源的内容。附加的来源证明能够提供更强的创作记录,但前提是工具能够保留并验证这些信息。

这些方法应当相互补充。参与其中的系统保留记录时,溯源可以确立事件经过;记录缺失时,检测可以标记可疑材料。两种机制都不应成为调查的万能替代品。

因此,Pangram 最有力的商业论点并非提供绝对确定性,而是在找出值得深入关注的案例的同时,减少人工必须审查的材料数量。这一承诺没那么戏剧化,却更站得住脚。

准确率主张遇上高风险后果

当机构扫描数百万份文件,并将每一次标记都视为裁决时,即使极低的错误率也会造成破坏性错误。

误报问题并非理论上的担忧。误报是指人类创作被标记为由 AI 生成或得到 AI 辅助。在教育、出版、就业和新闻行业中,这种标记可能在创作者作出回应前,就引发惩罚或声誉损害。

早期学术研究发现,多款 GPT 检测器对非英语母语者的写作存在不成比例的误判。该项偏见研究将问题与可预测的词语选择及较低的语言变化度联系起来——一些检测器会将这些模式与模型输出相关联。

Pangram 表示,其架构和训练流程避免了这种偏见。其技术报告纳入了英语学习者样本,并称在经过困难负样本挖掘后,该领域的误报率为 0.01%。但仍有必要在当前模型和真实机构环境中进行独立复现。

相较于对旧式检测器的广泛批评,有关 Pangram 的证据更为正面,但并不完全一致。该公司引用的独立评估显示,其在较长文本上的表现强劲。公开争议也暴露出错误结果,以及对于其标签含义的分歧。

The Atlantic 在其准确性调查中记录了这一矛盾。该刊报道称,Pangram 已在涉及书籍、文章、学术作品和公共文件的指控中变得颇具影响力。

Pangram CEO Max Spero 承认,该模型的内部推理难以解释。他还表示,这一工具绝不应充当最终裁决者。这一警告比任何醒目的准确率百分比都更值得关注。

当一个人必须质疑某项结果时,可解释性至关重要。被高亮显示的段落看似是一种解释,但它可能只表明模型在哪些位置给出了高分。它并不一定能指出直接来自聊天机器人的具体措辞。

规模让问题更加棘手。万分之一的误报率听起来微不足道;但若应用于一千万份人类文件,在部署数据与基准测试相符的前提下,同样的比率会产生一千个错误标记。

现实世界的输入很少能与基准完全匹配。其中包括罕见文体、程式化的企业语言、大幅编辑过的文字、译文、法律模板、科学术语,以及远短于测试样本的文件。

漏报同样重要。漏报是指生成内容被标记为人类创作。The Atlantic 描述的一项测试表明,Pangram 可能漏掉了约七十分之一的生成样本,尽管其他评估报告了更好的结果。

攻击者还可以反复测试公开检测器。他们可以不断修改一段文字,直至其分数降低,再传播修改成功的版本。这种自适应行为不同于普通基准测试,后者通常只评估样本一次。

图片预览也存在类似风险。TechCrunch 的有限测试发现,该检测器识别出了多张合成图像,并在一张真实照片中识别出一幅 AI 图片。但它也将一张拍摄 AI 生成图像的照片误标为人类内容。

这一失败说明了复合媒体的复杂性。底层的合成图片并未改变,但照片改变了周围像素的统计特征。在原始文件上有效的系统,面对截图、扫描件或社交平台重新压缩的内容时,可能会有不同表现。

客户应在自动化决策前要求进行特定领域的验证。筛查长篇文章的出版商,与评估简短回答的教师,其风险状况并不相同。扫描表情包的社交平台,面对的内容变换也不同于检查原始图片文件的新闻编辑部。

他们还应保留每项决策周围的证据。分数、模型版本、阈值、源文件、草稿历史和审核者备注,都能揭示某个结果是否合理。单张检测结果截图无法提供这些背景。

最负责任的部署方式,是将 Pangram 用于分流。高分可以启动审查、促成对话,或要求提供溯源信息;但不应自动证明存在不当行为。

Pangram 4 向竞争对手和机构施压

Pangram 4 提高了竞争检测器的性能门槛,同时迫使客户明确他们究竟希望检测实现什么目标。

GPTZero、Copyleaks、Originality.ai 和 Winston AI 都在销售用于区分生成材料与人类创作的工具。它们的产品在支持语言、集成方式、文档分析、抄袭检测功能,以及对辅助内容的处理方式上各不相同。

Pangram 当前的差异化优势在于混合文本分类、困难负样本训练和跨模型检测。其图片预览功能增加了一个新的产品类别,而竞争对手和溯源服务商则在重叠的信任与内容审核预算上展开竞争。

这笔融资可支持模型训练、评估、集成和分发。然而,资本本身并不能创造持久优势。随着人类写作和合成输出这两个群体不断变化,Pangram 必须持续收集具有代表性的人类写作和合成输出。

数据质量尤为重要。使用多样化、获授权且标签准确的人类文档进行训练,可以降低误报率。生成有说服力的镜像样本,则需要接触当前的前沿模型,并谨慎控制主题、语气、长度和文体。

竞争对手也可以采用类似方法。更深层的优势将来自运营反馈:经过验证的错误、有争议的决定、新出现的生成器,以及从真实客户处收集的对抗性样本。这些案例获取成本高,也难以标注。

机构同样面临压力。它们不能把 AI 政策外包给界面最清晰的检测器。它们必须决定哪些类型的辅助需要披露,以及什么证据足以启动调查。

例如,一所大学需要针对构思、编辑、翻译、编程协助和提交的正文分别制定规则。当标准写作软件已经包含生成式功能时,一刀切的禁令将难以执行。

出版商也面临相关挑战。它们必须保护读者免受捏造报道和未披露合成作品的影响,同时不能将每一次语法修正都视为欺诈。检测分数可以为这种判断提供参考,但编辑记录仍然更具信息价值。

搜索和社交平台的激励机制不同。它们需要大规模减少低价值生成内容。然而,一个将个别帖子标记为合成内容的平台,只要误标了合法创作者,就可能引发公开争议。

Pangram 的浏览器扩展让这种紧张关系变得可见。它可以为跨服务的帖子添加标签,并计算信息流健康度分数,用于估算展示内容中人类和 AI 材料的比例。这类分数让合成内容饱和度变得可感知,但也可能鼓励用户过度信任不透明的分类结果。

评估这些产品的组织,应从自身的决策出发,而非从检测器出发。它们应明确想要防止的伤害、可接受的错误率、升级处理程序,以及采取行动前所需的证据。

它们还需要为筛查和执法设置不同阈值。较宽松的筛查阈值可以识别更多可供审查的可疑材料;执法阈值则应要求更强的佐证,因为错误指控的代价更高。

这种区分为 Pangram 及其竞争对手提供了通往实用部署的路径。检测器可以为调查确定优先级、监测总体趋势,并测试某个内容集合是否正在变化。当单一结果直接决定成绩、工作、出版或访问权限时,它们的风险就会变得更高。

因此,Pangram 4 的竞争不止于原始准确率。客户将比较校准性、透明度、可审计性、模型更新实践,以及其自身内容上的表现。最善于处理不确定性的公司,可能比宣称拥有最大醒目数字的公司更有价值。

TechCrunch 内容报道后值得关注什么

三个信号将表明 Pangram 的扩张是在强化检测能力,还是仅仅扩大了有争议分类的数量。

第一个信号是对 Pangram 4 的独立测试。评估者应测试当前模型、经人工编辑的输出、人类化工具、短文本、译文和专业领域。结果应分别报告误报和漏报。

领域层面的结果比一个综合准确率数字更重要。在长篇学术论文上的强劲表现,并不能保证在社交帖子、法律文本、新闻稿件或学生回答上也有同等表现。公开测试集和可重复的方法将增强 Pangram 的主张。

独立测试还应检查校准性。校准良好的 80% 分数,应在可比案例中对应相近比例的正确分类。缺乏校准时,看似精确的百分比可能传达出超出模型实际能力的确定性。

第二个信号是 Pangram Image 的更广泛发布。重要证据将涉及经过编辑和重新压缩的媒体,而非完美无瑕的生成器原始输出。截图、裁剪、滤镜、拼贴、印刷图像和屏幕照片都应纳入测试。

客户应关注 Pangram 是否为每种变换发布单独的性能数据。当无害处理改变图像时,一个有用的热力图应保持稳定;如果其高亮区域不可预测地移动,审核者将难以解读结果。

跨模型泛化能力同样重要。新的图像生成器频繁出现,现有系统也会更新。如果独立研究人员能够证明它可检测训练中未纳入的模型,Pangram 的主张就会更有说服力。

第三个信号是机构如何将检测写入政策。学校、出版商、科学组织和雇主应说明,分数会触发审查还是惩罚;它们还应提供有实际意义的申诉程序。

生成作品与辅助作品之间的区分需要得到明确处理。允许校对但禁止生成段落的政策,不能只依赖宽泛的辅助内容分数。审核者需要草稿、版本历史,以及关于写作过程的陈述。

机构行为将比另一项基准测试更快揭示 Pangram 的真实影响。如果客户将其作为调查线索,改进后的检测可以强化内容治理;如果他们自动实施制裁,即使罕见的错误也会主导公众讨论。

读者也应以同样的谨慎态度看待网上指控。检测结果可以支持提出疑问,但无法重建一份完成文档背后的每一步。当作者身份重要时,请保存原始文件、保留草稿,并留存来源笔记。

对于使用 AI 的知识工作者而言,清晰的个人记录能提供切实的保护。一套结构化的第二大脑可以在正式文档成形之前,保存笔记、来源和中间思考过程。这些记录提供的上下文,是分类器无法仅从文字表述中推断出来的。

Pangram 获得 900 万美元融资表明,作者身份验证正成为一个商业类别。Pangram 4 和 Pangram Image 也显示出,这一类别正以多快的速度扩展到不同媒体形式。

TechCrunch 的内容实验得出了一个比完全信任或全盘否定都更有价值的结论。Pangram 似乎能够发现人类经常忽略的合成内容模式。但其输出仍需要解读、佐证以及公平的处理流程。

随着生成内容越来越容易制作,检测工具仍将具有吸引力。买方需要思考的问题是:他们想要的是筛查系统,还是自动化裁判?Pangram 接下来的独立评估、图像模型发布以及客户政策,将显示市场会选择哪一种角色。

 
 

免费开始

一款本地优先的AI助手,具备个人知识管理功能

为了获得更好的人工智能体验,

remio 目前仅支持Windows 10+ (x64)M-Chip Mac

你的 AI 工作伙伴

remio 一起高效工作

规划、创作、交付

一站式完成

bottom of page