流隙

Flux Fissures

从行为预测到主体蒸馏:数据资本化扩张下的混淆技术与替代性设施

发布于 # Articles

2026 年初,Openclaw 使智能体技术进入大众视野;3月,诸如“同事.skill”等主体蒸馏的实践行为开始在互联网上迅速流行;4月,Meta 宣布强制收集旗下员工的所有设备使用数据进行可替代员工能力的大模型训练。种种景象表明,人的个体知识与工作能力正在被解构为数据并流向大模型,被复制和替代。

这种对人类属性的数据提取并非始于当下。正如 Alexander R. Galloway 在《不可计算》中所谱写的计算与不可计算的媒介技术史:“计算在不断吸纳不可计算性”。身体、经验等一系列原先被认为不可计算的部分被新技术分解为离散符号,被纳入外置系统中运行和计算。在今天,构建于中心化设施基础之上的监控资本主义吸纳 AI 大模型技术,并在开发者对未来技术的宏大叙事叠加下转变为了某种更加庞杂的事物。那么,我们该如何应对当下这一媒介技术环境的转变?聚焦到数据计算流程来看:这一流程如何运作?其运作逻辑和结果发生了怎样的变化?原先的抵抗策略该如何调整和转译?

正如 Joana Moll 的作品《The Hidden Life of an Amazon User》,她将一次线上购物的操作所触发的 9000 页代码,加上约 30Wh 的能量消耗直接呈现,而这些代码和能量则全部用于对用户行为的持续追踪中。在监视资本主义的逻辑中,用户的每一次界面操作都被解构为一系列数据,被投入数据分析、用户画像、行为预测等算法后,又通过广告推荐影响用户以生产价值。这一数据资本化的过程在 AI 大模型技术的介入后,形成了另一种路径:数据被掌握前沿模型和尖端算力的大公司从用户和公共平台处采集,却没有通过算法回路再度指向数据生产者,而是进入模型训练管线,变为嵌入大模型内部的能力。

数据资本化的逻辑转变和规模扩张于此发生。监控资本主义不再是目的而是手段,数据不再是静态的,可见的符号,而被转变为大模型内部不可见的生成模式;而数据进入模型的过程同时具备不可逆性。我们可以要求企业将服务器中的画像数据删除,但无法将已经嵌入模型的数据撤出;最重要的是,用户生产的数据和用户本身的距离正不断扩大,数据不再重新指涉其生产者本身,而是进入大公司掌控的泛用大模型并被用于其他各个领域。虽然用户已取得了对平台采集数据行为的知情权和同意机制,但今天我们无法准确得知在数据进入模型后将会被企业如何使用。在这里问责机制产生缺失:作为数据生产者的用户能宣告对模型的管理权和所有权吗?

这一转变由此呈现了这样一种不对称结构:企业对数据和模型的控制权通过权重、接口、定价、部署场景等方式不断扩大,但责任却停留在输入端,用户与数据生产者对下游的问责却难以发生。

那么面对数字资本化这一转变和扩张,过往针对监视资本主义的抵抗策略还能发生作用吗?由艺术家和教育工作者开发的浏览器插件 AdNauseam 通过无差别自动点击广告的方式来干扰用户画像的构建。在这里,混淆技术通过对个体用户所产生的行为痕迹进行增量式伪装来破坏数据的可用性,从而试图夺回用户的隐私权。而在面对 AI 对作者权的侵害问题时,来自芝加哥大学的团队开发了 Glaze 与 Nightshade 两款应用,前者用于帮助艺术图像进行伪装来让 AI 对图像内容产生误读,而后者通过在图像中植入错误引导以尝试对 AI 模型的生成能力产生永久性破坏。

然而,即便混淆技术在输入端作用,并在一定程度上限制了平台对用户数据的提取,但它的作用范围局限在输入端和个体用户上:或许可以在针对监视资本时保护个人隐私权,但在却无法阻止大模型通过其他公共数据完成训练,难以深入下游的问责。或许类似 Nightshade 的攻击性实践能够深入流程深处,但攻击可以被破解,被抵御和反攻击,并且难以在根本上解决权力不对称问题,还需要与其他实践相结合。

就如同去中心化运动在面对中心化的互联网基础设施时那样,我们能否以一种替代性设施和模型来对抗企业对于模型越来越集中的权力?能否用集体训练和共治的方式来掌控属于用户自己的数据计算管线和模型界面?Holly Herndon 和 Mat Dryhurst 通过公共人工智能作品《The Call》尝试给出应对:项目团队走访各地合唱团,将声音组织为数据集进入模型训练,并通过一项“数据信托”实验中来共同管理模型成果,最终通过展览的形式将模型开放给大众使用。由此数据生产者、模型管理者和使用者之间的权力得到重新分配。

虽然作为替代性基础设施的自建模型仍然存在技术与算力依赖,规模化等问题,但能够反映出了一种大模型时代下数字自治的可能性:将企业所掌控的模型生产流程以及其中包含的授权、使用等问题纳入公共协商,提升数据计算管线的整体透明性,以此在一定程度上平衡数据资本化扩张导致的权力不对称。

从监视资本主义到 AI 大模型,从行为预测到主体蒸馏,数据资本化的扩张不仅是对人类数据解构的范围扩大,也是企业对数据计算管线的控制加强。我们不仅需要在数据输入端维护用户的隐私权,更需要深入数据训练和模型管理下游,通过替代性设施的和集体共治的手段来削弱企业的控制,并以此补充问责机制的缺失。计算无法阻挡,但不可计算性同样难以穷尽,我们需要做的是将二者的边界定义权从企业手中夺回到公众集体治理的语境下,让数据计算流程中的每一位受影响者都拥有参与定义的权力。