交互数据——AI时代最有价值却正在被系统性丢弃的数据品类
导语: 当AI吃掉所有人类数据之后,什么才是新的稀缺资源?专知智库的答案是“认知数据”——模型与用户、与自身在交互过程中产生的追问轨迹、纠错信号、偏好调整。自然数据是“事实的记录”,交互数据是“认知的记录”。但最有价值的数据品类正在被系统性地浪费。
正文:
交互数据是指模型与用户、与自身在交互过程中产生的追问轨迹、纠错信号、偏好调整。它有四个独特属性:带反馈信号、自标注、无限增量、认知记录。
带反馈信号。 自然数据是静态的事实记录,不携带关于“理解是否正确”“回答是否满意”的反馈信号。交互数据是动态的认知过程记录——追问轨迹包含“当前答案不令人满意”的信号,纠错信号包含“这个方向是错的”的信号,偏好调整包含“这个方向更接近目标”的信号。
自标注。 自然数据需要人工标注,成本高、周期长、质量不稳定。交互数据不需要人工标注,它天然携带标注信息——追问本身就是标注,纠错本身就是标注,偏好本身就是标注。自标注的特征使得交互数据的采集成本极低,而标注质量极高。
无限增量。 自然数据是有限的——互联网上的公开文本、代码库、知识库已经被主流模型基本“吃尽”。交互数据是无限的——每一次推理、每一次追问、每一次纠错都在产生新的交互数据。
认知记录。 自然数据记录的是“世界是什么样”,交互数据记录的是“人类如何理解世界”“模型如何改进理解”“追问如何逼近本质”。认知规律比世界知识更稀缺、更有价值、更可迁移。
然而,交互数据的当前处境是系统性丢弃。每一次推理产生的追问轨迹、纠错信号、偏好调整,在会话结束后被丢弃。这些数据没有被采集、没有被确权、没有被封装、没有被复用。
系统性丢弃的根本原因是制度空白。现行数据确权制度覆盖了消费行为数据、医疗数据、工业数据、公共数据四类“事实数据”品类,但没有覆盖交互数据这个“认知数据”品类。制度空白的核心问题之一是计量工具的缺失——即使有制度允许交互数据确权,如果没有计量工具来衡量交互数据的价值,确权也无法落地。
专知智库发布《交互数据确权与容度词元计量白皮书》,首次系统提出“交互数据确权”与“容度词元计量”的概念、框架、方法与制度建议,旨在解决规律缓存层入口层的核心问题:哪些交互数据值得被封装为规律资产、归谁所有、价值多少。





