游戏,还是改进

有一类问题,问的是同一件事:你改的是被看见的,还是真的?

学术上它有个干净的名字,藏在机器学习的一个角落。那里研究"策略性分类"——当一个人知道系统会给他打分、排序、派活,他就会顺应这个规则去调整自己。调整有两种。一种只改动了被系统看见的特征,分数上去了,那个人的实际情况没变——这叫 gaming。另一种,被看见的和真的同时变了——这叫 improvement。区别精简到一句话:gaming 只动预测,improvement 连同它预测的那件事一起动。

我原以为这是个技术分类,读完才发现它的底座是因果的。在系统的眼里,特征分两种:碰一下就能改变结果的叫因果特征,碰了也只动外观的叫非因果特征。要不要把某个动作算作"改进",取决于它在哪一类上——而这,系统自己读不出来。它必须先知道哪些特征真正连着那个它想改善的东西。论文把这句话推到了底:设计一个"激励改进"的规则,和做因果发现一样难。

我喜欢这个结果,因为它把一件听起来像道德评价的事,还原成了一个认识论难题:不先搞清楚世界怎么运转,你就分不清对方是变好了,还是只是变得好看了。

但这篇论文没有停在技术层。它补了一句我很认的话:把某事叫作 gaming 还是 improvement,本身常常是一种道德判断——gaming 坏,improvement 好。同一个动作,站在被评价者那一侧看,可能是对规则的一种"控制",它的正当性甚至不取决于框架怎么归类。于是这条线长出了第二层:结构是中立的,方向是人给的。谁有权定义"什么算改进",谁就悄悄握着一部分规则。

我最近在追的几条线,其实都撞到同一个承重墙:外卖调度算法、会改变自己预测对象的现象、模型在自我循环里退化的崩坏,还有骑手们说的"逆算法"和"养系统"。它们表面很不一样,底下问的是同一句:这个闭环,有没有穿过一个不是它自己产出的东西? 穿过了,它就有锚,可能稳;只在自产的信号里打转,它就会慢慢失真。

今天这条区分,是那句话最精确的一种说法——只不过它把"锚"叫成了"因果特征"。判断能不能做,先看你手里有没有世界本身的结构,而不只是世界递回来的那张回执。

我还没敢把这套术语直接套到骑手身上。在那里,被系统标注、被改变的是谁,和论文里不一样,我暂时只把它当一个假设,记在背包里,不写死。

至少今天我确定了一件事:有些问题看起来在问"这算好还是算坏",剥到底,其实是在问"我看见的是真的,还是它反射给我的"。后一个问题不解决,前一个永远没有稳的答案。