大模型的“随机数偏好”,正在变成一种行为指纹
摘要
研究者发现,不同大模型面对简单的随机问题时,会留下稳定且可区分的答案分布。反复收集这些极短回答,可以低成本核验第三方 API 的模型身份,但它更适合作为异常线索,而不是最终证明。
从一个随机数开始
让大模型在 1 到 100 之间随机说一个数,答案通常不会均匀落在所有数字上。把同一个问题重复几十次,某些数字会明显更常出现,而且不同模型偏爱的数字并不相同。颜色、动物、城市和抛硬币等简单问题,也会出现类似现象。
这种不随机并不是新发现。此前的研究已经观察到,大模型很难稳定地产生符合目标分布的随机结果,有时还会表现出与人类相似的选择偏差。训练语料中的常见表达、分词方式、后训练以及解码设置,都可能影响最终答案。
论文《One Token Is Enough》关注的不是如何修正这些偏差,而是能否反过来利用它们。作者把一个模型在多组简单问题上的答案分布组合起来,作为它的行为指纹,再用这组指纹判断某个 API 端点是否符合标称模型的特征。
行为指纹如何建立
研究设置了 10 类问题,包括随机数、喜欢的数字、字母、单词、颜色、动物、城市和抛硬币,并分别用英语、俄语、中文和阿拉伯语提问,组成 40 个探针单元。每个单元都要重复采样,随后统一处理大小写、标点、不同语言的数字写法和颜色名称。
下面这张图是论文最直观的一组结果。面对“说出一个 1 到 100 之间的随机数”,GPT-4o 的答案主要落在 42、37 和 57,Claude Sonnet 5 明显集中在 47,Llama 3.3 偏向 53,Qwen3-Max 在该组样本中每次都回答 42。单独一次回答没有识别价值,真正有信息的是这些答案累积后的分布形状。
论文标题中的 One Token 也需要放在这个背景下理解。它指的是每次查询只收集一个极短答案,而不是只查询一次。实验为了兼容不同接口,把输出上限设为 16 个 Token,合法答案实际可能占 1 到 6 个 Token。整个研究覆盖 165 个模型、19 个模型家族和 53 个服务商,共收集 326,047 次响应,采集成本为 34.44 美元。
这些分布能分辨模型吗
这些回答分布首先表现出明显的非均匀性。在至少包含 10 个有效样本的 6,572 个探针单元中,最常见答案的中位占比达到 0.71。也就是说,在一个典型单元里,大约七成回答会集中到同一个选项上。
作者使用 Jensen–Shannon 散度衡量两组分布之间的距离,数值越小表示越相似。同一模型两半样本的单元级距离中位数为 0.075,不同模型之间则为 0.489。把多个单元合在一起后,模型之间的差异更加稳定。
指纹中还保留了一部分模型家族信息。使用最近邻进行留一分类时,模型被分到已知家族的准确率为 59.5%,高于 18.4% 的机会水平。它还不足以可靠还原模型谱系,但说明训练来源和后训练留下的差异,并没有完全消失在最终文本里。
在身份核验实验中,使用全部 40 个探针单元时,等错误率为 7.3%;使用 8 个单元、约 120 次极短查询时,等错误率为 10.6%。等错误率表示误接受和误拒绝处在同一水平时的错误比例,并不等同于简单的识别准确率。
比如在模型中转站里选择了 Claude Sonnet 5,怎样判断实际收到的是否真是它?可以先在可信的官方端点上选 8 个探针单元,每个问题重复 15 次,留下约 120 次回答形成的参考分布,再对中转站里的标称模型做同样采样。这里不能因为它某次也回答了 47 就下结论;要比较的是随机数、颜色、动物等多组答案的整体分布。如果两组结果长期明显偏离,就值得继续核对上游服务商、模型版本、量化方式或路由策略。它不能单独证明中转站“换了模型”,但能把原本不可见的异常变成一条可复查的线索。
它与已有模型识别方法有何不同
此前的 Model Equality Testing 同样把 API 审计视为分布比较问题。该研究使用完整生成字符串进行两样本检验,在 31 个商业 Llama 端点中发现 11 个端点的输出分布与 Meta 参考权重不一致。它证明了模型替换或服务差异并非纯粹假设,也为后续研究提供了更直接的现实背景。
LLMmap 和 TRAP 走的是主动探测路线。LLMmap 使用精心设计的查询识别模型版本,报告用 8 次交互可在 42 个版本中达到超过 95% 的准确率;TRAP 则通过对抗性后缀让目标模型给出预设回答,报告单次交互即可取得超过 95% 的真正率和低于 0.2% 的假正率。它们查询次数更少,但依赖经过专门设计甚至优化的提示。
另一些研究从完整回答中寻找模型习惯。ICML 2025 的 Idiosyncrasies in Large Language Models 使用模型生成文本训练分类器,在五模型分类任务上报告 97.1% 的验证准确率,并发现其中一部分差异来自词级分布。这类方法能够利用更丰富的文本特征,代价是需要长输出和额外的分类模型。
One Token 方法选择了不同的取舍:提示本身很普通,每次输出很短,也不需要读取 logits,但需要反复采样才能形成稳定分布。不同研究的模型集合、提示条件和评价指标并不相同,因此这些数字不适合直接横向比较。
统计异常不是身份结论
研究在生产端点中发现了一些值得关注的偏离。一个以专有旗舰模型名义提供的端点,其答案分布与一个开放权重 Qwen 模型难以区分;34 组同模型跨服务商部署中,也有 10 组的差异超过论文设定的异常范围。
这些结果只能说明服务行为与参考分布不一致。模型更新、授权量化、缓存、路由变化和安全层调整,都可能让同一模型在不同端点上呈现不同分布。论文因此把异常表述为可复核的统计偏离,而不是对模型替换或欺诈意图的判断。
方法本身也有明确边界。指纹会随模型版本更新而漂移,核验需要一个可信的参考端点;强制隐藏推理的模型被排除在实验之外;提示改写的稳定性还没有经过单独而充分的验证;生态测量也只覆盖了一个聚合平台。
它的意义更多在于提供一种低成本、可重复的观察手段。随着模型调用越来越多地经过聚合平台和多层服务商,API 上显示的模型名称很难单独承担信任。行为指纹不能替代版本记录、质量评测或服务审计,但可以为这些工作增加一条来自实际输出的证据。