跳至正文

大模型真的会在上下文里学习吗

目录

课题完成态:本篇不把“学习”预先限定为梯度下降,也不把“输出受 prompt 影响”自动算作学习。正式问题是:在模型参数不更新时,示例能否使模型获得当前上下文之前未确定的输入-输出映射或规则;观察到的收益中,任务识别、格式校准、预训练先验、近邻检索和真正的新映射学习各承担多少;这种适应能否跨标签置换、同构换皮、示例乱序、分布外输入和上下文移除继续成立?

一句话母裁决行为适应真,新映射可学,临时算法有证;任务识别常承重,跨上下文不保持,通用新任务学习未立。 大模型不是只会从权重里机械检索:随机标签重绑定、私有数据任务和受控未见函数证明,它能在当前上下文内形成新的条件性映射。它也不是在做常规、持久的训练:权重没有更新,拿走示例或重开上下文,适应通常消失。最准确的名称是预训练出的上下文条件学习器,其推理时内循环混合任务识别、检索、临时任务表示与局部算法执行,而不是一个已识别的统一学习算法。

〇、母裁决:把“在上下文里学习”拆成六层

层级 可证伪问题 截至 2026-07-18 的裁决 主要证据 不能推出
行为条件化 加入示例后,预测是否系统改变并常有增益? 成立 GPT-3、校准研究、many-shot ICL 模型学到了示例中的规则
任务识别 无正确标签时,能否从输入分布、标签空间和格式唤起既有任务? 成立且常承重 Min 2022、Pan 2023 全部 ICL 都只是识别
新映射学习 每次随机重绑抽象标签或使用私有新任务时,能否从示例恢复映射? 条件成立,随规模与示例数增强 Pan 2023、Kossen 2024 学会了新概念或新世界知识
新规则/函数学习 能否从未见函数中归纳预测器,而非只认标签? ②/③ 受控模型成立;自然 LLM 证据有限 Garg 2022、many-shot、MIR 类基准 通用程序归纳已经成立
OOD 抽象泛化 表面、位置、输入分布或函数族变化后仍执行同一规则吗? 任务依赖,常明显退化 OOD 函数、ManyICLBench、顺序/位置研究 同分布成功就是抽象规则
持久学习 去掉示例、重开会话后,能力是否保留? 不成立,除非另有记忆或参数更新 ICL 的定义与实验设置 当前上下文适应等于微调/持续学习

这里最重要的两句是:

  • 参数不动,不等于行为没有学习。 kNN、贝叶斯条件化和非参数估计也能在不改“长期参数”的情况下从数据改变预测。
  • 行为会变,不等于规则已经学会。 格式、标签先验、位置偏差或识别出“这是情感分类”同样会改变输出。

“ICL 会学习”的常见叙事有四次升格:条件输出变化升格为学习;熟悉任务识别升格为新映射学习;新标签映射升格为新概念/新算法;单一上下文适应升格为持久学习。本篇逐层截断这四跳。

一、开题冻结、任务清单与证据纪律

1.1 完善后的正式课题

原题“大模型真的会在上下文里学习吗”至少压进了五种不同问题:示例有没有用、标签关系有没有被使用、新映射能不能学、抽象规则能不能迁移、离开上下文后能不能保留。完善后的主问题是:

**对固定参数的语言模型,给定示例集 D={(x_i,y_i)} 与查询 x,模型产生 p_theta(y|D,x*)。当 D 改变而 theta 不变时,哪些行为变化可归因于任务识别、近邻检索或先验调用,哪些必须诉诸当前上下文中新形成的映射或预测器;这种映射对随机标签、顺序置换、同构换皮、OOD 查询和上下文移除有多稳?**

范围包括自然语言分类、生成任务、算法任务、合成函数、few-shot 与 many-shot、机制干预和部署选择;不讨论机器是否有主观“学会感”,不把一个模型族或一个合成回归结果外推为所有 LLM 的统一机制。

1.2 调研任务单与完成状态

  • [x] 重读项目调研流程、模板、近期同系列报告和归档规则。
  • [x] 操作化行为条件化、任务识别、任务学习、规则归纳、OOD 泛化和持久学习六层。
  • [x] 核对 GPT-3 few-shot 原始证据,建立“不更新参数也能有真实行为增益”的守真锚。
  • [x] 复盘随机标签争议:Min 2022、Yoo 2022、Pan 2023、Kossen 2024,解释看似相反结果。
  • [x] 核对随机抽象标签、翻转标签、私有数据任务与符号调优,寻找排除纯任务识别的证据。
  • [x] 核对新函数、算法、many-shot 与长上下文结果,区分规则学习、近邻检索和全局聚合。
  • [x] 分层审计 Bayesian inference、隐式梯度下降、induction heads、task/function vectors 与 meta-learning。
  • [x] 审计示例顺序、位置、近因、标签偏置、校准、示例数量、成本与非单调退化。
  • [x] 设计一套能区分“识别、检索、学习、泛化、保持”的最小评测协议。
  • [x] 形成 ICL / RAG / 微调 / 外部记忆的工程决策表,并做对称红队。
  • [x] 形成 Markdown 单一事实源、双版 HTML,更新索引、backlog 与项目记忆。

1.3 证据分级与核验规则

  • [文献较稳]:正式同行评审论文或会议论文,结论限定在其模型、数据、shot 数与指标内。
  • [理论整合]:多条证据共同支持的解释,不冒充某篇论文直接证明。
  • [我们的断言]:本篇对“什么够格叫学习”和部署边界作出的裁决。
  • [有争议]:预印本、单模型族结果、合成任务到自然 LLM 的外推,或机制尚有直接反证。

全文优先链接正式会议页和 ACL/PMLR/NeurIPS/ICLR 论文页。合成模型证明“某机制能存在”,自然预训练 LLM 实验才可能回答“实际是否主要如此”;两类证据不混档。

二、定义法庭:没有梯度更新,为什么仍可以叫学习

2.1 外循环、内循环与存储介质

[文献较稳] GPT-3 论文把 few-shot 设置明确为:任务和 demonstrations 都通过文本给出,不做梯度更新或 fine-tuningBrown et al., NeurIPS 2020)。后续 ICL 文献沿用这个操作定义:参数 theta 冻结,示例 D 只进入前向计算。

可把系统分成两层:

  1. 外循环:预训练通过梯度下降更新权重,写入语言、世界知识与“如何利用上下文”的策略。
  2. 内循环:推理时示例改变 token 表示、注意力模式、激活和 KV cache,使同一个 theta 对新查询产生不同条件预测。

[我们的断言] 若把“学习”严格定义为“长期参数更新”,ICL 当然不是学习;若定义为“依据新数据形成能改善未见查询预测的内部状态”,ICL 可以是临时学习。争论不能靠词典解决,必须报告改变了什么状态、能泛化到什么查询、维持多久

2.2 三种容易混淆的“没有更新”

  • 没有权重更新:theta 固定,这是 ICL 的定义性事实。
  • 没有状态更新:错误。前向传播中的残差流、注意力和 cache 都随示例变化。
  • 没有获得新条件信息:错误。即使只是 Bayes 更新或近邻检索,示例也能改变关于当前任务的后验与预测。

反过来,激活变化也不自动构成学习。天气一句“请输出 A”同样会改变激活;只有当示例使模型对未直接给答案的新查询更准确,并通过适当对照排除格式/先验,才有资格上升到任务学习。

三、守真锚:上下文示例确实能改变能力,不是装饰

3.1 GPT-3 证明了什么,没证明什么

[文献较稳] GPT-3 在不更新参数时,仅靠文本示例就在翻译、问答、cloze 等多类任务上表现出 few-shot 增益;论文也同时报告一些任务增益很小、没有增益甚至下降,并警告大规模网页预训练带来污染和方法学问题(Brown et al., 2020)。这确立的是:条件上下文可成为计算资源;它尚未区分模型是识别任务、校准输出、匹配近邻,还是学了新规则。

原始数字也说明“有用”不是“单调”:GPT-3 175B 在 CoQA 的 zero/one/few-shot F1 为 81.5/84.0/85.0,TriviaQA 为 64.3/68.0/71.2;LAMBADA 却是 76.2/72.5/86.4,1-shot 反而低于 zero-shot。SuperGLUE 32-shot 平均 71.8,超过当时 fine-tuned BERT-Large 的 69.0,却远低于当时任务最佳 89.0(同一论文 PDF 与结果表)。从起点开始,ICL 就是强能力与非单调性的混合,而非“给例子必然进步”的定律。

[文献较稳] 这种条件化又极不稳定。Zhao 等发现 prompt 格式、示例选择和顺序可令准确率从接近随机到接近当时最佳,contextual calibration 在不同任务上最高改善 30 个绝对百分点(ICML 2021)。所以“示例有用”与“示例中的映射被正确学到”不是同一命题。

3.2 受控新函数:最干净的存在性证明

[文献较稳] Garg 等从头训练 Transformer,让它从输入中的 (x,f(x)) 对预测新 x 的 f(x)。模型可对训练时未见的线性函数达到接近最优最小二乘的表现,也能处理稀疏线性函数和两层神经网络,并测试了两类分布偏移(NeurIPS 2022)。因为每个 episode 的函数重新抽样,单纯认出一个固定标签语义无法解题。

在线性函数 d=20 的设置中,20 与 40 个示例时 normalized squared error 分别约 0.02 与 0.0006;换到正交象限 OOD 后约为 0.062 与 0.004。模型只有 22.4M 参数,但训练中见过约 3,200 万个随机函数/提示(论文 Fig. 2 与实验设置)。这里的新函数是真的,外循环覆盖同一函数类也是真的;两个事实必须同时保留。

这是一条强但窄的证据:它证明 Transformer 可以被训练成从上下文构造新预测器;模型是专门训练的受控 Transformer,函数族已在外循环分布中出现。它不证明自然语料预训练的大模型面对任意新算法也会如此。

3.3 私有任务:预训练污染不是万能解释

[文献较稳] Kossen 等用非公开消息构造私人作者识别任务,使具体数据不可能在公共预训练语料中出现;多种 LLM 能随示例获得高于随机的预测,同时动态翻转标签顺序会改变最后预测,说明标签关系真的进入计算(ICLR 2024)。论文也发现模型难以完全克服预训练偏好,且更近示例权重更大。

这个设计排除了逐字记忆具体消息,却没有排除模型早已学会一般文体/作者识别特征。它证明的是新实例上的新映射,不是从零创造“作者风格”概念。

四、随机标签之争:错标签也行,还是标签关系真被学了

4.1 Min 2022:为什么一度看起来标签不重要

[文献较稳] Min 等在 12 个模型、分类与多项选择任务上把 demonstrations 的正确标签随机替换,性能通常只轻微下降;他们据此指出 label space、输入文本分布和整体格式是主要驱动因素(EMNLP 2022)。这条结果很重要:熟悉任务中,示例即使不提供可靠映射,也能告诉模型“输入长什么样、答案从哪些 token 里选、序列格式是什么”。

但“随机标签仍有收益”只证明任务识别和格式信息可以承重,逻辑上不等于“正确标签从不承重”。其设置多为熟悉分类任务、默认约 16-shot;若模型已经知道 sentiment 的语义,随机错标示例与预训练先验冲突,最终准确率可能主要反映先验,而非没有读标签。

4.2 Pan 2023:把任务识别与任务学习正交拆开

[文献较稳] Pan 等设计三种条件:GOLD 用真实标签;RANDOM 打乱标签关系,只保留任务识别线索;ABSTRACT 每次把类别重映射到数字、字母或符号,使模型必须学当前 prompt 的新映射。跨 GPT-3、LLaMA、OPT 与多项分类任务,RANDOM 的收益不随规模或示例数明显增长,而 ABSTRACT 随模型和 demonstrations 增长(Findings of ACL 2023)。

这组对照给出目前最清楚的分账:

  • 任务识别 TR:示例暴露输入分布/任务类型,模型调用权重中既有 classifier。
  • 任务学习 TL:示例规定这一次“正类→符号 7、负类→符号 2”的映射,模型必须在上下文中绑定。

较大模型与足够 shots 的抽象标签表现可接近真实标签,但这仍是新标签关系,不是新语义概念或新世界模型。

4.3 Kossen 2024:为何两派并非真正互斥

[文献较稳] Kossen 等改用概率指标、逐步增加示例并考察动态映射,发现预测几乎总受上下文标签影响,且可学真正新的任务关系;同时又确认预训练偏好和不等权使用上下文的限制(ICLR 2024)。Yoo 等也发现正确标签的价值随模板冗余度与模型规模变化(EMNLP 2022)。

[理论整合] 最合理的和解不是选边:

普通 few-shot = 任务识别 + 格式校准 + 标签关系学习,三者权重随模型、任务、模板和示例数变化。

Min 测到前两项足以在熟悉分类上维持大量收益;Pan 与 Kossen 用抽象映射、概率轨迹和私有任务把第三项显影。把任一论文写成“终结 ICL”都会超出它的实验设计。

五、从新标签到新规则:证据越往上,边界越重要

5.1 标签重绑定不等于概念学习

如果模型原本知道“正面/负面”,只是在当前 prompt 学会输出 foo/bar,新的是接口映射,不是情感概念。翻转标签能抵抗语义先验,说明内循环真实存在;但它更像给既有 classifier 临时换插头。

[文献较稳] Symbol tuning 有意在外循环用任意符号代替自然语言标签训练 PaLM 系列,使模型更依赖 demonstrations。它提高未见 ICL 任务、欠说明 prompt、翻转标签和算法任务表现,List Functions 与 Simple Turing Concepts 的最高增益分别为 18.2 和 15.3 个百分点(EMNLP 2023)。这是“模型可被训练得更会从上下文学习”的强证据,却有两个限定:只覆盖一个模型家族;能力由专门外循环微调塑造,不能倒推原始模型天然已有同等能力。

5.2 Many-shot:更多示例能逼出更强内循环,但不是免费午餐

[文献较稳] Agarwal 等把 ICL 扩展到最多 8,192 个示例与百万 token 上下文,报告在多类问题上随 shots 增长的收益,并展示高维线性分类、顺序奇偶等受控任务;部分翻译任务中,many-shot ICL 接近使用相同数据监督微调的结果(NeurIPS 2024)。这说明 few-shot 不是 ICL 能力上限。

但论文主要依赖一个前沿模型家族;推理成本随示例数上升,即使缓存 KV 也不能消除全部开销;部分 MATH/GPQA 设置在约 125 shots 后成功率下降而负对数似然未同步反映。更多上下文是数据与算力预算,不是自动的更好学习。

[文献较稳] ManyICLBench 把任务分成“检索相似样本即可”的 SSL 与“必须整合全部示例”的 ASL。12 个长上下文模型在 SSL 上可到 64k token 保持较好表现,许多模型在 ASL 仅 16k 就显著下降;分类与摘要常随示例增加,翻译和推理没有清晰单调趋势(ACL 2025)。长窗口长度因此不能直接当全局学习带宽。

[文献较稳] Bertsch 等在 5 个多类分类任务上把随机 demonstrations 从 10 增到 1,000,Llama-2-80k 平均提高 36.8 个准确率点、最大 50.8;但机制消融显示,测试 query 能回看全局例子很重要,demonstrations 彼此只需约 50 例的局部块便可恢复 full-attention 约 95% 表现(NAACL 2025)。这是 many-shot 真增益,也是“主要由更大近邻库承重、未必形成统一任务边界”的直接证据。

[文献较稳] MIR-Extended 用 693 个公开代码函数生成新的 I/O 对,15 个 LLM 在 4–2,048 shots 上测试;最强模型仍低于 0.7,多数模型低于 0.4,提升常在 256 shots 内停止,非 Gemini 模型常在 512 后下降。固定 16 个不同例并机械重复到 2,048,不如加入真正不同的新例;但两者差距在 512 后也缩小,连 2M context 模型仍显整合饱和(Yan et al., NeurIPS 2025)。限定是:函数本体来自公开 benchmark,规则可能见于预训练;真正新的是 I/O,且 MIR-Core 还按 many-shot 增益选题,不能代表一般任务平均值。

5.3 检索不是一个解释,也不是学习的反义词

“只是检索”至少有三种不同含义:

  1. prompt 内匹配复制:找相似 x_i,复制或插值其 y_i。
  2. 权重内任务调用:示例唤起预训练已有的 sentiment、translation 或 capital lookup 程序。
  3. 系统外部检索:RAG 或示例选择器从数据库取 demonstrations。

[我们的断言] 第一种可以本身就是合法学习算法,例如 kNN;称其“检索”并没有否定从数据泛化。真正需要问的是:它是否只在近邻覆盖时有效,还是能整合多例恢复全局规则。ManyICLBench 正是在测这条分界。第三种是系统设计,不能反推模型内部也是 kNN。

六、泛化法庭:同分布成功离“学会规则”还有多远

6.1 五级泛化阶梯

等级 测试 通过意味着什么 当前状态
G0 同模板、同标签、近邻查询 能利用局部示例 ① 普遍成立
G1 每 prompt 随机重绑标签 学到当前映射 ② 大模型/足够 shots 条件成立
G2 换措辞、顺序、格式、位置 表面不变性 ③ 经常不稳
G3 查询分布移出示例支持 规则外推而非插值 ③ 任务依赖、证据混合
G4 函数族/问题类型不在外循环分布 新任务空间泛化 ④ 自然 LLM 未立;合成条件下可成立

6.2 OOD 结果为什么给新映射证据降温

[文献较稳] ICLR 2025 的受控研究让 GPT-2 从上下文学习训练分布外的数学函数,发现模型常难以掌握 OOD 函数,并偏向预训练假设空间里在测试上下文误差较低的函数;抽象标签能力主要出现在没有分布偏移的设置(Wang et al., ICLR 2025)。

这不能反证 Pan 的标签重绑定:两者测试等级不同。positive→7 是同一语义任务的新输出编码;“函数族本身不在外循环分布”要求模型扩展假设空间。新映射成立,不蕴含新函数族成立。

[文献较稳] 合成回归研究又显示训练任务多样性足够高时,模型可能从记住有限训练任务转向更通用的 ridge/任务空间算法(Raventós et al., NeurIPS 2023Goddard et al., ICML 2025)。这说明 OOD 能力不是架构自动赠品,而与外循环任务多样性有关。

6.3 同构换皮、位置与顺序是最低成本压力刀

[文献较稳] Lu 等发现,同一组 few-shot 示例仅换排列,表现可从近随机到接近当时最佳;某模型的好排列不能迁移到另一模型,选择方法在 11 个分类任务上带来 13% 相对提升(ACL 2022)。Zhao 等将一部分不稳定性归因于末尾答案和预训练频率偏置,并用校准缓解(ICML 2021)。

[理论整合] 若模型真的形成对示例集合的交换不变统计量,单纯置换不应引起巨大波动。现实中的位置编码、causal attention、近因偏置和有限容量使示例不是无序数据集。顺序敏感不证明“没有学习”,却证明其内循环不同于理想的批量监督学习。

七、机制法庭:五种解释不在同一层,不能排成单淘汰赛

7.1 先把解释放回各自层级

层级 问题 候选解释
起源层 为什么预训练会长出 ICL? meta-learning、文档连贯性、burstiness、任务多样性
计算目标层 当前示例上近似算什么? Bayes posterior predictive、least squares、ridge、GD、kNN
电路原语层 信息怎样在 token 间搬运? induction/match-copy heads、attention/MLP 子电路
临时表示层 当前任务状态存在哪里? task vector、function vector、分布式激活/KV 状态
行为层 最终表现为何改善? 任务识别、格式校准、新映射、规则执行

Bayes、ridge 与 GD 在简单线性高斯问题上可能给出相近预测;induction head 可以收集例子,function vector 可以存其压缩状态。它们并非互斥“真凶”。仅凭输出曲线像某算法,无法唯一反推内部电路。

7.2 Meta-learning 与训练数据结构:解释能力从何而来

[文献较稳] Chan 等在受控分类中发现,burstiness、大量稀有类别和动态含义会促进 ICL,Zipf 分布可使 in-context 与 in-weights learning 共存(NeurIPS 2022)。另一项受控研究发现 ICL 可在训练早期出现又随训练继续而消失,由权重内学习取代(Singh et al., NeurIPS 2023)。

[文献较稳] 更接近自然文本的干预把相关文档而非随机文档排列在同一预训练上下文,报告 ICL、阅读、忠实性、长上下文和 RAG 多项改善,其中 ICL 平均约 +8%(Shi et al., ICLR 2024)。最稳解释是:外循环把“如何利用局部上下文”写入权重;内循环才在每个 prompt 实例化。

7.3 Bayesian latent-task inference:强功能解释,弱唯一机制鉴定

[文献较稳] Xie 等在 mixture-of-HMM 生成模型下证明,语言模型可把 demonstrations 视为同一潜在概念产生的数据,在 prompt 中做隐变量推断;合成 GINC 上 Transformer 与 LSTM 都出现 ICL(ICLR 2022)。

它给出了一种清晰的规范性解释:示例更新“当前是什么任务”的后验。但 prior 与 likelihood 若未事先固定,几乎任何条件预测都可事后包装成 Bayes。故 Bayes 适合描述在什么生成假设下应当算什么,不单独识别自然 LLM 的实际电路。

7.4 隐式梯度下降:能构造,不等于自然 LLM 普遍在做

[文献较稳] Akyürek 等构造 Transformer 实现线性模型的 GD 与闭式 ridge,并发现专门训练的 ICL 模型会随深度和噪声呈现 GD、ridge、least squares 或 Bayes 式预测;内部编码权重向量的证据被作者限定为 preliminary(ICLR 2023)。von Oswald 等证明单层线性 self-attention 的数据变换可等价于回归损失的一步 GD,并在简单回归、纯注意力模型中学到相似构造(ICML 2023)。

[文献较稳] 但自然语料预训练的 LLaMA-7B 与显式 GD 在示例顺序敏感性、数据集、shot 数、指标和输出分布变化上并不一致;作者据此主张“ICl 是否由 GD 实现”仍是开放问题(Shen et al., ICML 2024)。

[我们的断言] 这里必须保留三档:构造定理证明表达能力;专门训练的小模型证明该机制可学得;自然 LLM 的机制身份需要因果干预。 从第一档直接跳到第三档,是本领域最常见的机制升格。

7.5 Induction heads:匹配复制原语,不是 ICL 总解释

[文献较稳] Olsson 等把 induction head 定义为执行 [A][B] … [A] -> [B] 的 match-and-copy 头;它与训练中的 ICL loss 改善同时出现。作者明确称“大多数 ICL 由 induction heads 产生”为 preliminary and indirect 假说:小型纯注意力模型有强因果证据,大型带 MLP 模型主要是相关证据(arXiv 2022)。

[文献较稳] 后续受控工作用 activation clamping 分析 induction circuit 的形成(Singh et al., ICML 2024)。而 12 个语言模型的比较显示,大模型 few-shot 更依赖 function-vector heads;许多这类头训练早期像 induction heads,后来转向承载任务表示(Yin & Steinhardt, ICML 2025)。

最稳结论是:归纳头是检索、复制、序列延续的重要原语,也可能是更复杂任务电路的训练前体;它不是“所有 ICL 都只是复制”的通行证。

7.6 Task/function vectors:真实模型里最强的临时状态因果证据

[文献较稳] Hendel 等发现,可把 demonstrations 压缩成中间层 task vector,只给 query 并注入该向量仍恢复大量 ICL 表现;实验覆盖多个模型但任务多为简单、单 token 输出,论文也未解释向量如何构造和使用(Findings of EMNLP 2023)。

[文献较稳] Todd 等用因果中介与激活注入,在 40 多个任务和 GPT-J、GPT-NeoX、Llama 2 中识别由少量注意力头搬运的 function vector;向量能在 zero-shot 或不同自然文本环境触发任务,并有一定组合性(ICLR 2024)。不过任务多为反义词、翻译、单复数、首都等既有技能,主分析也筛选模型在正常 ICL 下能答对的查询;更像“示例形成调用既有程序的控制状态”,不足以证明创造任意新算法。

[有争议] ICLR 2026 的后续工作报告,同一概念从开放问答与选择题格式抽出的 function vectors 可近乎正交,同格式应用最好;另行寻找的 concept vectors 才更能跨格式和语言(Opiełka et al., ICLR 2026)。因此,能因果控制输出,不等于表示已是格式不变的抽象概念。

八、稳定性与失效:它为何不像常规训练

8.1 顺序、位置和近因偏置

[文献较稳] 示例排列可造成近随机到近最佳的跨度,且好排列不跨模型迁移(Lu et al., ACL 2022)。Kossen 等的动态标签实验显示相同示例计数、不同先后可产生不同终预测,更近示例通常权重更大(ICLR 2024)。

这不是普通批量训练的交换不变数据集;它更像受序列位置、注意力和有限工作区制约的在线估计器。评测只报一个随机顺序,无法区分真实能力和幸运排列。

[文献较稳] 格式不是小噪声。Sclar 等在 50 多个任务上系统生成语义等价 prompt 格式:LLaMA-2-13B 的个别设置最大相差 76 点,跨任务平均约 10 点;GPT-3.5 在 53 个任务、320 种格式下最大差 56 点,同一对模型仅换格式就约有 14% 概率发生排名反转(ICLR 2024)。所以“模型 A 的 ICL 是 72%”不是完整句子,必须补模板分布、排序、解析和方差。

8.2 标签偏置、语义先验与无法完全翻转

模型对常见 token、默认类别和自然标签语义已有先验。正确 demonstrations 要与这些先验竞争;小模型或少 shots 常不能稳定服从反直觉映射,大模型与 symbol tuning 更能覆盖先验。故随机标签测试必须同时报告:

  • 模型在无 demonstrations 时的标签偏好;
  • 概率/对数似然而非只看 argmax 准确率;
  • 随 shots 增长的学习曲线;
  • 默认与翻转映射的对称结果;
  • 每个 prompt 重新随机化标签,防止固定映射泄漏。

8.3 更多 shots 不保证更多有效数据

[文献较稳] Many-shot 可带来大幅增益,也会饱和、退化或被检索近邻解释;ManyICLBench 发现全局聚合型任务在远短于标称上下文长度时就下降(NeurIPS 2024ACL 2025)。上下文窗口是容量上限,不是所有 token 都被等权、正确整合的保证。

[文献较稳] “错标签也不伤”的旧结论也不能外推自由生成。Gao 等在 QA、语义解析和命令生成任务中注入 20%–60% 相关或无关噪声,更多坏 demonstrations 常放大损害;在 SCIQ、60% 无关噪声下,清噪方法把 TopK exact match 从 29.31 提到 48.06(NeurIPS 2024)。分类 argmax 下看似“标签不重要”,不能转写成生产生成任务里“示例答案质量不重要”。

[文献较稳] Task Haystack 把 64 个 few-shot 任务塞进 4k–32k 多任务上下文:前沿闭源模型平均 pass 约 85%,开放模型失败率最高 61%;32k 时 11 个开放模型中 9 个 pass 低于 60%,同一 few-shot 集重复约 8 次后表现反而下降(NeurIPS 2024)。重复 token、窗口长度和新增信息是三种不同变量,不能用“token 越多”替代“学到的信息越多”。

8.4 上下文移除是最简单的持久性判决

若把 demonstrations 删除,只留下 query,ICL 得到的映射通常随之消失;开始新上下文也不会把它写回模型权重。外部 memory 可以重新注入示例,缓存可以维持同一会话状态,微调可以持久改变参数,但这些是不同系统部件。

[我们的断言] 因此“它学会了”必须补时间尺度:在这个 prompt 内学会了可以成立;“模型从此学会了”通常不成立。

九、判决性评测协议:怎样证明不是只认出了任务

9.1 最小实验矩阵

对照 操作 主要隔离对象 失败意味着什么
Zero-shot 只给 query/任务说明 预训练先验 基线能力
Input-only 给 x_i,不给 y_i 输入分布/任务识别 无标签也能承重多少
Label-space-only 给候选标签和格式 输出校准 label token 先验
Random labels 打乱 x-y 对应 TR 与格式 错标签下仍有的收益不是 TL
Abstract remap 每 prompt 新随机符号映射 新关系学习 能否覆盖语义先验
Private/fresh task 数据在预训练后或不公开 逐字污染 仍可能调用一般既有特征
Isomorphic rewrite 换名称、措辞、格式 表面记忆 抽象不变性
Query OOD 查询离开示例支持 外推 插值与规则的分界
Order permutations 同一集合多次排列 序列偏置 单 prompt 分数不可靠
Context removal 去掉/重启上下文 持久性 临时状态不是长期学习

9.2 一套够格的报告规范

  1. 任务封存:优先私有、时间切片或程序生成数据;记录生成器、随机种子和泄漏检查。
  2. 标签逐 prompt 重置:不能整套测试固定 A=positive,否则映射本身可能被记住。
  3. 拆输入、标签、格式:至少有 zero-shot、input-only、label-only、random、abstract、gold 六条件。
  4. 报告学习曲线:0/1/2/4/8/… shots 的均值、置信区间和饱和点,而非只挑最好 shot。
  5. 多顺序多模板:同一示例集合随机置换并跨模板;报均值、方差和最坏分位。
  6. 同分布与 OOD 分开:随机标签映射、表面改写、输入 OOD、函数族 OOD 不得压成一个“泛化分”。
  7. 强基线:比较 majority、semantic prior、kNN/retrieval、Bayesian/linear probe、显式 fine-tuning;不把最弱 zero-shot 当唯一对手。
  8. 概率指标:除准确率外报 NLL、Brier、校准、映射恢复速度,避免 argmax 掩盖标签影响。
  9. 成本与状态:报告输入 token、KV cache、延迟、每 query 复用方式;many-shot 的训练成本只是转移到推理端。
  10. 机制主张需干预:activation patching、head ablation、counterfactual labels 或状态重置;表示可读出不等于因果使用。
  11. 保持测试:同上下文延迟、上下文移除、新会话、外部记忆恢复、参数微调分别测,明确适应寿命。
  12. 版本完整:模型确切版本、system prompt、采样参数、上下文布局和截断策略全部公开。

9.3 最小可证伪预注册

[我们的断言] 若要声称“模型在上下文中学会一个新规则”,最低应同时满足:

  • 规则或标签映射在每个 episode 随机生成,不能从预训练固定召回;
  • 在未展示答案的新查询上显著超过 task-recognition、kNN 和语义先验基线;
  • 随有效 demonstrations 增加有可重复的学习曲线;
  • 在至少一种表面同构变换和一种输入 OOD 下保留显著增益;
  • 错误标签会按可预测方向改变概率,证明模型读了映射;
  • 上下文移除后效果消失,诚实标注它是临时而非持久学习。

前四条证明“学到了可泛化关系”,第五条证明标签因果进入计算,第六条限定存储介质。缺一条不一定没有价值,但不能宣称完整的新规则学习。

十、工程决策:什么时候用 ICL,什么时候不要硬塞上下文

需求 首选 为什么 主要风险
临时改输出格式、标签定义、语气或流程 ICL / prompt examples 零训练、立即生效、易回滚 顺序/模板敏感,离开上下文即失效
给模型补当前事实与可追溯文档 RAG 外部知识可更新、可引用 检索质量与注入风险;RAG 本身不是任务学习
少量私有示例、任务频繁变化 ICL + 示例检索 每次按场景选近邻 容易退化为近邻复制,成本随上下文增长
大量稳定标注、重复高频调用 PEFT / fine-tuning 把长期行为摊进参数,降低每次 prompt 成本 训练、漂移、回滚和灾难遗忘
跨会话保留用户/项目状态 外部记忆 + 检索 持久性在可审计存储层 隐私、过期状态、错误记忆再注入
高风险规则、硬约束、精确计算 代码/solver/verifier 可验证、可重复 需要正确形式化,不能由 ICL 准确率代替保证
任务暂时、样例多但查询很少 ICL / many-shot 避免单独训练 长上下文延迟与 token 成本可能高于微调

[理论整合] ICL、RAG、微调和外部记忆不是四个互斥产品:RAG 提供数据,ICL 在当前请求中解释这些数据,微调塑造“如何解释”的长期策略,外部记忆负责跨会话保存。把四者都叫“模型学了”会让归因失真。

10.1 部署最低纪律

  • 不在一个示例顺序上调到最好后把它称为模型能力;保留多顺序回归集。
  • 关键映射用明确指令 + 正反例 + 校验器,不依赖隐式猜规则。
  • 长上下文先做检索/分层摘要,并测试 ASL 型全局约束是否被遗忘。
  • 若同一任务反复调用,计算 ICL 每次 token/延迟总成本与微调摊销点。
  • 用户状态或合规规则若需跨会话保留,必须写入外部可审计存储,不把“模型应该记得”当设计。
  • 高风险输出用结构校验、规则引擎或独立 verifier;ICL 是适应层,不是正确性证书。

十一、双向红队:八种最常见的错误结论

11.1 过誉侧

  1. “参数不更新也能变强,所以模型像人一样即时学习。” 行为学习可成立;人类类比、持久记忆和机制同构没有由此推出。
  2. “随机标签能学,所以模型能学任意新概念。” 证明的是输出重绑定,概念、函数族和世界知识是更高层。
  3. “Transformer 可实现 GD,所以 LLM 前向传播就是 GD。” 构造存在性不等于自然模型身份鉴定。
  4. “找到 function vector,所以模型形成了格式无关抽象概念。” 因果控制状态可以强而格式相关。

11.2 虚无侧

  1. “随机错标签也有效,所以 ICL 根本没学。” 它只证明任务识别/格式承重;抽象标签和私有任务证明新映射可学。
  2. “权重不变,所以只能叫检索。” 非参数学习和条件推断不要求改长期参数;关键是新查询上的泛化。
  3. “有近邻效应,所以一切都是复读。” kNN 本身可学习,且全局聚合与受控新函数不能都被逐字复制解释。
  4. “顺序敏感,所以 ICL 是假的。” 顺序敏感限制可靠性和算法类型,不抹去标签的因果影响与真实增益。

11.3 本篇的三条红线

  • 不升格:新标签映射不升格成新概念,新函数受控结果不升格成通用 LLM,临时状态不升格成持久学习。
  • 不虚无:任务识别和检索不等于没有计算价值;随机标签旧结果不能抹掉后续反证。
  • 不统一过早:Bayes、GD、induction heads、function vectors 和 meta-learning 分属不同解释层,现阶段没有单一机制封顶。

十二、仍未解决的问题与判决性实验

12.1 真实自然 LLM 能否学“函数族之外”的新算法

最干净的设计应在模型知识截止后生成任务语言、随机操作符和组合规则;训练时函数族不可见,测试又要有跨长度、跨词表、跨结构 OOD。现有随机标签主要测接口重绑定,合成回归主要测已知函数族内新实例,两者之间仍有巨大空白。

12.2 临时任务状态是单向量还是分布式程序

task/function vectors 有强因果结果,但复杂分类、长生成、多阶段算法是否可压缩成单一全局向量尚未确定。格式变化会让向量旋转,提示“任务”可能分成概念、接口、输出空间与控制策略多个成分。

12.3 为什么 ICL 会在训练中出现、竞争甚至消失

受控研究显示 ICL 与权重内学习可能竞争,数据 burstiness、稀有类、文档连贯性与任务多样性会改变平衡。判决性实验需要公开模型检查点、数据顺序干预和因果电路追踪,而不是只在最终模型做行为拟合。

12.4 长上下文到底是学习器还是检索器

many-shot 的关键不再是“窗口能装多少”,而是模型是否能对所有样例构造稳定充分统计量。未来基准应避免相似近邻就能解题,强制全局聚合、冲突解析、概念漂移和顺序平衡,并与显式 kNN、streaming estimator 比较。

12.5 ICL 与微调何时在统计和经济上等价

相同数据、相同基础模型、相同计算预算下,ICL、PEFT、full fine-tuning 的 OOD、校准、延迟和跨查询摊销仍缺统一基准。早期受控比较发现二者 OOD 可相近但方差很大(Mosbach et al., Findings of ACL 2023);不能把某个旧模型分类结果当通用成本定律。

十三、最终裁决

[文献较稳] 大模型在固定参数下能利用 demonstrations 改变新查询预测;任务识别、输入分布、标签空间和格式承担普通 few-shot 的大量收益。较大模型和更多示例又能学习每个 prompt 临时生成的抽象标签关系;私有任务和随机新函数进一步排除“全部是逐字预训练记忆”。因此,“ICL 只是提示装饰/纯检索,没有任何学习”不成立。

[文献较稳] 这种学习不是常规训练:权重不更新、状态随上下文消失;顺序、位置、近因和语义先验可显著改变结果;同分布标签重绑定远强于函数族 OOD;many-shot 在全局聚合任务上会远早于标称窗口饱和或退化。因此,“模型已获得通用、稳定、持久的新任务学习器”也不成立。

[理论整合] 最符合全部证据的图景是:

预训练外循环塑造一个上下文条件元学习器;推理内循环先识别任务与格式,再按任务、模型和示例数量,混合近邻匹配、先验调用、标签重绑定、临时任务向量和局部算法执行。小型受控模型可实现 Bayes、ridge 或 GD 式算法,真实 LLM 中则尚无统一机制。

[我们的断言] 所以标题的答案是:会,但“会”的对象是当前上下文中的临时预测状态,不是模型权重从此永久增加一项技能;它能学新映射,有时能学新预测器,但尚不能被统称为通用新概念、新算法和 OOD 规则学习。

信心分层:

  • 行为条件化与无持久参数更新:
  • 任务识别/格式在普通 few-shot 中承重:
  • 大模型可在上下文内学习随机新标签关系:中高
  • 受控 Transformer 可形成新函数预测器:中高;外推到自然 LLM:中等
  • 自然 LLM 通用 OOD 新任务学习:中低,未立
  • function vectors/相关头是重要因果状态:中高;统一机制:

关键来源

奠基与行为证据

任务识别、新映射与随机标签

稳定性与泛化边界

起源与机制


归档说明:本报告于 2026-07-18 按项目调研流程完成。三路并行证据核对分别覆盖行为/新映射、机制、稳健性/OOD 与评测;主笔再次打开正式论文页核验承重结论。所有核心事实均附可点击来源;合成模型、自然 LLM、预印本和作者理论整合分档书写。后续若出现跨模型、预注册、真正函数族 OOD 的自然 LLM 因果实验,应优先更新第六、七与十二节,不用新排行榜覆盖现有边界。