解密Prompt系列2. 冻结Prompt微调LM:T5 PET LM-BFF

发布时间:2026/9/25 18:08:02

解密Prompt系列2. 冻结Prompt微调LM:T5  PET  LM-BFF 这一章我们介绍固定prompt微调LM的相关模型他们的特点都是针对不同的下游任务设计不同的prompt模板在微调过程中固定模板对预训练模型进行微调。以下按时间顺序介绍支持任意NLP任务的T5针对文本分类的两篇PET和LM-BFF。在小样本场景固定prompt微调LM对比常规微调的优点在分类任务上比较直观我能想到的有三点(在下面PET中会细说无需额外的分类层的参数引入微调成本低标签词本身前置语义信息的引入无需重头学习可类比MRC微调和预训练的Gap更小任务转化成LM任务后一致性高T5paper: 2019.10 Exploring the Limits of Transfer Learning with a Unified Text-to-Text TransformerTask: EverythingPrompt: 前缀式人工promptModel: Encoder-DecoderTake Away: 加入前缀Prompt所有NLP任务都可以转化为文本生成任务T5论文的初衷如标题所言是为了全面公平的对比不同预训练和迁移策略的贡献和效果避免在A模型上效果不好的预训练目标在B上可能效果更优的情况对比项包括预训练目标语言模型乱序还原MLM(不同的掩码率)Span掩码, etc预训练数据构建C4数据集从C4抽取不同领域语料来训练模型架构: Encoder-DecoderDecoder OnlyEncoder Only迁移策略逐步解冻全量微调局部微调其他多任务预训练模型大小说句题外话再看论文结果发现Encoder-Decoder的模型结果SpanMLM损失函数效果最好。不知道这是否是谷歌押注T5而没有像OpenAI一样选择Deocder结构的原因。具体对比结果这里不细说本文只关注T5为了公平对比以上差异提出的Text2Text的通用建模框架用相同的模型相同的预训练相同的损失函数和解码方式把文本分类摘要翻译QA都转化成了生成任务而转化的方式就是通过加入前缀prompt。针对不同的下游微调任务我们看下T5提出的Text2Text是如何构建prompt模板的WMT英语到德语的翻译任务输入是’translate English to German:‘input, 输出是翻译结果CNN Mail摘要任务: 文本摘要任务输入是‘Summarize:’input输出是摘要MNLI任务输入是’mnli hypothesis:‘假设‘premise:’叙述输出是contradiction, entailmentneutralSTS文本相似任务输入是’stsb sentence1:’input1‘sentence2’input2, 输出是1~5的打分离散化问答SQuAD任务输入是’question:提问 ‘context:’上下文输出是答案不难发现在T5的时代prompt模板的构建还比较粗糙更多是单纯的任务名称任务类型来区分不同的NLP任务只是让模型在解码时多一层条件概率既给定不同prompt前缀在解码时采用不同的条件概率attention。并没有太多从语义和上下文关联的角度去进行prompt模板的构建我猜这是T5在论文中提到他们尝试了不同的prompt模板发现效果影响有限的原因哈哈因为都不太好所以没啥差异不不能否定T5在通用LM上做出的贡献~PET-TC(a)paper a: 2020.1 Exploiting Cloze Questions for Few Shot Text Classification and Naturalprompt: 单字完形填空式人工PromptTask Text ClassificationModel: Roberta-large, XLM-RTake Away: 加入完形填空式Prompt把文本分类任务转化成单字MLM和第一章的LAMA相似PET-TC也是把输入映射成完形填空式的prompt模板对掩码词进行预测作为分类标签。不过PET没有直接使用prompt而是用了半监督的方案。用多个prompt模板微调模型后对大规模无监督数据进行预测然后在伪标签上进行常规的模型微调哈哈绕了一个圈最后还是输出的常规微调的模型。我大胆猜测作者很看好prompt范式在微调时引入的前置语义信息以及无额外参数的设定但是对不同prompt和answer模板带来的不稳定性感到头疼于是搞出这么个折中的方法~prompt Answer EngineerPET针对每个数据集人工设计了prompt模板和Answer词对标签的映射。针对单双文本输入分别举两个例子以下ab为原始输入文本_位置为MASK词单输入Yelp评论1~5星打分标签词分别为terrible, badokaygoodgreat双输入AG’s News新闻四分类问题, 标签词分别为分类名称WorldsSports, Business, Science/Tech,可以看出作者构建prompt模板的思路是尽可能还原文本所在的上下文场景Answer词的选取是一对一的构建模式每个label只选取一个词来表示。固定prompt微调LM完形填空式的prompt模板在微调时的优势我认为主要有以下三点没有额外参数的引入常规微调需要引入hidden_size * label_size的额外参数classify head作为每个标签对应的空间表征这部分需要针对下游任务重头学习。而完形填空的token是在原始vocab中的于是只需要调整标签词的预训练表征让它在label上线性可分即可前置语义信息的引入因为标签词的选取本身符合label的原始语义例如以上YELP评论打分中的5个形容词本身就是隐含了评论质量信息的所以会引入部分前置信息避免重头学习这一点和MRC有些相似预训练和微调的一致性高都是解决完形填空问题学习目标一致微调的损失函数是交叉熵作者没有引入额外参数而是把MASK位置上模型的预估logits在label上归一化来得到分类预测。例如上面的AG新闻分类任务先得到MASK位置worldssportsbusinessscience这四个词的预测logits然后归一化得到预估概率再和分类标签计算交叉熵。为了避免灾难遗忘作者在下游任务微调时加入了预训练的MLM任务于是微调的损失函数如下L(1−α)LCEαLMLM半监督蒸馏这部分的设计可以和prompt的部分分开来看是一个半监督方案。以上每个任务对应的多个prompt模板分别固定prompt微调LM得到一版模型然后在大量的未标注样本上进行预测再对多个模型的预测值进行加权得到伪标签。最终在为标签上使用常规的微调方案加classifier head训练模型作为输出这一步类比知识蒸馏。所以PET最后输出的还是常规的监督微调模型Prompt只是被当做了一种半监督方案。效果上在小样本的设定上比直接使用监督微调都有一定的效果提升。作者还做了iPET对以上过程通过迭代逐步扩大数据集提高伪标签准确率的方案不过这么麻烦的实现一点都不适合我这种懒人哈哈就不细说了~针对PET有几点疑问完形填空类的prompt在微调过程中可能的灾难遗忘是否因为对label词的微调偏离了词在原始文本中语义表征以及和其他词的相对位置prompt模板差异带来的效果差异尚未解决人工构建的prompt模板不一定是最优的Answer词单token以及和label一一对应的设定限制性较强。这部分在后面的续作里作者做了改良后面介绍的几个模型大多是基于PET上述问题的改良~PET-TC(B)paper b: 2020.9 It’s not just size that matters: Small language models are also few-shot learners.Prompt 多字完形填空式人工PromptTaskText ClassificationModel: Albert-xxlarge-v2Take Away: 支持多字的完形填空Prompt效果超越GPT3这篇paper和上面的PET-TC是同一作者算是上文的续作主要优化了Answer词单token设定支持多个token作为标签词不过限制性依旧较强是预先设定任务最大的token数然后使用最大token数作为MASK数量而非动态的任意数量的MASK填充。论文对推理和训练中的多MASK填充做了不同的处理。在推理中需要向前传导K次如下图所示使用标签最大的label词长度K生成k个MASK位置对K个位置同时预估得到K个预估词选取概率最高的1个词进行填充针对填充后的新文本对剩余K-1个位置再进行预估直到所有位置都被填充分类概率由所有填充标签词的概率累乘得到p(Y−1|x)P1M(ble|x)∗P2M(terri|~x)在训练过程中为了提升效率论文使用了一次向前传导对多个位置同时完成预估这时MASK长度是所有标签的最大长度。例如情感分类问题terr##ble长度为2great长度为1这时MASK填充长度为2,great只取第一个MASK词的概率后面的忽略概率计算如下p(Y−1|x)P1M(ble|x)∗P2M(terri|~x)p(Y1|x)P1M(great|x)(1)(2)其他部分和PET基本一样这里不再重复。效果上这篇论文换成了Albert-xxlarge-v2模型和GPT-3 few-shot在superGLUE上进行效果对比。不过以下参数对比并不太合理虽然Albert是层共享参数但是推理速度并无提升12层的xxlarge模型参与计算的参数量级应该是223M*12~2B所以并不是严格意义上的小模型。调整参数后32个小样本上PET的效果也是超过同等量级甚至更大的GPT3在few-shot上的效果的LM-BFFpaper: 2020.12 Making Pre-trained Language Models Better Few-shot LearnersPrompt: 完形填空自动搜索promptTask: Text ClassificationModel: Bert or RobertaTake Away: 把人工构建prompt模板和标签词优化为自动搜索LM-BFF是陈丹琦团队在20年底提出的针对few-shot场景自动搜索模板和触发词的Prompt方案prompt模板延续了PET的完型填空形式把人工构建prompt和标签词的构建优化成了自动搜索。论文先是验证了相同模板不同标签词,和相同标签词不同模板对模型效果都有显著影响如下以下介绍自动搜索的部分标签词搜索考虑在全vocab上搜索标签词搜索空间太大在少量样本上直接微调选择最优的标签词会存在过拟合的问题。作者先通过zero-shot缩小候选词范围再通过微调选择最优标签词。如下固定prompt模板(L)作者用训练集中每个分类©的数据在预训练模型上分别计算该分类下MASK词的概率分布选择概率之和在Top-k的单词作为候选词。再结合所有分类Top-K的候选词得到n个标签词组合。这里的n和k都是超参在100~1000不等。然后在n个候选标签词组合中针对微调后在验证集的准确率选择效果最好的标签词组合。prompt模板搜索固定标签词作者使用T5来进行模板生成让T5负责在标签词前、后生成符合上下文语义的prompt指令再在所有训练样本中选择整体表现最优的prompt模板。如下, 固定二分类的标签词是great和terribleT5的模型输入为InputMASK标签对应标签词MASK让模型来完成对MASK部分的填充。现在预训练模型中通过Beam-Search得到多个模板再在下游任务中微调得到表现最好的一个或多个prompt模板以上自动搜索prompt和标签词得到的部分结果如下该说不说这种方案得到的标签词至少直观看上去比AutoPrompt合人理类不能少懂固定prompt微调LM经过以上搜素得到最优标签词组合和prompt模板后作者的微调过程模仿了GPT3的few-shot构建方式。如上图先把输入填充进prompt模板再从各个分类中各采样1个样本作为指令样本拼接进输入为待预测文本补充更丰富的上下文一起输入模型。在训练和推理时补充的指令样本都是从训练集中采样。同时为了避免加入的指令样本和待预测样本之间差异较大导致模型可能直接无视接在prompt后面的指令样本作者使用Sentence-Bert来筛选语义相似的样本作为指令样本。效果上作者给出了每类采样16个样本的小样本场景下 Roberta-Large的效果可以得到以下insights部分场景下自动模板是要优于手工模板的整体上可以打平自动搜索是人工成本的平价替代加入指令样本对效果有显著提升在16个样本的few-shot场景下prompt微调效果是显著优于常规微调和GPT3 few-shot效果的
延伸阅读

更多相关文章

2026/9/26 15:07:36

Unity HUD UI性能优化:从Canvas重建到Draw Call的工程化解决方案

1. 项目概述:为什么HUD UI是性能“重灾区”在Unity3D游戏开发中,尤其是移动端或大型多人在线游戏,HUD(Head-Up Display,平视显示器)UI的性能表现,往往是决定游戏能否流畅运行的关键瓶颈。它不像…

2026/9/26 15:05:09

从记忆型AI到开工型Agent:事件模式与追加写入实战

1. 从“记忆型 AI”到“开工型 Agent”的认知转变1.1 为什么“能记住”不等于“能干活”过去大半年,我陆陆续续试过不少所谓的个人 Agent 项目。一开始我也被“记忆”这个卖点吸引——能记住我的偏好、能回忆上次聊到哪、能在我提到某个项目时自动关联历史上下文。听…

2026/9/26 15:05:09

深入理解Linux O(1)调度算法:进程优先级、双队列与性能调优

有段时间只要服务器 load average 一高,我就习惯性先重启机器。直到一次线上业务进程把 CPU 占满,监控脚本迟迟跑不动,我才意识到:如果不理解 Linux 到底按什么规则把 CPU 分给进程,排查这类问题就只能靠猜。这篇文章把…

2026/9/26 15:05:09

ESD S20.20-2021静电防护体系落地指南:从标准条款到产线检查表

做电子厂质量或者设备的工程师,最近应该没少听到 ESD S20.20-2021 这个编号。客户审厂、体系审核、新项目导入,经常会被问一句:你们的静电防护控制程序,是按这个标准做的吗?如果你刚好负责这块,手头又缺一份…

2026/9/26 15:05:09

STICA:对象中心世界模型如何提升强化学习决策与泛化

我看一个自动驾驶决策日志的时候,发现一个特别有意思的现象:模型在仿真里已经能稳稳跑完绕障任务,但测试时路边多了一个气球广告牌,车就开始左右摇摆。排查到底层才发现,我把整帧画面直接压成一个特征向量交给了策略网…

2026/9/26 15:00:09

多Agent系统失控与治理:FCoP协议与调用链追踪实战

1. 多 Agent 系统为什么会走向失控1.1 从单体 Agent 到多 Agent 协作的演进逻辑2024 年之前,大多数团队对 Agent 的理解还停留在“一个模型加几个工具函数”的阶段。一个 Agent 负责理解用户意图、调用 API、返回结果,链路短、状态少、出问题也好排查。但…

2026/9/25 21:00:17

GAMP 5 基于风险的计算机化系统验证:软件分类与审计追踪实践

简介:《A Risk-Based Approach to Compliant GxP Computerized Systems》即业内熟知的GAMP 5指南,面向制药企业质量与IT合规人员、验证工程师及计算机化系统管理者,用于解决GxP法规环境下系统合规性难以科学落地的问题。文档以风险管理为主线…

2026/9/25 20:59:52

安全托管MSSP实战:从静态防御到人机协同的攻防运营与应急响应

简介:这份PPT围绕互联网业务安全托管服务展开,面向企业安全负责人、IT运维人员及关注MSSP/MSS选型的读者,重点回应传统安全过度依赖人工、碎片化静态防御难以对抗产业化攻击等痛点。资源共1个pptx文件,包体约30.63MB,以…

2026/9/26 0:04:28

画质修复APP怎么选?Wink影像修复能力与产品实力解析

现如今手机拍摄场景愈发丰富,演唱会直拍、漫展记录、老视频翻新、日常vlog录制,都会遇到画面模糊、噪点多、曝光失衡等问题,不少用户在挑选工具时比较在意一款画质修复APP能够兼顾修复效果与自然质感。Wink作为美图公司推出的全球化AI影像增强…

2026/9/26 0:04:28

超低能耗建筑K值要求能否满足?浙东铝业建筑型材解析

核心摘要浙东铝业的超低能耗系统门窗产品,资料显示保温性能可达 K≤1.4W/(㎡K),能够对应上海地区超低能耗住宅对门窗保温性能的应用需求。判断建筑是否满足超低能耗要求,不能只看铝型材本身,还需要结合玻璃、隔热条、密封系统、开…

2026/9/25 20:55:38

USB Type-C PCB布局分区设计:电源、高速信号与PD协议全攻略

做硬件这行,Type-C接口算是典型的“看着简单,做起来全坑”的东西。光引脚就24个,高低速信号、电源、控制线全部塞在一个小小的连接器里,如果PCB布局不做规划,打样回来基本就是“插上没反应”、“高速掉线”、“静电一打…

2026/9/25 18:41:36

系统编程学习原型如何补齐稳定性边界

系统编程学习原型如何补齐稳定性边界预算有限时&#xff0c;我先优化明显多余的复制&#xff0c;而不是猜测性地换容器。用借用传递只读数据通常就能减少分配&#xff1a; fn parse(line: &str) -> Result<Item, Error> { /* ... */ }用基准确认热点确实在分配&am…

2026/9/25 18:34:56

雨花区哪家财务公司代理记账比较好?

在雨花区&#xff0c;企业处理财税事务常常面临诸多挑战&#xff0c;选择一家靠谱的财务公司至关重要。湖南巨勤财务管理咨询有限公司就是本地正规实体财税服务机构&#xff0c;深耕本地工商财税行业多年&#xff0c;熟悉当地工商局、税务局最新政策与申报流程。主营公司注册、…

还想了解更多?直接咨询顾问

免费诊断 + 免费方案 + 透明报价。

全国咨询热线400-8866-253
免费获取方案
☎咨询二维码 ☎ ↑