AI 大模型中带有“instruct”通常与指令微调相关。在大模型的训练过程中,指令微调是其中一个重要阶段。此阶段模型被训练以理解并执行具体指令,例如翻译文本等,从而能够回答问题。指令微调阶段输入的内容通常包括三个部分,如“Instruct:请你翻译下面这段话”“Input:一段英文”“Output:一段中文”。通过指令微调,模型能够更好地按照人类的期望和具体要求进行输出。
大语言模型训练过程涉及几个关键步骤:无监督学习:这一阶段模型通过分析大量文本数据,学习到语言的基本结构和常识,具备文本补齐能力而非直接回答问题。模型将人类的知识通过向量化的方法转换,从而获得基础的语言模型。清洗出好的数据指令微调:在此阶段,模型被训练以理解并执行具体指令,如翻译文本,从而能够回答问题。这一阶段涉及的数据输入量相对于无监督学习阶段有所减少。输入内容包括3个部分,中间可能有分隔符* Instruct:请你翻译下面这段话* Input:一段英文* Output:一段中文对齐过程:通过引入人类的评价标准(奖励函数)和处理特定的格式要求,进一步优化模型的输出以符合人类的期望。这包括处理文化、道德等方面的细节,以确保模型的输出更加贴近人类的价值观。排序相信在这个过程中,OpenAI很有可能自己构建了一套强大的标注组织体系,高效,又能对抗标注人员能力强依赖。说起来人工标注符合scaling law。
“-理解中文语义”:这类描述是没有意义的,因为这是大模型的基础设定。也可以理解为环境设定,系统预设就必然理解语言,不提更好,防止他过度理解。“-评估和打分文本质量”:目标已经包含打分这个任务,这里不需要再提。“-提供文本改进建议”:这个也是在目标中重复出现。Markdown格式错误# Profile:## Goals:这样的结构,就是错误的把Goals放到了作者信息里面。应该放到# Role层级下面代表这是这个机器人的目标。Initialization “欢迎用户,并提示用户输入信息”,这里也可以细化一下,“明白以上要求后请回复:“请提供需要打分的提示词:””。这里就更加清晰的指代,用户下一句回复的信息,是需要打分的提示词。“我是小圆点,加入我的私人AI讨论组吧!vx:novatude ”
prompt这个词很多人都听到过,甚至一度还出现过prompt优化师这样的角色。那么prompt是做什么的呢?prompt其实是给到大模型输入的一段原始的输入,能够帮助模型更好地理解用户的需求并按照特定的模式或规则进行响应。对于prompt,比如可以设定“假设你是一位医生,给出针对这种症状的建议”,然后你与大模型后续的对话中,都会按照这个原始设定来展开。这里有个比较有意思的玩法,就是我们可以在prompt的设定中,要求模型按照一定的思路逻辑去回答。比如最近比较火的cot,也就是思维链,也是在prompt这个环节,对于模型的输出进行指导。这里的玩法很多,比如我们还可以让模型按照特定格式的json输出等,这样模型真的就可以变成了一个输出器来使用。