Chat with Wiki - 入门大模型的简要学习清单

Answer

以下是一份大模型入门的简要学习清单：

理解大模型的底层原理：
- 了解预训练阶段大模型的学习内容和数据量，例如以 GPT-3 为例，其训练使用了约 4990 亿 token 的数据集，相当于 86 万本《西游记》。
- 熟悉 Transformer 模型架构，这是处理文本内容的经典架构，虽然具体细节不清楚不影响使用大模型，但感兴趣可通过相关链接深入了解。
掌握大模型的概念：
- 通俗地说，大模型通过输入大量语料让计算机获得类似人类的“思考”能力，能进行文本生成、推理问答、对话、文档摘要等工作。
类比学习大模型的训练和使用过程：
- 找学校：训练大模型需要大量计算，GPU 更合适，只有有资本购买大量 GPU 的才有能力训练自己的大模型。
- 确定教材：大模型需要大量数据，几千亿序列（Token）的输入基本是标配。
- 找老师：选择合适的算法让大模型更好理解 Token 之间的关系。
- 就业指导：为让大模型更好胜任某一行业，需要进行微调（fine tuning）指导。
- 搬砖：就业指导完成后，进行如翻译、问答等工作，在大模型里称为推导（infer）。
了解 Token：
- Token 被视为模型处理和生成的文本单位，可以代表单个字符、单词、子单词等，在将输入进行分词时会对其数字化，形成词汇表。

Content generated by AI large model, please carefully verify (powered by aily)

References

[title]走入AI的世界[heading2]3清楚原理：必须理解的核心概念和听得懂的底层原理[heading4]3.2大模型的底层原理那么预训练阶段大模型就行学了些什么，又学了多少内容呢？以GPT-3为例，训练他一共用了4990亿token的数据集（约570GB文本），这其中绝大多数都是来源于高质量的网页、书籍数据库、维基百科等的内容，可能你对4990亿token这个数字没有直观的体感，那么我们不妨做个换算，它大概相当于86万本《西游记》，人生不过3万天，也就是说，即使你不吃不喝不睡，以每天读完一本《西游戏》的阅读速度去看这些资料，也大概要28.6辈子才能读完。转换器模型（Transformer）：Transformer这个单词你可能很陌生，但它的另一个中文翻译“变形金刚”你一定不陌生，Transformer是一种处理文本内容的经典模型架构，图16中左半部分就是GPT-1所使用的Transformer架构图（右边则是经典的Diffusion模型架构图，用于图像生成）。图16 Transformer和Diffusion关于Transformer的具体细节，即使不清楚，也并不太会影响你用好大模型，因此我们不做更多展开讨论了，感兴趣的朋友可以移步这里：[【官方双语】GPT是什么？直观解释Transformer |深度学习第5章_哔哩哔哩_bilibili](https://www.bilibili.com/video/BV13z421U7cs/?vd_source=951ca0c0cac945e03634d853abc79977)[Transformer Explainer:LLM Transformer Model Visually Explained](https://poloclub.github.io/transformer-explainer/)

大模型入门指南

[title]大模型入门指南[heading1]什么是大模型通俗来讲，大模型就是输入大量语料，来让计算机获得类似人类的“思考”能力，使之能够理解自然语言，能够进行『文本生成』、『推理问答』、『对话』、『文档摘要』等工作。既然是学习，那我们就可以用『上学参加工作』这件事来类比大模型的训练、使用过程：1.找学校::训练LLM需要大量的计算，因此GPU更合适，因此只有购买得起大量GPU的贵族学校才有资本训练自己的大模型2.确定教材::大模型顾名思义就是大，需要的数据量特别多，几千亿序列（Token）的输入基本是标配3.找老师::即用什么样的算法讲述“书本”中的内容，让大模型能够更好理解Token之间的关系4.就业指导::学完书本中的知识后，为了让大模型能够更好胜任某一行业，需要进行微调（fine tuning）指导5.搬砖::就业指导完成后，下面就要正式干活了，比如进行一次翻译、问答等，在大模型里称之为推导（infer）在LLM中，Token([2])被视为模型处理和生成的文本单位。它们可以代表单个字符、单词、子单词，甚至更大的语言单位，具体取决于所使用的分词方法（Tokenization）。Token是原始文本数据与LLM可以使用的数字表示之间的桥梁。在将输入进行分词时，会对其进行数字化，形成一个词汇表（Vocabulary），比如：The cat sat on the mat，会被分割成“The”、“cat”、“sat”等的同时，会生成下面的词汇表：|Token|ID| |-|-| |The|345| |cat|1256| |sat|1726| |…|…|

大模型入门指南

[title]大模型入门指南原文地址：https://mp.weixin.qq.com/s/9nJ7g2mo7nOv4iGXT_CPNg作者：写代码的西瓜随着ChatGPT的到来，大模型([1])（Large Language Model，简称LLM）成了新时代的buzzword，各种GPT产品百花齐放。大多数人直接用现有产品就可以了，但对于喜欢刨根问底的程序员来说，能够在本地运行会更有意思。但由于没有相关背景，笔者一开始在接触时，很多GitHub上的搭建教程看得是云里雾里，而且这方面的介绍文章要不就是太晦涩难懂，要不就是太大众小白，于是就有了这篇文章，主要介绍笔者在搭建大模型过程中学到的知识，以及如何在macOS上运行大模型。笔者水平有限，不足之处请读者指出。