Chat with Wiki - 大模型结构剖析

Answer

大模型的结构主要包括以下几个部分：

基础层：为大模型提供硬件支撑和数据支持，例如 A100、数据服务器等。
数据层：这里的数据层并非用于基层模型训练的数据基集，而是企业根据自身特性维护的垂域数据，分为静态的知识库和动态的三方数据集。
模型层：包括 LLm（大语言模型）或多模态模型。LLm 一般使用 transformer 算法实现，如 GPT；多模态模型用于文生图、图生图等，训练数据为图文或声音等多模态数据集。
平台层：是模型与应用间的平台部分，如大模型的评测体系或 langchain 平台等。
表现层：也就是应用层，是用户实际看到的地方。

在大模型的运作方面，对于核心的模型层，即 LLm 和多模态模型，其原理如下：

Encoder-only 模型通常适用于自然语言理解任务，如分类和情感分析，代表模型是 BERT。
Encoder-decoder 模型同时结合了 Transformer 架构的 encoder 和 decoder 来理解和生成内容，用例包括翻译和摘要，代表是 google 的 T5。
Decoder-only 模型更擅长自然语言生成任务，如故事写作和博客生成，众多熟知的 AI 助手基本都采用这种结构。

大模型的特点在于：

预训练数据非常大，往往来自互联网，包括论文、代码、公开网页等，最先进的大模型一般用 TB 级别的数据进行预训练。
参数非常多，如 Open 在 2020 年发布的 GPT-3 就已达到 170B 的参数。

Content generated by AI large model, please carefully verify (powered by aily)

References

Ranger：【AI 大模型】非技术背景，一文读懂大模型（长文）

首先为方便大家对大模型有一个整体的认知，我们先从大模型的整体架构着手，来看看大模型的组成是怎么样的。下面是我大致分的个层。从整体分层的角度来看，目前大模型整体架构可以分为以下几层：[heading3]1.基础层：为大模型提供硬件支撑，数据支持等[content]例如A100、数据服务器等等。[heading3]2.数据层[content]这里的数据层指的不是用于基层模型训练的数据基集，而是企业根据自己的特性，维护的垂域数据。分为静态的知识库，和动态的三方数据集[heading3]3.模型层：LLm或多模态模型[content]LLm这个大家应该都知道，large-language-model，也就是大语言模型，例如GPT，一般使用transformer算法来实现。多模态模型即市面上的文生图、图生图等的模型，训练所用的数据与llm不同，用的是图文或声音等多模态的数据集[heading3]4.平台层：模型与应用间的平台部分[content]比如大模型的评测体系，或者langchain平台等，提供模型与应用间的组成部分[heading3]5.表现层：也就是应用层，用户实际看到的地方[content]这个就很好理解了，就不用我多作解释了吧

Ranger：【AI 大模型】非技术背景，一文读懂大模型（长文）

在上面我们分解的大模型架构中，其他几层其实对于产品同学而言都是很好理解的。但其核心的模型层，也就是LLm和多模态，我相信很多人还是对其感到迷惑。为什么我输入一段文字后，模型就能给生成对应的回复？为什么模型可以根据我输入的文字去生成视频和图片？这里我们不摆论文和学术性的讲解，我用尽可能通俗的方式来给大家讲解一下其原理。当然有兴趣的同学可以再深入的去学习。

从 0 到 1 了解大模型安全，看这篇就够了

encoder-only:这些模型通常适用于可以自然语言理解任务，例如分类和情感分析.最知名的代表模型是BERTencoder-decoder:此类模型同时结合了Transformer架构的encoder和decoder来理解和生成内容。该架构的一些用例包括翻译和摘要。encoder-decoder的代表是google的T5decoder-only:此类模型更擅长自然语言生成任务。典型使用包括故事写作和博客生成。这也是我们现在所熟知的众多AI助手的结构我们目前耳熟能详的AI助手基本都来自左侧的灰色分支,当然也包括ChatGPT。这些架构都是根据谷歌2017年发布的论文“attention is all you need”中提出的transformer衍生而来的，在transformer中，包括Encoder，Decoder两个结构目前的大型语言模型就是右侧只使用Decoder的Decoder-only架构的模型大模型又大在哪呢？第一，大模型的预训练数据非常大，这些数据往往来自于互联网上，包括论文，代码，以及可进行爬取的公开网页等等，一般来说，现在最先进的大模型一般都是用TB级别的数据进行预训练。第二，参数非常多，Open在2020年发布的GPT-3就已经达到170B的参数在GPT3中，模型可以根据用户输入的任务描述，或给出详细的例子，完成任务但这与我们熟知的ChatGPT仍然有着很大的差距，使用ChatGPT只需要像和人类一样对话，就可以完成任务。除了形式上的不同之外，还有一个更加重要的差距，那就是安全性上的差别。