Skip to content

大语言模型

  • LLM(Large Language Model,大型语言模型),是基于Transformer 架构、海量文本数据训练的超大参数量人工智能模型,核心能力是理解、生成人类自然语言,也是当前 AIGC、对话 AI 的底层基础。

发展过程

  • 2018年:GPT-1 代表作诞生。
  • 2020年:GPT-3(1750 亿参数),划时代产品,首次出现上下文学习(In-Context Learning)。
  • 2022年:ChatGPT 问世(GPT3.5+RLHF)
  • 2023年:多模态 + 国产大模型集中落地
  • 2024年–至今:Agent 智能体 + 轻量化 + 普惠落地

代表模型

  • OpenAI 的 GPT 系列:GPT-3、GPT-3.5、GPT-4。
  • Google 的 BERT 系列:BERT、BERT-2、BERT-3。
  • Meta 的 Llama 系列:Llama-1、Llama-2、Llama-3。
  • Amazon 的 T2 系列:T2-1、T2-2、T2-3。
  • Microsoft 的 Qwen 系列:Qwen-1、Qwen-2、Qwen-3。
  • Tencent 的 ChatGLM 系列:ChatGLM-6B、ChatGLM-13B。
  • Alibaba 的 Qwen 系列:Qwen-1、Qwen-2、Qwen-3。
  • Huawei 的 MindSpore 系列:MindSpore-1、MindSpore-2、MindSpore-3。