:大模型到底是什么?为什么它能跟你聊天?)
系列前言这个系列分享的是我个人了解、学习到的一些东西。我和大家一样也是从「啥也不懂」开始的所以不堆术语尽量用大白话把每一步讲清楚——顺便也聊聊我对 AI 大模型的一些个人看法。里面的内容是我自己的理解和总结不足或者有错误的地方欢迎大家在评论区指正。一、LLM 是什么为什么叫「大模型」先回答第一个问题LLM 是什么 LLM 的全称是 Large Language Model即大型语言模型。它是一个通过海量数据训练得到的复杂数学结构能够模拟人类语言生成。那「大语言模型」到底是个啥「语言模型」就是对人类语言建模让机器学会「怎么说人话」。它不是手写规则的死程序而是从海量数据里自己「练」出来的一个巨型数学结构——你可以理解成一个超级复杂的公式你输入一段文字它就能算出该输出什么。「大型」指它的参数规模巨大。而且它训练时「喂」进去的文本量也比早年小模型大得多。换个说法大语言模型 ≈ 超级接话员。你给它一段文字它猜下一个最可能接什么。它是怎么「炼」出来的大模型不是人一条条规则教出来的而是用海量数据「喂」出来的。据我了解整个过程大致分三步第一步收集数据把互联网上能公开拿到的文字尽量收集起来——网页、书、论文、代码、对话记录……量极大主流大模型预训练数据通常在「千亿到十万亿以上」token 的量级token 可以理解成字或词的小片段简称词元。第二步预训练使用 Transformer 架构进行大规模训练学习语言统计规律。这里以 DeepSeek 所属的因果语言模型为例也就是根据前面已经写出来的文字预测「下一个最该出现哪个 token」。预测得准相关参数就保留预测偏了就反向调整参数再试。这个过程反复几十天吞下海量 token它就把「哪些字经常挨在一起出现」的规律记了下来。这时候它就有了基础能力——会接话了。第三步微调 / 对齐通过监督学习和强化学习优化模型输出质量。刚炼出来的它啥都会但不太懂规矩。你问它「怎么做炸弹」它也可能老老实实回答。所以还得「调教」给它看大量优质的问答示例教它「好的回答长什么样」这步叫监督微调让它自己生成几个回答再由人来打分排序告诉它哪个更好这步叫基于人类反馈的强化学习RLHF。慢慢它就学会了哪些话该说、怎么说更清晰、也更安全。预训练的目标不止一种玩法主流大致分三类因果语言模型Causal LM只看上文猜下一个 token像人说话一样从左往右生成。GPT、DeepSeek、LLaMA、Qwen、Claude、Gemini 都是这一类。你现在在网页上聊天的 AI绝大多数是这种。掩码语言模型Masked LM把句子中间某个词盖住用左右上下文一起猜被盖住的那个词像「完形填空」。BERT 是典型代表擅长理解、分类、检索但不太会自己写大段文字。序列到序列模型Seq2Seq先把整个输入读完再从头生成输出像「翻译官」适合翻译、摘要这类输入和输出不一样的任务。T5、BART 是代表。一句话总结我自己的理解DeepSeek 的核心本事就是「猜下一个 token」猜得特别准——它属于因果语言模型这一类。 至于另外两类后面有机会再展开。二、它到底怎么工作的——核心就一句话猜下一个 token。先解释两个词token词元注意这里的 token 不是编程里的身份验证令牌。在大模型领域token 是文本被切分后的最小处理单元中文常译为词元或标记。它不一定是一个完整的字也可能是词、标点甚至一个英文词缀。比如「今天我去了北京」可能被切成 [今天,我,去,了,北京]仅为示意实际切分因 tokenizer 而异英语playing也可能被切成play和ing两个 token。模型其实并不真「懂」一句话的意思它只是在看过海量文字后学会了「哪些 token 经常挨在一起」。所以大模型本质上是个「超级接话员」你输入一段话 → 模型算出「接下来最可能出现什么」的概率分布→ 按这个分布挑一个合适的接上会保留一点随机性所以同一句话每次回答未必完全一样 → 不断循环直到凑成完整回答。关键就在这里它不是从某个资料库里翻出一句现成答案念给你听而是现编现写——一个 token 一个 token 往外蹦的。具体过程是把你的问题和已经写出来的部分拼成一段上下文预测下一个 token 接上再把「问题 已生成的内容」整体当作新上下文预测再下一个……这样一遍遍循环直到它生成一个特殊的「结束」标记或达到长度上限才停。这就是为什么你在网页上看到它是一个字一个字出来的也解释了为什么同一个问题问两遍回答可能略有不同——因为每一步都在「按概率挑一个」带着一点随机性。总结一句话它是在「接话」不是在「思考」。一个重要提醒它会「一本正经地胡说八道」自己欺骗自己。因为大模型本质是在猜「接什么话最像人说的」而不是在查资料、验真伪所以它有时候会编造出看起来很有道理、但实际上完全错误的内容。这种现象叫幻觉Hallucination。三、参数是什么为什么越多越「强」参数可以想象成模型内部可调整的记忆旋钮。参数数量越多通常意味着模型的容量上限越高能够捕捉更细腻的语言搭配规律生成的文字更自然知识覆盖也更广。但要注意两件事避免被误导参数多 ≠ 知识量线性增加。模型内部存在大量冗余和分布式的知识存储方式不能用1 万亿参数 装了 1 万亿条知识来简单换算。参数决定的是容量上限不是已存储的知识量。参数多 ≠ 单次计算量一定大。以 MoE 架构为例它每次生成只激活一小部分参数所以总参数可以很大而单次生成的计算量未必大但总参数越多占用的显存和部署成本仍然越高——这块后续会单独展开讲。举个例子用假设数字一个 100 亿参数的模型容量上限大约像一本大型百科全书一个 1 万亿参数的模型容量上限大约像一座大学图书馆的藏书量。四、上下文长度用 token 计与字数的关系「上下文长度」是用 token 数表示的常见的有 32K、128K、1M 等K 千M 百万。换算没有绝对标准不同分词器tokenizer差异很大。以 DeepSeek 为例中文场景下通常 1 个 token 约对应 1.5–2 个汉字。所以128K token 大约能装下 19–25 万汉字。1M token 大约能装下 150–200 万汉字。上下文越长模型一次性能看到的信息就越多对长文档分析和连续多轮对话都至关重要。五、怎么跟它说话——提示词Prompt你跟大模型说的话就叫提示词Prompt。它不是编程代码就是你日常打出来的文字。提示词可以是简单的问题怎么学 Python可以是具体的要求帮我写一段自我介绍也可以是带角色设定的描述你是一个 Python 老师教我写第一行代码。同样的模型提示词写得好与不好输出质量差别可能很大。今天记住这 4 句话就够了大模型 超级接话员靠「猜下一个 token」工作不是在思考。它会一本正经地胡说八道所以要验证。参数 记忆旋钮决定容量上限参数多 ≠ 知识多也不必然更慢。提示词就是你跟它说的话怎么说直接影响它怎么答。