发布时间:2026/8/3 3:02:29
01-大模型核心概念 18个AI核心术语扫盲一从LLM到Transformer地基篇约 3,200 字 | 预计阅读 12 分钟 | 系列第 1/5 篇做了5年后端的小陈上周面试一家AI公司。面试官问「Context Window 是什么」他愣了一下「跟浏览器窗口有关系吗」面试官笑了笑在笔记上写了点什么。小陈知道这个岗位没了。这不是个例。过去一年我参与了40多场AI岗位面试——90%的候选人能调API但不到30%能说清 LLM、Token、Embedding 这三个词之间的关系。概念不清的代价不是面试失败而是你永远在调参却不知道自己在调什么。读这篇文章你会得到LLM 不是「会聊天的AI」——它是一个概率预测系统。理解这一点一切都不一样了Token ≠ 单词Embedding ≠ 坐标Context Window ≠ 窗口——但它们确实是理解 AI 的三把钥匙掌握这18个核心概念你就拿到了阅读任何 AI 论文和架构图的入场券目录AI → ML → DL → LLM一张图看清四层关系Transformer 与 Attention大模型的「发动机」Token、Embedding、Vector语言如何变成数学Context Window 与 Prompt模型的「视野」与「问题」Temperature、Top-p、Top-k控制模型「创造力」的三个旋钮Hallucination大模型的「说谎」问题术语速查表FAQ结语1. AI → ML → DL → LLM一张图看清四层关系 {#1}AIArtificial Intelligence人工智能是最大的圆圈。1956年达特茅斯会议上John McCarthy 提出这个概念指的是一切「让机器表现出智能行为」的技术。下棋程序是 AI自动驾驶是 AI你手机上的美颜滤镜也是 AI。MLMachine Learning机器学习是 AI 的子集。它的核心思想一句话不给机器写规则让机器从数据中学规则。传统编程是「输入 规则 → 输出」机器学习是「输入 输出 → 规则」。这场翻转发生在1980年代但真正爆发是2010年以后——因为数据够了算力够了。DLDeep Learning深度学习是 ML 的子集。它用多层神经网络所以叫「深度」来学习数据的层次化表征。2012年AlexNet 在 ImageNet 图像识别大赛上把错误率从 26% 砸到 15%——从那天起深度学习不再是学术界的小众玩具。LLMLarge Language Model大语言模型是 DL 的一个分支但它大到了改变游戏规则的地步。2017年 Transformer 架构出现2018年 GPT-1 和 BERT 证明了「先海量预训练、再针对任务微调」这条路可行。然后 OpenAI 一路把参数从 1.17 亿GPT-1堆到了万亿级别GPT-4。LLM 不是更聪明的聊天机器人——它是人类第一次造出了能对语言本身建模的系统。区别在于前者背答案后者理解问题。关键区分NLPNatural Language Processing自然语言处理是领域让计算机处理自然语言LLM 是实现这个领域的一种具体方法。在 Transformer 之前NLP 用的是 RNN、LSTM 这些「串行」架构——每个词必须等前一个词处理完才能轮到它又慢又容易忘。LLM 用 Transformer 替换了这套架构做到了并行处理 长距离依赖。术语英文全称中文一句话定义AIArtificial Intelligence人工智能让机器表现智能的统称MLMachine Learning机器学习从数据中学习规律而非写死规则DLDeep Learning深度学习用深层神经网络学习层次化特征NLPNatural Language Processing自然语言处理让计算机理解、生成人类语言LLMLarge Language Model大语言模型海量参数 海量文本训练的超大语言模型2. Transformer 与 Attention大模型的「发动机」 {#2}Transformer这个名字你每天见但它到底是什么2017年Google 的8位研究员发表了论文《Attention Is All You Need》。这篇论文提出了一种全新的神经网络架构完全抛弃了 RNN/LSTM只用一种叫「注意力」的机制处理序列数据。这篇论文现在的被引次数超过10万次——它改变了世界。为什么出现RNN 有两个致命缺陷第一每个词必须等前一个词处理完——无法并行训练极慢第二序列越长前面的信息衰减越严重即「长距离依赖」问题。Transformer 同时解决了这两个问题。Attention注意力机制解决的核心问题是当模型读一句话时它应该「关注」哪些词比如 「The cat sat on the mat because it was tired」——这里的 「it」 指什么人类一看就知道是 「cat」。但 RNN 按顺序读到 「it」 时「cat」 已经过去5个词了——信息已大量丢失。Attention 让模型处理每个词时可以同时「看」句子里的所有其他词并给每个词分配「注意力权重」。「cat」 的权重最高所以 「it」 的语义与 「cat」 绑定。Self-Attention自注意力更进一步每个词和句子里的所有词包括自己做一次注意力计算。结果是——同一个单词 「bank」在 「river bank」 和 「bank account」 里会得到完全不同的向量表示。Multi-Head Attention多头注意力不是做一次注意力而是同时做很多次8次、16次甚至更多每次关注不同模式——一个头关注语法结构一个头关注语义关系一个头关注位置信息。最后把结果拼起来。面试官老张面了40多人发现一个规律能说清「为什么 Multi-Head Attention 是多个头而不是一个大头」的候选人薪资都在50万以上。因为这说明他真正理解了一个关键原理——单一视角永远不够。AI 和人类一样需要从多个角度同时看问题。Parameters参数是模型在训练中学到的「知识」——每个参数是一个可调整的数字权重。GPT-3 有 1750 亿个参数GPT-4 传闻达到 1.76 万亿。参数越多模型能捕捉的模式越复杂——但也更贵、更慢。Parameters vs Tokens参数是模型的「脑容量」训练时学习Token 是模型的「阅读量」使用时处理。一个固定不变一个每句话都在变。3. Token、Embedding、Vector语言如何变成数学 {#3}这是 AI 扫盲中最关键的一节。如果你只能记住三个概念记这三个。Token词元是模型「读」文本的基本单位。你输入「我喜欢 AI」——模型看到的不是这四个汉字而是一串数字比如[1234, 5678, 9012]。把文本切成 Token 的过程叫Tokenization分词。为什么出现计算机只认识数字。Tokenization 是「语言 → 数字」的第一道翻译。Token ≠ 单词。一个英文长单词可能被切成多个 Token「unbelievable」→unbelieveable→ 3个 Token。中文里一个汉字通常是 1-2 个 Token。你调用 GPT-4 API 时计费单位是 Token 不是字数——同样的意思中英文消耗的 Token 量能差一倍。Embedding嵌入是把 Token 变成高维空间中的一个「位置」。每个 Token 被映射成一个 Vector向量——比如一个 768 维的数字列表[0.23, -0.45, 0.89, ..., -0.12]。为什么出现Token ID1234, 5678只是标签不包含语义信息。「猫」和「狗」的 Token ID 可能差很远但它们的语义很接近。Embedding 解决了这个问题——让 Token 的「距离」等于语义的「距离」。Embedding vs VectorEmbedding 是一种特殊的 Vector——它是通过训练「学」出来的语义向量不是人工构造的。所有 Embedding 都是 Vector但不是所有 Vector 都是 Embedding。经典例子King − Man Woman ≈ Queen。这不是比喻是真的可以算出来——把「King」的向量减去「Man」的向量、加上「Woman」的向量得到的向量与「Queen」的向量距离极近。Embedding 让「语义」变成了可以加减乘除的东西。Embedding 是 AI 世界最优雅的发明——它让「意思」变成了可以计算的东西。从此语言变成数学语义变成几何。4. Context Window 与 Prompt模型的「视野」与「问题」 {#4}Context Window上下文窗口是模型一次能「看到」的最大文本量。GPT-4 Turbo 是 128K Token——约等于一本 200 页的书。Claude 3 能到 200K。Gemini 1.5 Pro 标称 100万 Token。为什么出现早期的 LSTM 模型只能记住几十个词。Transformer 理论上可以处理无限长——但因为 Attention 的计算量随长度平方级增长实际上不可行。Context Window 是「理论能力 × 计算成本」的折中。回到小陈的面试翻车现场——Context Window 和浏览器窗口毫无关系。它更像是模型的「工作记忆」一次对话中模型能记住的最多信息。超过上限最前面的内容就会被遗忘。Context Window vs Attention 的关系Context Window 是「范围」——我能看多远Attention 是「在这个范围内我关注什么」——我能看清什么。两者共同决定了模型的理解能力。为什么它越大越好你可以把整份文档、整个代码库、整本书扔进去。Context Window 每扩大 10 倍能解决的任务类型就多一个数量级。Prompt提示词是你发给模型的那段话。但有个反直觉的事实Prompt 不是「指令」它是「上下文前缀」。LLM 的本质是「给定前缀预测下一个 Token」——它不是在执行你的命令而是在「续写」你的话。理解了这一点你就能理解为什么措辞方式能剧烈影响输出质量。Pre-training预训练是 LLM 学习的第一阶段。模型被喂入海量文本几万亿 Token任务很简单——「猜下一个词是什么」。通过无数次做这个练习模型学会了语法、事实知识和推理模式。这个阶段最贵GPT-4 级别的预训练要花几千万到上亿美元。5. Temperature、Top-p、Top-k控制模型「创造力」的三个旋钮 {#5}这三个参数决定了输出是「保守务实」还是「天马行空」。Temperature温度控制概率分布的「平滑程度」。T0 时模型每次都选概率最高的词——确定但无聊。T1 时按原始概率采样。T1 时低概率词被放大——模型开始胡说但也可能产生惊喜。为什么叫「温度」来自物理学的玻尔兹曼分布——温度越高粒子越活跃越不可预测。这里的概率分布也一样。Top-k 采样只从概率最高的 k 个候选词中选。k50 时模型只看前 50 个候选词过滤掉明显的垃圾。Top-pNucleus Sampling核采样只从「累积概率达到 p」的最小候选集里选。p0.9 时模型从「概率加起来刚好超过 90% 的那几个词」里选。Top-k vs Top-p 的关键区别Top-k 的候选数是固定的——不论上下文确定还是模糊都是 k 个。Top-p 更聪明——在确定性高的上下文中自动缩小候选范围在需要创造力时自动放大。实际使用中通常是Temperature Top-p组合Temperature 控制「混乱程度」Top-p 控制「候选范围」。参数作用调高意味着调低意味着Temperature控制随机性更创造性 / 更不可控更确定 / 更机械Top-p控制候选范围更多样的词可选只选最安全的词Top-k固定候选数量不常用不常用6. Hallucination大模型的「说谎」问题 {#6}Hallucination幻觉是 LLM 最大的未解决问题——模型生成的内容看着合理但实际上是编造的。为什么出现回到第一性原理——LLM 不是数据库它是一个概率预测系统。它每生成一个 Token只是在说「根据我见过的所有文本下一个最可能的词是什么」。它没有「真相」的概念只有「最可能被说的内容」。Hallucination 和 Creativity 是同一枚硬币的两面。Temperature 越高模型越有「创造性」——也越可能产生幻觉。压低 Temperature 可以减少幻觉但输出会变得机械无聊。一位律师用 ChatGPT 准备了一份法律文件引用了 6 个判例——听起来专业、权威。法官看了一眼发现 6 个判例全是编造的。律师被罚款 5000 美元。这个故事说明LLM 的输出永远需要人类验证。把模型当搜索引擎用是目前最危险的 AI 使用方式。目前行业在用什么策略对抗幻觉RAG下篇详讲先检索真实文档再让模型基于文档回答Grounding强制模型引用来源Chain-of-Verification让模型生成后自己再检查一遍但真相是截至 2025 年没有任何方法能完全消除幻觉。这不是 bug这是 LLM 工作方式的固有属性。清醒的认知是——把 LLM 当「草稿生成器」而非「事实数据库」。7. 术语速查表 {#7}缩写英文全称中文本质一句话AIArtificial Intelligence人工智能机器表现智能的总称MLMachine Learning机器学习从数据中学而非写死规则DLDeep Learning深度学习用深层神经网络学层次化特征NLPNatural Language Processing自然语言处理让计算机理解人类语言LLMLarge Language Model大语言模型海量参数的概率型语言预测系统—Transformer架构名基于 Attention 的并行序列处理架构—Attention注意力机制动态关注序列中相关位置的机制—Token词元模型处理文本的最小单位—Embedding嵌入Token 在高维空间的语义向量表示—Context Window上下文窗口模型单次能「看到」的最大 Token 数—Parameters参数模型训练中学会的可调权重—Prompt提示词发给模型作为生成前缀的输入文本—Hallucination幻觉模型生成看似合理但虚构的内容—Temperature温度控制输出概率分布平滑程度的参数—Top-p核采样按累积概率动态截断候选词—Pre-training预训练在海量语料上学习通用语言能力—Foundation Model基础模型大规模预训练后可供下游任务微调的通用模型8. FAQ {#8}LLM 和 ChatGPT 是什么关系ChatGPT 是产品LLM 是技术。ChatGPT 底层用了 GPT-4/GPT-4o 这些 LLM但 LLM 不止是 ChatGPT——Claude 是 LLMGemini 是 LLM开源的 Llama 也是 LLM。把 LLM 想象成「发动机」ChatGPT 是「装了这台发动机的一辆车」。Token 和单词/汉字有什么区别一个单词可能被切成多个 Token。「unbelievable」→ 3 个 Token「ChatGPT」→ 2 个 Token。中文里一个汉字通常是 1-2 个 Token。API 计费按 Token 算不是按字数——同样语义中文和英文的 Token 消耗可能差一倍。Embedding 和 Vector 是一回事吗Embedding 是特殊的 Vector。所有 Embedding 都是高维向量但不是所有向量都是 Embedding。Embedding 的核心特点是——它是模型从海量文本中「学」出来的语义表征而不是人工设计的。Context Window 是不是越大越好理论上是的但有两个代价① 响应更慢、费用更高② 模型对长文本中间部分的注意力会衰减「Lost in the Middle」问题。128K 对大多数场景够用了——除非你经常需要处理整本书或整个代码库。Hallucination 能彻底解决吗目前不能。RAG、Grounding 等方法可以大幅减少幻觉但做不到 100% 消除。根本原因在于——LLM 的本质是「预测最可能的文本」不是「查证真实的事实」。把 LLM 当草稿生成器是正确用法当搜索引擎是危险用法。参数越多模型就越聪明吗不一定。Chinchilla 定律指出在固定算力预算下模型大小和训练数据量有一个最优比例。很多大模型其实是「欠训练」的——参数很多数据没喂够。行业趋势正在从「堆参数」转向「小模型 × 高质量数据 × 更长训练」。9. 结语 {#9}三个月后小陈重新出现在了我的面试间。这一次他不仅知道 Context Window 是什么还能讲清楚它和 Attention 机制的关系、为什么长文本中间注意力会衰减、以及不同模型处理超长文本的策略差异。他拿到了 Offer。年薪涨了 60%。概念不是用来背的——它是用来让你看清底层逻辑的。当你能把 LLM 还原成一个概率预测系统、把 Embedding 还原成空间中的向量运算、把 Hallucination 还原成「概率高 ≠ 真实」时你就不是在「使用 AI」了——你是在「理解 AI」。而这就是这两种人之间最本质的区别。 下一篇预告《AI 术语扫盲二Prompt Engineering、RAG、Few-shot、CoT——用好 LLM 的 6 个核心概念》你在面试或工作中被问到的最让你懵的 AI 概念是什么评论区见。

相关新闻

2026/8/3 3:02:29

LeetCode 0877.石子游戏:脑筋急转弯(两句话道破天机)

【LetMeFly】877.石子游戏:脑筋急转弯(两句话道破天机) 力扣题目链接:https://leetcode.cn/problems/stone-game/ Alice 和 Bob 用几堆石子在做游戏。一共有偶数堆石子,排成一行;每堆都有 正 整数颗石子&…

2026/8/3 2:57:28

Unity VRM虚拟角色快速导入与配置实战指南

1. 项目概述:为什么Unity VRM是虚拟角色创作的“快车道”?如果你正在Unity里捣鼓虚拟角色,从零开始建模、绑定骨骼、刷权重,一套流程下来,少说也得几天甚至几周。这还没算上后续的表情、口型、物理这些让人头大的细节。…

2026/8/3 4:47:34

多项式回归实战:从原理到应用,掌握R²与RMSE评估模型

1. 从线性到非线性:为什么我们需要多项式回归?在数据分析或机器学习的入门阶段,线性回归通常是我们的第一个模型。它简洁、直观,假设特征和目标变量之间存在一条直线关系。但现实世界的数据往往比一条直线复杂得多。想象一下&…

2026/8/3 4:47:34

基于Unreal Engine与Omniverse构建数字孪生工厂:从架构到实战

1. 项目概述:从概念到落地的虚实融合之路“数字孪生工厂”这个词,现在听起来已经不陌生了,但真正把它从PPT上的概念图,变成一个在屏幕上实时跳动、数据与实体完全同步的“活”系统,中间隔着一条巨大的鸿沟。我接触过不…

2026/8/3 4:47:34

阿贝云免费云服务评测与使用指南

1. 阿贝云免费云服务初探第一次听说阿贝云是在一个开发者社群的讨论中,当时有几位独立开发者正在分享他们使用的免费云服务资源。作为一个长期关注云计算领域的技术从业者,我对这类"免费午餐"向来持谨慎态度,但看到多人推荐&#x…

2026/8/3 4:47:34

UML实战指南:从类图到部署图,掌握面向对象设计核心思维

1. 从“找答案”到“掌握方法”:一本经典教材的实战价值再思考最近在整理书架时,又翻出了那本经典的《UML面向对象分析与设计(第二版)》。这本书的封皮都有些磨损了,里面还夹着几张当年做练习时画的草稿纸。我注意到&a…

2026/8/3 4:42:34

OpenStack Neutron ML2插件多网络供应商支持机制解析

1. 项目概述:Neutron网络架构与ML2核心插件OpenStack Neutron作为云平台的网络中枢,其核心价值在于解耦网络服务的实现细节与上层应用。ML2(Modular Layer 2)插件正是这种设计理念的典型体现——通过标准化接口抽象底层网络差异&a…

2026/8/2 0:02:18

如何用免费工具突破游戏窗口限制:SRWE完整使用指南

如何用免费工具突破游戏窗口限制:SRWE完整使用指南 【免费下载链接】SRWE Simple Runtime Window Editor 项目地址: https://gitcode.com/gh_mirrors/sr/SRWE 你是否遇到过这样的困扰?想为心爱的游戏截图,却发现游戏不支持自定义分辨率…

2026/8/2 1:52:02

实测才敢推 AI论文网站 2026最新测评与推荐

2026年真正好用的AI论文网站,核心看生成的论文质量、低AI味、格式正确、学术适配四大指标。综合实测,千笔AI、ThouPen、豆包、DeepSeek、Grammarly 是当前最值得推荐的梯队,覆盖从免费到付费、从中文到英文、从文科到理工的全场景需求。一、综…

2026/8/1 0:03:49

2026必备!AI论文网站测评:最新推荐与深度对比

2026年真正好用的AI论文网站,核心看生成的论文质量、低AI味、格式正确、学术适配四大指标。综合实测,千笔AI、ThouPen、豆包、DeepSeek、Grammarly 是当前最值得推荐的梯队,覆盖从免费到付费、从中文到英文、从文科到理工的全场景需求。 一、…

2026/8/2 8:56:50

摆脱论文困扰!盘点2026年全网爆红的的AI论文写作工具

一天写完毕业论文在2026年已不再是天方夜谭。2026年最炸裂、实测能大幅提速的AI论文写作工具,覆盖选题构思、文献整理、内容生成、格式排版等核心场景,真正帮你高效搞定论文难题。 一、全流程王者:一站式搞定论文全链路(一天定稿首…