CONCEPTS
全部词条
四十八个核心概念,可按知识域或难度筛选。
共 48 个词条
向量与向量空间
AI 把一切——词、图、声音、用户——都变成同一件事:一串数字
梯度与梯度下降
整个深度学习,归根到底只有一件事:沿着下坡的方向走一小步
矩阵运算与线性变换
矩阵乘法不是一堆乘法再相加,而是整个空间被一次性改写
概率与概率分布
模型从不给出“答案”,它给出的是每个可能答案的把握程度
贝叶斯定理
先相信一点,看到证据,再修正一点——这就是贝叶斯
熵与信息论
一句话越出人意料,它携带的信息就越多;语言模型的损失函数,量的正是这份“意外”
监督学习
用「问题—答案」的成对样本,让模型学会从问题直接给出答案
无监督学习
没有答案时,只能让数据自己浮现结构——而「好」的标准要重新定义
损失函数
损失函数定义了你到底在惩罚什么——换一个损失,就是换一套对错观
过拟合与正则化
模型把训练数据一字不差地背下来了,却在新数据上一败涂地
模型评估与交叉验证
准确率是最容易骗人的指标——评估方法错了,一切都白搭
偏差-方差权衡
每一个预测误差都能拆成三份:模型太简单、模型太抖动,以及世界本身的随机
神经元与感知机
神经网络最小的零件:一次加权求和,加一个偏置,再拧一下非线性
反向传播
让“求梯度”从数学苦役变成一次函数调用,这是深度学习真正起飞的那一刻
激活函数
没有它,再深的网络也只是一次线性变换
卷积神经网络
用“局部看、到处用同一把尺”取代全连接,让图像识别第一次真正可用
循环神经网络
让网络拥有“记忆”:同一个单元沿着时间反复使用,处理任意长度的序列
归一化与残差连接
让上百层的网络真正训得动:一条恒等捷径,加一次每层的重新标定
分词与 Token 化
模型不认识字,它只认识 token——切分方式悄悄决定了模型的能力与成本
词嵌入
把「词」变成「坐标」——近义词自动聚在一起,语义第一次可以被加减
注意力机制
每个位置都能直接「看到」其他所有位置,并按相关性动态分配注意力
Transformer 架构
用「全体同时开会」取代「逐字传话」,让长距离依赖一步可达
预训练与微调
先用海量无标注文本学会语言,再用少量数据专精——这是现代 AI 最省数据的范式
提示工程与对齐
让模型「有用、诚实、无害」,比单纯把它做得更大更难
图像的数字化表示
照片在机器眼里,是一层叠着一层的数字方阵
卷积运算
同一块小模板扫过全图,找出边缘、纹理与形状
图像分类
不告诉它「猫有胡须」,给它看够多的猫,它自己会总结
目标检测
从「图里有什么」到「谁、在哪里、有几个」
语义分割
给每个像素上色:不是画框,而是填色本
自监督视觉与多模态对比学习
不需要标注:让模型自己从「哪些是同一张」中学会看世界
马尔可夫决策过程
把「一步一步做决定」写成五个符号,强化学习的一切都从这里开始
价值函数与 Q 学习
不去猜「该怎么做」,而是先算出「每个选择值多少分」
策略梯度
干脆直接调整策略本身,让「好动作」出现得更频繁
探索与利用
眼前最好的选择,未必是长期最好的选择
深度强化学习
让神经网络直接看像素做决定,再用几十年前的老办法把它按住
基于人类反馈的强化学习
当「好答案」写不成公式时,就让人类来当那个奖励函数
生成模型总览
判别模型回答「这是什么」,生成模型回答「它应该长什么样」
自编码器与变分自编码器
先把信息压过一个瓶颈,再从瓶颈里把它重新长出来
生成对抗网络
造假者与鉴定师的较量:谁逼出了谁的极限
扩散模型
学会上千次微小的去噪,就学会了从纯噪声里造出一张图
潜空间扩散与条件控制
不在像素上做扩散,而是在一层被压缩的语义空间里做
多模态生成
同一个模型,同时学会说、画、动——甚至建模三维世界
训练与推理基础设施
显存决定你能训多大的模型,通信决定你要花多久;算力本身往往不是瓶颈
模型压缩
在几乎不牺牲精度的前提下把模型变小、变快、变便宜——但三者通常只能同时占两样
推理优化与服务化
训练只发生一次,推理每天发生上亿次;服务的两难在于首 token 要快、吞吐要高,而两者常常互相拉扯
检索增强生成
与其把知识硬塞进参数,不如让它留在外面、需要时再查——像开卷考试而非闭卷考试
智能体与工具调用
让模型不再只是回答问题,而是能查资料、调接口、跑代码——并在每一步的结果之后再决定下一步
安全、对齐与提示注入
模型优化的从来不是“我们真正想要的东西”,而是我们写进损失函数里的那个代理指标——两者的缝隙就是对问题的全部