评测广场
从函数到Transformer:一部AI核心思想的极简进化史——评测飞天闪客《一小时从函数到Transformer》

从函数到Transformer:一部AI核心思想的极简进化史——评测飞天闪客《一小时从函数到Transformer》

T
Tech蜗牛
4天前 · 5 次浏览

从函数到Transformer:一部AI核心思想的极简进化史——评测飞天闪客《一小时从函数到Transformer》

视频背景:在碎片化学习的时代,找到一条能将函数、神经网络、Transformer 乃至大模型生态一气打通的主线并不容易。视频作者「飞天闪客」用约 61 分钟做了一次高密度、无废话的串联讲解。

  • 原视频信息:作者 飞天闪客,抖音链接 https://v.douyin.com/H6ju3p0Gklg/,时长约 61 分钟。
  • 版权声明:本文是对原视频观点的梳理与提炼,所有核心知识版权归原作者所有,仅供学习参考。

视频讲了什么

整条视频以“世界上的所有逻辑和知识都可以用函数表示”为起点,沿着“符号主义碰壁→连接主义靠猜→神经网络表达复杂函数→梯度下降求参数→反向传播加速训练→对抗过拟合→CNN/RNN 应对不同数据→注意力机制与 Transformer 诞生→大模型生态涌现”的路径,把 AI 从古典思路到现代前沿的演化讲成了一部思想史。

知识点拆解

1. 函数:一切逻辑的起点

早期人工智能信奉符号主义,认为只要把现实抽象为符号,再写出明确函数(寒树)就能解释一切。比如输入直角三角形两边,根据勾股定理得到斜边;输入质量和加速度,由牛顿第二定律得到力。但世界太复杂,像识别一张猫图这样人类觉得“简单得爆炸”的任务,用精确函数描述却变成史诗级难题,连翻译这种有明确规则的函数也无法做到丝滑,符号主义走到头了。

2. 从猜参数到连接主义

既然找不到精确函数,干脆“开摆”:先随便猜一个简单的线性关系(如 y=Wx+b),然后根据与真实数据的差异调整 W 和 b,让直线逐渐贴合数据。这种“蒙带猜”的方式就是连接主义,不求解析解,只求大差不差的近似。面对非线性数据,只需在线性函数外层再套一个非线性运算(激活函数,如 ReLU、sigmoid),再通过多层嵌套,就能逼近任意复杂函数。把这种嵌套结构画成图,每个节点叫一个神经元,多层网络就叫神经网络,每一层都在做线性变换+激活的事情。

3. 损失函数与梯度下降

有了网络,怎样才算“好”?定义损失函数(如均方误差)来度量预测值与真实值的总差异。目标变成找到使损失最小的 W 和 b。对于简单线性回归,直接令导数为 0 就能解出;但神经网络损失函数太复杂,只能采用“一点一点试”的策略:每次看损失对参数的偏导数(梯度),让参数往梯度反方向移动一小步,重复直到损失足够小。这就是梯度下降,学习率控制移动快慢。

4. 反向传播:连乘求导的智慧

神经网络层数多,直接求偏导太困难。利用链式法则,从输出端往输入端逐层求偏导,把“W 变一点会使损失变多少”拆成“W 变→中间量变→输出变→损失变”的连乘。这种从右向左传递梯度的过程就叫反向传播,与前向传播一起构成一次训练迭代。

5. 过拟合与那些“土办法”

模型在训练集上表现完美,在新数据上却糟糕,这叫过拟合。原因是模型太复杂,把噪声也学了。对策包括:简化模型复杂度、增加数据量(或数据增强)、提前终止训练。更精细的有 L1/L2 正则化(在损失函数中加上参数的绝对值/平方和惩罚项),以及 Dropout——训练时随机丢弃一部分神经元,强迫网络不依赖特定参数,简单粗暴但有效。

6. CNN:给图像量身定制的网络

全连接层处理图像时参数爆炸,且把像素平铺丢失了空间关系。卷积神经网络用卷积核滑动完成局部特征提取,大幅减少参数量并保留位置信息。卷积之后常跟池化层降维,再接全连接层分类。CNN 把原来的矩阵乘法换成卷积运算,非常适合图像这类静态数据。

7. 词嵌入与 RNN:让文字流动起来

处理文本首先要编码:独热编码太稀疏且无语义,词嵌入则用适中维度的稠密向量表示词,不同词向量的相似度反映语义关联,相近的词在高维“潜空间”中距离更近。要让模型理解词的顺序,循环神经网络把前一时刻的隐藏状态与当前输入一起计算,实现信息沿时间步传递。但 RNN 存在长距离遗忘和必须串行计算的问题。

8. Attention 与 Transformer:一次看全所有词

Transformer 彻底抛弃循环结构。给每个词加上位置编码,再通过 Query、Key、Value 矩阵计算词与词之间的相似度权重,然后把各词的 Value 加权求和,让每个词都在自己的视角下融合全句上下文。多个独立的“头”并行学习不同角度的注意力,最后拼接再线性变换。整体架构就是堆叠多头注意力加前馈网络,辅以残差连接和层归一化。训练时用掩码防止偷看未来词。这篇结构简单粗暴的论文《Attention Is All You Need》成为当今大语言模型的鼻祖。

9. 大模型生态与关键概念

现代大模型本质就是巨大的神经网络,用预训练获得基础能力,再通过微调适配具体任务。当参数规模足够大,涌现出推理等未刻意训练的能力。GPT 只用 Transformer 的解码器,靠“猜下一个词”变成了聊天、编程的全能选手。围绕大模型还衍生出上下文、提示词、温度采样、幻觉、检索增强生成、工作流、智能体、MCP 协议、模型压缩与量化、RLHF 等一套庞大生态。作者将这一整套脉络收束为:万物皆函数,训练即求参数,Transformer 只是把这些老概念聪明地组合了起来。

适合谁看 / 学习建议

非常适合想系统性理解 AI 技术脉络、但被公式和术语吓退的初学者。视频本身已高度简化主线,建议先原速通看一遍建立直觉,再对照这份拆解回顾每个环节的“为什么”。有基础者可重点看 Transformer 和多头注意力部分的具象讲解。如果想亲手验证,可以找一个简单的全连接网络或调用一个小 Transformer 模型,尝试改变学习率、观察过拟合现象、或玩一玩词向量相似度,远比死磕公式有效。

聚星逸视角

从「聚星逸」这类 AI 产品评测社区的视角看,飞天闪客的视频像是一张精准的“技术地图”。当你理解了神经网络从函数拟合到 Transformer 的演化,再打开聚星逸的词元网关去体验 DeepSeek、GLM、Claude、Gemini 等模型时,就不再只是“感觉回答好坏”,而能直接对应到:上下文窗口如何影响长文本,温度参数怎样调节创造力,不同架构可能导致哪些能力差异。甚至可以把所学内容变成一条评测维度——这个模型的“幻觉”倾向是否符合它对位置编码和注意力的设计?那个模型的长程推理能力是不是和其上下文工程有关?学透这条链路,你就能把黑箱产品拆开看,成为真正懂行的 AI 应用者。

#AI#深度学习#Transformer#神经网络#视频解读

评论

暂无评论,快来抢沙发