从词向量到 Transformer 经历了什么
计算机只认识数字,要让机器处理语言,第一步是把文字变成向量。自然语言处理这几年的爆发,本质上是一条表示能力不断升级的路线:从静态词向量,到序列模型,再到注意力机制和 Transformer。
词向量:让词可计算
早期用 one-hot 表示词,向量维度等于词表大小且彼此正交,”猫”和”狗”毫无相似可言。word2vec 改变了这一点:
- 通过”用上下文预测词”或”用词预测上下文”训练出低维稠密向量
- 语义相近的词向量距离也近,甚至能做 king - man + woman ≈ queen 这样的类比运算
但词向量是静态的:”苹果”在”吃苹果”和”苹果发布新机”里是同一个向量,无法区分多义。
RNN 与 LSTM:处理序列
语言是序列,RNN 让网络按时间步逐词读入并维护一个隐藏状态,理论上能建模上下文。问题是梯度在长链上相乘,长距离依赖学不动(梯度消失)。LSTM 用门控机制缓解了这一问题,成为多年主流,但它必须串行计算,训练慢,且超长文本的记忆依然有限。
注意力机制:抓重点
翻译”我喜欢你”时,生成”you”应该重点看”你”而不是”我”。注意力机制允许模型在生成每个输出时,动态地对输入各位置加权:
- Query 与每个 Key 算相关性得分
- 得分归一化后对 Value 加权求和
从此模型不再受限于”最近的隐藏状态”,长距离依赖一步直达。
Transformer 与路线分化
2017 年《Attention Is All You Need》提出 Transformer:完全抛弃循环结构,只靠多头注意力 + 位置编码 + 前馈网络。好处是全部位置可并行计算,训练效率质变,规模才做得上去。之后路线分化:
- BERT 系:双向编码,擅长理解类任务(分类、抽取)
- GPT 系:单向解码,自回归续写,最终走通了大模型路线
回头看,从词向量到 Transformer 的演进主线只有一条:让表示携带更多上下文、让计算更能并行。今天的大语言模型,正是这条主线上规模化的产物。
本博客所有文章除特别声明外,均采用 CC BY-NC-SA 4.0 许可协议。转载请注明来源 非鱼小站!
评论
WalineDisqus







