Transformer模型

你说的 tanfrom 应该是 Transformer(Transformer模型)。如果是指别的,请纠正。下面分析 Transformer 原理。

Transformer 是现在大模型(GPT、LLaMA、Claude 等)的核心结构,本质是:

利用注意力机制(Attention)学习输入元素之间的关系,并通过大量矩阵运算建立复杂映射。


1. Transformer整体结构

最简:

输入文本

   ↓

Tokenizer

   ↓

词向量 Embedding

   ↓

位置编码 Position

   ↓

Transformer Block × N

   ↓

输出概率

   ↓

下一个词

例如:

输入:

我 喜欢 吃 苹果

模型不是理解文字,而是转换:

文字
 ↓
数字向量
 ↓
数学关系
 ↓
预测下一个数字

2. Transformer核心:Attention

传统神经网络:

输入1 → 网络 → 输出
输入2 → 网络 → 输出

每个输入独立。

Transformer:

输入1
  ↘
输入2 → 相互计算关系 → 输出
  ↗
输入3

它关注:

一个词应该关注其他哪些词。

例如:

小明 把 苹果 吃了

模型学习:

吃 ← 苹果
吃 ← 小明

关系强弱不同。


3. Attention数学原理

核心公式:

genui{“trigonometry_vectors_learning_block”:{“type_id”:”TRIG_RATIO_TANGENT”,”locale_override”:”zh-CN”}}

(这里展示的是数学可视化示例;Transformer中的Attention不是三角函数,核心公式如下)

[
Attention(Q,K,V)=softmax(\frac{QK^T}{\sqrt d})V
]

三个东西:

Q(Query)

查询:

我现在想找什么信息?

例如:

想找:

谁吃?
吃什么?

K(Key)

标签:

我有什么信息?

例如:

苹果

标签:

水果
食物

V(Value)

真正的信息:

苹果的语义内容

计算:

Q × K

↓

相关程度

↓

softmax

↓

加权V

↓

得到新表示

4. 为什么叫 Transformer?

Transformer:

Transform
转换

意思:

把一种表示转换成另一种更有意义的表示。

例如:

输入:

苹果

初始:

[0.2,0.5,0.8]

经过很多层:

水果
植物
食物
甜

这些关系被编码进向量。


5. 一个Transformer Block

LLaMA结构:

输入
 |
 |
RMSNorm
 |
 |
Attention
 |
 |
残差连接
 |
 |
RMSNorm
 |
 |
Feed Forward
 |
 |
残差连接
 |
 |
输出

6. Multi-Head Attention(多头注意力)

不是只看一种关系。

例如:

一句:

苹果手机很好

不同头学习:

头1:

苹果 → 公司

头2:

手机 → 产品

头3:

很好 → 情感

结构:

              Attention1
             /
输入 ------ Attention2
             \
              Attention3


合并

↓

输出

7. Feed Forward 网络

Attention负责:

找关系

FFN负责:

处理信息

类似:

Attention

发现:

苹果和水果有关


FFN

进一步编码:

苹果=一种可食用植物果实

8. 为什么Transformer能产生智能?

因为它拥有:

1. 大规模参数

例如:

LLaMA:

7B
13B
70B

参数就是:

可调整的数学关系

2. Attention建立关系

世界本质:

对象
+
关系

Transformer学习:

词之间关系

概念之间关系

事件之间关系

3. 训练目标简单

GPT类:

预测:

今天晚上天气____

答案:

很好

不断预测。

结果:

模型被迫学习:

语言规律
世界规律
因果关系

9. Transformer 和大脑的关系

不是模拟大脑。

更像:

大脑:
神经连接产生认知


Transformer:
数学连接产生表示

共同点:

都是通过连接结构产生复杂能力

10. 从源码角度

LLaMA中的Transformer核心:

llama.cpp

↓

llama_decode()

↓

Transformer Layer

↓

Attention

↓

RMSNorm

↓

FFN

↓

Logits

对应数学:

矩阵乘法
+
向量运算
+
概率计算

一句话总结:

Transformer = 用 Attention 学习元素之间关系,再通过深层矩阵变换,把简单符号转换成包含世界规律的高维表示。

从你之前研究的“关系、规律、结构”的角度看:

对象
 ↓
关系
 ↓
关系网络
 ↓
稳定模式
 ↓
规律表示

Transformer 本质就是一个从大量数据中自动发现关系结构的数学系统

类似文章