FXJ-WIKI
搜索
Ctrl
+
K
FXJ-WIKI
搜索
Ctrl
+
K
00-收件箱
excalidraw
Excalidraw Test.excalidraw
飞天闪客内容总结.excalidraw
Algorithms
ACMExercises
AtCoder
ABC
ABC-334
ABC-338
ABC-339
ABC-340
ABC-341
ABC-342
ABC-343
ABC-344
ABC-345
ABC-346
ABC-347
ABC-348
ABC-349
ABC-350
ABC-351
ABC-352
ABC-356
ABC-357
ABC-358
ABC-360-temp
ABC-366
ABC-369
ABC-371
AGC
AGC-012C
ARC
ARC-179
CodeForces
div1+div2
CF-1930-div1+div2
CF-1991-div1+div2
CF-1994-div1+div2
CF-2002-div1+div2
div2
CF-1918-div2
CF-1922-EDU-div2
CF-1923-EDU-div2
CF-1925-div2
CF-1928-div2
CF-1929-div2
CF-1934-div2
CF-1935-div2
CF-1937-div2
CF-1944-div2
CF-1946-div2
CF-1957-div2
CF-1969-EDU-div2
CF-1981-div2
CF-1988-div2
CF-1993-div2
CF-1995-div2
CF-1997-EDU-div2
CF-1998-div2
CF-2004-EDU-div2
div3
CF-1878-div3
CF-1907-div3
CF-1921-div3
CF-1927-div3
CF-1931-div3
CF-1932-div3
CF-1933-div3
CF-1941-div3
CF-1945-div3
CF-1968-div3
CF-1996-div3
CF-2000-div3
CF-2008-div3
div4
CF-1985-div4
CF-1999-div4
CF-2009-div4
单题
CF-510C
CF-510D
板刷
Rating1100~1400
B. Binary Colouring
B. Collatz Conjecture
B. Increase-Decrease-Copy
B. Substring and Subsequence
C1. Magnitude (Easy Version)
C. Basil's Garden
C. Boring Day
C. Manhattan Permutations
C. Sofia and the Lost Operations
C. Two Movies
D. GCD-sequence
D. Mathematical Problem
Contest
蓝桥杯
14届🏀
2023 ICPC网络赛
2024CCPC网络赛
2024昆明邀请赛
2024郑州邀请赛
HDU新生赛
hdu
HDU2973
Luogu
B3644 拓扑排序 & 家谱树 - 洛谷
B3645 数列前缀和 2 - 洛谷
B3646 数列前缀和 3 - 洛谷
P1102 A-B 数对 - 洛谷
P1163 银行贷款 - 洛谷
P1352 没有上司的舞会 - 洛谷
P1453 城市环路 - 洛谷
P1890 gcd区间
P2607 骑士 - 洛谷
P2863 The Cow Prom S - 洛谷
P8376 排列 - 洛谷
NowCoder
2024寒假集训营
2024牛客寒假算法基础集训营1
2024牛客寒假算法基础集训营2
2024牛客寒假算法基础集训营3
2024牛客寒假算法基础集训营4
2024牛客寒假算法基础集训营5
2024牛客寒假算法基础集训营6
2024牛客多校
牛客多校4
小白月赛
小白月赛87
小白月赛88
小白月赛89
小白月赛90
小白月赛91
小白月赛92
小白月赛94
小白月赛100
牛客周赛
牛客周赛34
牛客周赛36
牛客周赛37
牛客周赛38
牛客周赛39
牛客周赛40
牛客周赛41
牛客周赛47
牛客周赛51
牛客周赛52
牛客周赛55
牛客周赛57
牛客周赛58
牛客周赛60
牛客周赛62
牛客周赛 Round35
牛客周赛 Round 30
牛客周赛 Round 31
牛客周赛 Round 33
练习赛
牛客练习赛119
牛客练习赛122
牛客练习赛126
牛客练习赛128
数组操作
swpuoj
2023新生赛题解
W1032LCA
W1054 永无止境的反转
新生赛
Topcoder
16109
Single Round Match 790 Editorials - Topcoder
z-Misc
Network of Schools
Proving Equivalences
The Largest Clique
受欢迎的牛
算法知识
DP
练习
DP乱锅炖
区间DP
树形DP
状压DP
线性DP
背包DP
线性DP
P1020 导弹拦截
P1077 摆花
P1091 合唱队形
P1095 守望者的逃离
P1216 数字三角形
P1541 乌龟棋
P3842 线段
P4059找爸爸
最长上升子序列
最长公共子序列
二分
练习
P1873 EKO 砍树
二分大杂烩
二分
图论
Johnson 全源最短路径算法
lca
spfa
Tarjan 算法求强连通分量
二分图
树形DP专题
欧拉图
浅谈基环树(环套树)
链式前向星存图
数据结构
树状数组
练习
P1637 三元上升子序列
P1908 逆序对
P1972 HH的项链
P4054 计数问题
P4514 上帝造题的七分钟
P5142 区间方差
树状数组
线段树
练习
P1438 无聊的数列
P1440 求m区间内的最小值
P1502 窗口的星星
未命名
P2184 贪婪大陆
P2357 守墓人
P2471 降雨量
P2574 XOR的艺术
P2824 排序
P2880 Balanced Lineup G
P3130 Counting Haybale P
P3353 在你窗外闪耀的星星
P3611 Cow Dance Show S
P4588 数学计算
P4939 Agent2
P5057 简单题
线段树
ST表
单调栈
单调队列
并查集
数论
中国剩余定理
原根
威尔逊定理
快速幂 & 矩阵运算
拓展欧几里得
整数环以及丢番图方程
欧拉函数
欧拉定理
狄利克雷卷积
素数筛法
莫比乌斯函数
裴蜀定理
逆元
bitset
博弈论
等待更新的知识点
线性基
Curated
Algorithms
C++ - SWPUACM Wiki
C++ array 使用方法详细介绍_array__-CSDN 博客
史上最全的各种 C++ STL 容器全解析
Edge
CompletableFuture原理与实践-外卖商家端API的异步化
How to Get Rich
JUC并发—3.volatile和synchronized原理_牛客网
LATEX - Beamer - 知乎
WebClipper
youtube.com
这时代太抽象,想要不疯太难了…
zhihu.com
万字长文解析Agent框架中的上下文管理策略
万字长文解读LLM Agent:总体框架、经典论文与实践
Attention Mechanisms in LLMs, clearly explained
Engineering
Agent
Agent 构建模式
Agent 相关知识学习
Agent 杂项
Backend
Java
java基础
java语法糖
java并发
并发锁相关知识
线程池相关知识
线程相关知识
java集合
List
ArrayList 源码分析
CopyOnWriteArrayList 源码分析
LinkedList 源码分析
List 相关常见知识
Map
HashMap 源码分析
LinkedHashMap 源码分析
Map相关常见知识
Queue
Queue相关常见知识
java集合概览
思维导图
Java集合思维导图
计算机基础
计算机网络
计算机网络部分笔记
Home
模板整理
飞天闪客内容总结.excalidraw
#excalidraw
00-收件箱
/
excalidraw
模块 01 | 语言建模本质与超大规模分类任务
破解黑盒玄学:大语言模型绝非神秘直觉,其底层极其纯粹 —— 给定前面所有输入,在词表中做多分类预测下一个 Token!
自回归语言模型生成全链路与多分类机制
① 输入离散文本序列 (Tokens: t=1..4):
今 天
天 气
真
好
序列张量 X ∈ ℝ^(4 × 768)
深层神经网络万能函数 f(X; Θ)
• 堆叠数十层 Transformer Blocks(自注意力与非线性变换)
• 数十亿/数千亿可训练参数(权重矩阵 W 与偏置 b)
• 通用近似定理:将离散字符映射到高维连续语义流形空间
末位隐藏状态 h_t ∈ ℝ^768
Linear 线性投影层 (d_model=768 → Vocab_Size=50257)
未归一化对数得分 Logits ∈ ℝ^50257
Softmax 归一化概率分布与下一词多分类采样:
极了 ⭐
82%
呀
8%
呢
4%
...
2%
挖掘机
0.001%
香蕉
0.0001%
自
回
归
循
环
生
成
分类问题与生成任务
• 图像二分类:输出 2 个神经元 (猫 vs 狗)
• 图像千分类:输出 1000 个神经元
• GPT 语言模型生成:本质也是分类任务!
唯一的区别是候选类别多达 50,257 个!
• 所谓文字生成,就是不断做 50,257 选 1 的多选题,
选出一个 Token 拼回输入末尾,生生不息!
• 自监督训练的优雅:互联网海量文本天然就是
(输入前缀, 下一个词) 的训练样本对,无需昂贵标注!
交叉熵损失函数使得模型在海量语料上不断逼近
真实人类语言的条件概率分布,涌现出理解与推理能力!
张量维度全生命周期契约
首先抓牢每一层输入/输出张量维度契约:
① 输入序列: [Batch, Seq_Len=4]
② 词嵌入层: [Batch, 4, d_model=768]
③ 变换主干: [Batch, 4, 768] (保真)
④ 线性投影: [Batch, 4, Vocab=50257]
⑤ 概率采样: 取末位 [1, 50257] 抽样
输入输出维度相同使得 Transformer Block 可以像积木一样
无限纵向堆叠数十层甚至上百层,形成极强的深度表征!
模块 02 | 词向量 Embedding 与语义空间
几何直觉:一维不可分,升维则切分开!One-Hot 缺陷与稠密语义空间中的向量运算法则。
一维线性不可分 ➔ 二维线性可分:升维
1. 一维数轴上的红蓝样本点:交错分布
红 (x=1)
蓝 (x=2)
蓝 (x=3)
红 (x=4)
切线1
切线2
❌ 无论在哪里切一刀,都无法用一个阈值将红蓝球分开!(一维线性不可分)
升维映射:引入特征维度 y = (x - 2.5)²
2. 升入二维空间:抛物线拉伸,一条直线轻松切分!
x
y
✔ 线性超平面(分界直线 y = C)完美切分!
为什么 Transformer 需要 768 / 4096 维词向量?
• 自然语言中蕴含着极其繁复的语义关联、时态、情感与逻辑关系;
• 一维标量根本无法容纳如此复杂的分类界限;
• 神经网络升维(Embedding)赋予了模型极其充裕的『自由度空间』,
让复杂的语言关系在超高维空间中变得处处线性可分
• 词向量矩阵 Embedding 随整个模型端到端反向传播微调,
无需任何人工特征工程,自发演化出高度结构化的语义流形
One-Hot 正交缺陷 vs 稠密语义向量空间
方案 A:One-Hot 独热编码
苹果 = [1, 0, 0, 0, ..., 0] ∈ ℝ^50257
香蕉 = [0, 1, 0, 0, ..., 0] ∈ ℝ^50257
挖掘机 = [0, 0, 1, 0, ..., 0] ∈ ℝ^50257
❌ 维度灾难(5万维全为0),且任意两词点积均为0,完全丢失语义相似度
方案 B:可学习稠密词向量 (Dense Embedding) 与几何语义
苹果 (v_apple)
香蕉 (v_banana)
挖掘机 (v_excavator)
θ 极小
相似度 ≈ 0.96
【语义可加性】向量空间中的平行四边形运算法则:
通过端到端反向传播,词向量自发学到了抽象的概念方向
(如性别轴、皇室权力轴、词性时态轴)
几何距离代表语义亲疏,方向位移代表概念转换
模块 03 | FFN 前馈神经网络与空间折痕
纯线性堆叠等于单层!激活函数像折纸一样弯折高维空间,FFN 4倍膨胀充当大模型的事实记忆键值库。
为什么只用矩阵乘法没有用?
纯线性矩阵乘法:
无论你堆叠 10 层还是 10,000 层全连接网络,如果不加非线性激活函数,
多个矩阵连乘在数学上完全等价于单层扁平矩阵!无法拟合任何非线性曲面。
【几何本质】激活函数 = 在高维空间制造「折痕」
拐点/折痕 (Bending Point)
ReLU(x) = max(0, x)
【折纸几何比喻(Folding Space)】
• 想象一张平整白纸,你只用直尺画线,永远无法切分复杂的交错圆环;
• 激活函数的非线性拐点,就像把纸沿着折痕弯折一下;
• 每一个神经元都在空间中折一道印子,数千个神经元共同协作,
就能折出极其精密的多维流形曲面,包裹住任意复杂的概念边界!
FFN 4倍膨胀架构与事实记忆键值库 (Key-Value Memory)
三层拓扑:先升维膨胀 4 倍,再降维还原
输入层
d = 768
膨胀隐藏层
4d = 3072
输出层
d = 768
W1 矩阵 (上采样)
W2 矩阵 (下采样)
FFN 是大模型的事实知识记忆库(Key-Value Memory)
大模型中约 2/3 的参数量都聚集在 FFN 层。最新机理研究证实:
1. 第一层权重 W1 充当「Key(键匹配器)」:
每个神经元检测特定的语义模式(例如检测到「法国 + 首都」)。
2. GELU 激活函数充当「非线性门控过滤」:
压制绝大多数无关神经元,只点亮被触发的概念神经元!
3. 第二层权重 W2 充当「Value(值存储器)」:
被点亮的神经元通过 W2 读出事实知识(输出「巴黎」!)。
结论:Attention 负责在序列中『搬运与交流信息』,
FFN 负责在神经元深处『检索与回忆知识』!
模块 04 | Self-Attention 动态上下文融合机制
解决静态词向量歧义痛点:Q/K/V 三重角色分工,点积相似度打分,除以根号dk防止方差爆炸,Softmax加权动态融合!
Query (Q / 查询向量)
「我是谁?我现在急需什么上下文信息?」
每个词拿着放大镜去探索其他词。
由输入 X 乘以权重矩阵 W_Q 投影生成。
Key (K / 键向量)
「我是谁?我身上有什么关键线索可供匹配?」
每个词举起的对外索引标签。
由输入 X 乘以权重矩阵 W_K 投影生成。
Value (V / 值向量)
「若被选中,我将贡献什么实质语义精髓?」
每个词内藏的真正语义内容抽屉。
由输入 X 乘以权重矩阵 W_V 投影生成。
【全流程矩阵推演】因果自注意力流水线 (以序列「今天 天气 真」为例)
1. 查询 Q (3×d_k)
q_今天 [ . . . ]
q_天气 [ . . . ]
q_真 [ . . . ]
×
2. 转置 K^T (d_k×3)
k_今 k_天 k_真
[ . . . ]
[ . . . ]
3. 打分矩阵 S = Q·K^T
今: [ 12.4, 4.2, 1.1 ]
天: [ 3.8, 14.1, 2.0 ]
真: [ 2.1, 5.8, 15.6 ]
÷ √d_k
+ Mask
Softmax
4. 因果掩码注意力权重 A (下三角)
今: [ 1.00, 0.00, 0.00 ]
天: [ 0.25, 0.75, 0.00 ]
真: [ 0.15, 0.25, 0.60 ]
★ 右上角为0:因果掩码杜绝偷看未来Token!
×
5. 内容 V
v_今天
v_天气
v_真
6. 上下文重塑 Z
z_今天'
z_天气'
z_真'
【为什么必须除以 √d_k 缩放因子?】
若 q 与 k 均值约为 0、方差为 1,则其内积 q·k 是 d_k 个独立随机变量之和。
内积结果的期望为 0,而方差却会放大到 d_k!当 d_k = 64 时,标准差达到 8。
如果不除以 √d_k = 8,点积数值会达到数十,经过 Softmax 之后会导致极端指数放大(变成 0.9999 与 0.0001),
使得梯度处处趋近于 0,反向传播严重饱和!除以 √d_k 完美将方差重新锚定回 1
从「死词」到「活词」的蜕变过程
• 初始词嵌入(Embedding)是静态的:字典里的「苹果」向量无论放在哪个句子里都长得一模一样;
• 在「苹果发布会」中,通过 Attention,它吸收了「发布会」的 Key 标签,将高权重赋予科技语义;
• 在「红富士苹果」中,它吸收了「红富士」的 Key 标签,将高权重赋予水果语义;
• Attention 的本质不是算算术,而是让原本僵死的符号在上下文洪流中动态变形,精准表达当下的确切意图!
模块 05 | Transformer Block 流水线
位置编码打破置换不变性,残差直通高速公路彻底根除梯度消失,LayerNorm 稳定特征方差,自回归循环生生不息!
现代 Pre-LN Transformer Block 单层架构
输入 Tokens: ["今天", "天气", "真", "好"]
+
词嵌入 (Embedding)
shape: [4, 768]
位置编码 (Positional Encoding)
shape: [4, 768] (注入语序)
LayerNorm (层归一化 1)
Multi-Head Attention
• 8 个独立注意力头并行计算
• 每个头特征维度 d_k = 64
• 拼接后经 W_O 投影还原
残差直通公路 1
(Residual Highway)
无损保留浅层特征
+
LayerNorm (层归一化 2)
Feed-Forward Network
• 升维:768 ➔ 3072
• 非线性激活:GELU
• 降维:3072 ➔ 768
残差直通公路 2
(Residual Highway)
提供梯度反向直通
+
重复堆叠 × N 层
(如 GPT-2 堆叠 12 层,
GPT-3 堆叠 96 层)
Final LN + Linear 头
【核心组件 1】残差连接 (Residual Connection)
为什么没有残差连接就根本无法训练深层大模型?
反向传播梯度流:
• 在数十层的深层网络中,导数连乘极易衰减到接近 0 (∂F/∂x ≈ 0);
• 但因为残差连接在括号里加了一个常数「单位矩阵 I」,
使得误差梯度可以直接顺着直通公路以 100% 强度无损回传到底层!
• 彻底终结了深度学习中阻碍模型做大的梯度消失顽疾!
★ Pre-LN 现代改进:
原始 Transformer 采用 Post-LN(在 Add 之后做归一化),
容易造成深层数值不稳定。现代大模型统一迁移至 Pre-LN,
让主残差干线保持无障碍纯线性贯通,训练极为平滑!
【核心组件 2】层归一化 (LayerNorm) 与位置编码
1. 为什么用 LayerNorm 而不用 CV 领域的 BatchNorm?
• BatchNorm 是跨样本沿 Batch 维度求均值方差,
严重依赖 Batch 大小,且无法应对推理时的变长文本;
• LayerNorm 独立在单个 Token 内部的 768 维特征轴归一化,
与 Batch 大小完全解耦,计算高度稳定!
2. 为什么必须引入位置编码 (Positional Encoding)?
• Self-Attention 是置换不变的(无语序概念):
打乱句子顺序「猫抓老鼠」和「老鼠抓猫」,点积算力完全一样!
• 必须显式将位置信息编码为高维向量相加,赋予模型感知语序的能力。
模块 06 | 现代大模型演进
现代 LLM 对原始 Transformer 零件的全面换装改造:RoPE、SwiGLU、RMSNorm、GQA,与从提示词到智能体工具调用。
现代开源大模型 (Llama/DeepSeek) 核心零件改造
1. 位置编码:绝对正弦 PE ➔ RoPE 旋转位置编码
• 核心几何直觉:在二维复数平面上将向量旋转 m·θ 角度;
• 内积自然带出相对位置差 (m - n)·θ,让模型天然具备长文本相对距离感知与超长上下文外推能力!
2. 前馈激活:普通 FFN ➔ SwiGLU 门控前馈网络
• 引入双分支门控(Gating)机制,一条分支做非线性激活,另一条分支线性调制;
• 显著提高参数表达效率与训练收敛速度,成为 Llama、Mistral 标配!
3. 归一化加速:LayerNorm ➔ RMSNorm
• 实验证实:LayerNorm 的减去均值操作对训练稳定性贡献微乎其微;
• RMSNorm 彻底舍弃减均值计算,只做均方根缩放,计算速度提升 20%~50%!
4. 注意力显存优化:MHA ➔ GQA (分组查询注意力) & MLA
• 推理瓶颈在显存吞吐(KV Cache 暴涨);
• GQA 让多组 Query 头共享同一组 Key 和 Value 头,显存直接立省 75%!
• DeepSeek MLA:更进一步采用低秩压缩潜变量,显存立省 90%!
大模型到 Agent
1. 用户复杂任务输入 (User Task Prompt)
例:「请帮我分析 2026 年最新财报,绘制营收对比图并发送邮件」
2. LLM 大脑认知规划(思维链 CoT + 格式约束)
• 迫使模型输出「Let us think step by step」,拆解长链逻辑;
• 遇到自身知识盲区或需要现实交互时,模型不再胡编乱造,
而是自主决定输出结构化工具调用协议指令 (Tool Call JSON)!
Action: {"tool": "query_database",
"args": {"year": 2026, "target": "revenue"}}
3. 外部执行环境与工具网关 (MCP / Shell / API)
• 模型本身无法联网、无法运行代码、无法操作文件;
• 外部系统捕获 JSON 指令,调用真正的 Python 沙箱、SQL 数据库、浏览器或 MCP 服务;
• 收集真实环境返回的 Observation 数据:
Observation: {"revenue_q1": "$42.5B",
"growth_yoy": "+18.4%"}
环境真实反馈
灌回模型上下文
(Observation)
自主循环
Thought (思考拆解) ➔ Action (调用工具)
➔ Observation (观察反馈) ➔ 再次 Thought
大模型化身为能够:
1. 借助 MCP 协议调用海量现实工具;
2. 自主纠错、自主拆解长线目标;
3. 驱动多 Agent 协同作业
在上方输入关键词开始检索
选择一条搜索结果即可实时预览