2026-08-11
预训练语言模型的前世今生 - 从Word Embedding到BERT 解读
用 12 页 warm-notes / sketchnote 风格图解复盘一篇 BERT 前置知识长文:从 Word Embedding、RNN/LSTM/ELMo、Attention、Transformer、GPT 一路走到 BERT 的 MLM、NSP 和下游任务适配。
zhengyuhong.cn
这里记录技术、思考和长期积累的笔记。
zhengyuhong.cn@gmail.com
2026-08-11
用 12 页 warm-notes / sketchnote 风格图解复盘一篇 BERT 前置知识长文:从 Word Embedding、RNN/LSTM/ELMo、Attention、Transformer、GPT 一路走到 BERT 的 MLM、NSP 和下游任务适配。
2026-08-10
用 12 页 warm-notes / sketchnote 风格图解复盘高效 LLM 架构 survey:从长上下文瓶颈出发,串起 linear sequence modeling、sparse attention、efficient full attention、MoE、hybrid architecture、Diffusion LLM 和跨模态应用。
2026-08-07
用 10 页 warm-notes / sketchnote 风格图解复盘 Transformer 原始论文:为什么去掉 RNN/CNN、Q/K/V 注意力如何计算、多头注意力如何分工,以及论文用路径长度、BLEU 和训练成本证明了什么。
2026-08-06
图解一篇 GPT 系列学习笔记:从 GPT-1 的 Pretrain + Finetune,到 GPT-2 的 Prompt / zero-shot,再到 GPT-3 的 In-context Learning、IFT 和 CoT,串起 decoder-only 语言模型路线的核心机制变化。
2026-08-06
图解一篇 BERT 原理学习笔记:BERT 如何用 Transformer Encoder 做双向语义抽取,如何把 Token、Segment、Position 三种 Embedding 相加作为输入,并通过 MLM、NSP 预训练后微调到分类、问答和序列标注任务。
2026-08-05
图解 Bahdanau、Cho 和 Bengio 2015 年的 RNNsearch:为什么固定向量会成为 Seq2Seq 长句瓶颈,模型如何用 BiRNN 注释源句、用可导 soft alignment 为每个目标词动态生成上下文向量,并在英法翻译中显著提升长句表现。
2026-08-04
图解 Sutskever、Vinyals 和 Le 2014 年的 Seq2Seq 论文:Encoder-Decoder LSTM 如何把序列压成向量再生成序列,为什么只反转 source 能显著降低优化难度,以及 beam search 与 reranking 如何带来强机器翻译结果。
2026-08-04
Mikolov 等人在这篇 Word2Vec 后续论文中引入 Negative Sampling、高频词下采样和短语发现,让 Skip-gram 更快、更准,也能直接学习短语向量。
2026-07-29
图解 Hochreiter 和 Schmidhuber 1997 年 LSTM 原始论文:CEC 如何维持稳定误差流,input gate 与 output gate 如何控制写入和读出,以及实验怎样验证长时依赖能力。
2026-07-29
图解 Cho et al. 2014 的 RNN Encoder-Decoder:短语如何被编码成向量、门控隐藏单元如何记忆与遗忘,以及神经短语分数如何接入传统 SMT。
2026-07-29
Mikolov 等人的 Word2Vec 论文把词向量训练从昂贵神经语言模型中抽离出来,用 CBOW 和 Skip-gram 让大规模词表示训练成为基础工具。
2026-07-29
DeepSeekMoE 通过细粒度专家切分和共享专家隔离,让 MoE 专家更专门、冗余更少,并在较低激活计算下接近 dense 模型表现。
2026-07-29
DeepSeekMath 用 120B 数学网页语料继续预训练 7B 模型,再用 GRPO 强化学习提升数学推理,让开源小模型在 MATH 上突破 50%。
2026-07-29
DeepSeek-Coder 的核心不是单个新模块,而是用高质量 repo-level 代码语料、FIM 预训练、16K 长上下文和指令微调组合出强代码能力。
2026-07-29
DeepSeek LLM 的核心不是新模块,而是用 scaling law 指导 7B/67B 开源大模型的长期训练,再通过 SFT 和 DPO 把 Base 能力对齐成 Chat 能力。
2026-07-29
从 Q/K/V 的可微检索视角出发,串起注意力池化、打分函数、多头注意力、自注意力、位置编码、Transformer、ViT 和大规模预训练模型的共同骨架。
2026-07-29
从 QKV 注意力池化讲到多头、自注意力、位置编码、Transformer、ViT 和大规模预训练的系统解读,附中文 sketchnote 图解。
2026-07-29
Bengio 等人在 2003 年把语言模型从统计短片段计数推进到可联合学习词向量和概率函数的神经语言模型。
2026-07-28
Kimi K3 的核心不只是 2.8T 参数,而是用 KDA、AttnRes 和 Stable LatentMoE 同时扩展序列长度、网络深度和模型宽度。
2026-07-28
DataFlow-Harness 的重点不是让 Agent 写一次性脚本,而是把 Agent 放进可编辑、可验证、可回滚的 pipeline harness 里。
2026-07-27
LLM 把不确定性引入了工程系统,几个测试用例跑通已经不够,我们需要用评估集持续衡量和驱动工程能力。
2026-07-25
台风来临前,我又坐到门口,想起小时候等暴雨的凉爽,也想起有些少年时光终究只能路过一次。
2026-07-24
有些年龄不是生日提醒你的,而是在一个普通下午,你发现自己不再想喝冰可乐。
2026-07-21
这个个人知识笔记从一条清晰的写作和发布链路开始。