2026-09-19
术先于道:从修身炉到 AI 教育
AI 让人更容易获得结果,却不一定让人拥有产生、判断和承担结果的能力。真正需要警惕的,是术先于道,答案先于理解。
zhengyuhong.cn
这里记录技术、思考和长期积累的笔记。
zhengyuhong.cn@gmail.com
2026-09-19
AI 让人更容易获得结果,却不一定让人拥有产生、判断和承担结果的能力。真正需要警惕的,是术先于道,答案先于理解。
2026-08-31
用 9 页 warm-notes 风格图解复盘 Linear Attention:从 QKᵀ 的平方复杂度出发,理解 kernel feature map、因果前缀状态与 RNN 式推理,并用图像生成和语音识别实验看清速度、显存与表达能力之间的取舍。
2026-08-27
用 8 页 warm-notes / sketchnote 风格图解阅读这篇 FFN 机制论文:从 Conditional Computation 任务出发,梳理非线性 FFN 的必要性、稀疏激活、SUM/MAX circuit 分工、targeted ablation 双重分离,以及 DistilBERT 中 noun/verb specialization 的验证。
2026-08-25
以 Jay Alammar 的 The Illustrated Transformer 为主线,系统梳理 Transformer 的 encoder-decoder 架构、Q/K/V 自注意力、多头注意力、位置编码、残差归一化、解码器 mask、训练目标和推理解码。
2026-08-24
从旧物收纳想到人的容量,再借程序员熟悉的 Cache 和 TTL,给生活也设一套及时清理的缓存策略。
2026-08-19
下午冲一杯生椰拿铁时想到,身体像一只杯子,里面装什么决定它是什么,而每只杯子也都有自己的容量。
2026-08-14
Part 3 用 12 页 journal-minimal 图解阅读论文后半段:Cordis 如何把演算映射到 ctx、fiber、dispose、loader reconciliation 和 HMR transaction,并说明 Koishi 与 agent harness 场景里的系统意义。
2026-08-14
Part 2 用 12 页 journal-minimal 图解阅读论文的形式化核心:component 三元组、fiber registry、target view、base calculus、Unloading 状态,以及 progress 和 confluence 两类保证。
2026-08-14
Part 1 用 12 页 journal-minimal 图解阅读论文前半段:从动态系统为什么不能靠重启讲起,梳理时空可组合性的两条轴、revertible effects、reactive coeffects,以及 unified context paradigm。
2026-08-11
用 12 页 warm-notes / sketchnote 风格图解复盘一篇 BERT 前置知识长文:从 Word Embedding、RNN/LSTM/ELMo、Attention、Transformer、GPT 一路走到 BERT 的 MLM、NSP 和下游任务适配。
2026-08-10
用 12 页 warm-notes / sketchnote 风格图解复盘高效 LLM 架构 survey:从长上下文瓶颈出发,串起 linear sequence modeling、sparse attention、efficient full attention、MoE、hybrid architecture、Diffusion LLM 和跨模态应用。
2026-08-07
用 10 页 warm-notes / sketchnote 风格图解复盘 Transformer 原始论文:为什么去掉 RNN/CNN、Q/K/V 注意力如何计算、多头注意力如何分工,以及论文用路径长度、BLEU 和训练成本证明了什么。
2026-08-06
图解一篇 GPT 系列学习笔记:从 GPT-1 的 Pretrain + Finetune,到 GPT-2 的 Prompt / zero-shot,再到 GPT-3 的 In-context Learning、IFT 和 CoT,串起 decoder-only 语言模型路线的核心机制变化。
2026-08-06
图解一篇 BERT 原理学习笔记:BERT 如何用 Transformer Encoder 做双向语义抽取,如何把 Token、Segment、Position 三种 Embedding 相加作为输入,并通过 MLM、NSP 预训练后微调到分类、问答和序列标注任务。
2026-08-05
图解 Bahdanau、Cho 和 Bengio 2015 年的 RNNsearch:为什么固定向量会成为 Seq2Seq 长句瓶颈,模型如何用 BiRNN 注释源句、用可导 soft alignment 为每个目标词动态生成上下文向量,并在英法翻译中显著提升长句表现。
2026-08-04
图解 Sutskever、Vinyals 和 Le 2014 年的 Seq2Seq 论文:Encoder-Decoder LSTM 如何把序列压成向量再生成序列,为什么只反转 source 能显著降低优化难度,以及 beam search 与 reranking 如何带来强机器翻译结果。
2026-08-04
Mikolov 等人在这篇 Word2Vec 后续论文中引入 Negative Sampling、高频词下采样和短语发现,让 Skip-gram 更快、更准,也能直接学习短语向量。
2026-07-29
图解 Hochreiter 和 Schmidhuber 1997 年 LSTM 原始论文:CEC 如何维持稳定误差流,input gate 与 output gate 如何控制写入和读出,以及实验怎样验证长时依赖能力。
2026-07-29
图解 Cho et al. 2014 的 RNN Encoder-Decoder:短语如何被编码成向量、门控隐藏单元如何记忆与遗忘,以及神经短语分数如何接入传统 SMT。
2026-07-29
Mikolov 等人的 Word2Vec 论文把词向量训练从昂贵神经语言模型中抽离出来,用 CBOW 和 Skip-gram 让大规模词表示训练成为基础工具。
2026-07-29
DeepSeekMoE 通过细粒度专家切分和共享专家隔离,让 MoE 专家更专门、冗余更少,并在较低激活计算下接近 dense 模型表现。
2026-07-29
DeepSeekMath 用 120B 数学网页语料继续预训练 7B 模型,再用 GRPO 强化学习提升数学推理,让开源小模型在 MATH 上突破 50%。
2026-07-29
DeepSeek-Coder 的核心不是单个新模块,而是用高质量 repo-level 代码语料、FIM 预训练、16K 长上下文和指令微调组合出强代码能力。
2026-07-29
DeepSeek LLM 的核心不是新模块,而是用 scaling law 指导 7B/67B 开源大模型的长期训练,再通过 SFT 和 DPO 把 Base 能力对齐成 Chat 能力。
2026-07-29
从 Q/K/V 的可微检索视角出发,串起注意力池化、打分函数、多头注意力、自注意力、位置编码、Transformer、ViT 和大规模预训练模型的共同骨架。
2026-07-29
从 QKV 注意力池化讲到多头、自注意力、位置编码、Transformer、ViT 和大规模预训练的系统解读,附中文 sketchnote 图解。
2026-07-29
Bengio 等人在 2003 年把语言模型从统计短片段计数推进到可联合学习词向量和概率函数的神经语言模型。
2026-07-28
Kimi K3 的核心不只是 2.8T 参数,而是用 KDA、AttnRes 和 Stable LatentMoE 同时扩展序列长度、网络深度和模型宽度。
2026-07-28
DataFlow-Harness 的重点不是让 Agent 写一次性脚本,而是把 Agent 放进可编辑、可验证、可回滚的 pipeline harness 里。
2026-07-27
LLM 把不确定性引入了工程系统,几个测试用例跑通已经不够,我们需要用评估集持续衡量和驱动工程能力。
2026-07-25
台风来临前,我又坐到门口,想起小时候等暴雨的凉爽,也想起有些少年时光终究只能路过一次。
2026-07-24
有些年龄不是生日提醒你的,而是在一个普通下午,你发现自己不再想喝冰可乐。
2026-07-21
这个个人知识笔记从一条清晰的写作和发布链路开始。
输入关键词开始搜索。