<?xml version="1.0" encoding="utf-8" standalone="yes"?><rss version="2.0" xmlns:atom="http://www.w3.org/2005/Atom"><channel><title>Transformer on LoopRouter Blog</title><link>https://blog.looprouter.com/tags/transformer/</link><description>Recent content in Transformer on LoopRouter Blog</description><generator>Hugo</generator><language>zh-cn</language><lastBuildDate>Sat, 20 Jun 2026 00:00:00 +0000</lastBuildDate><atom:link href="https://blog.looprouter.com/tags/transformer/index.xml" rel="self" type="application/rss+xml"/><item><title>LLM 到底是怎么工作的</title><link>https://blog.looprouter.com/docs/how-llms-actually-work/</link><pubDate>Sat, 20 Jun 2026 00:00:00 +0000</pubDate><guid>https://blog.looprouter.com/docs/how-llms-actually-work/</guid><description>&lt;blockquote&gt;&#10;&lt;p&gt;&lt;strong&gt;AI 摘要&lt;/strong&gt;&lt;br&gt;&#10;现代 LLM 大多是基于 Transformer 的系统，它们通过一层层重复堆叠的模块来处理文本。模型看到的不是单词，而是 token。整个流程从分词开始：文本被转换成固定词表里的整数 ID；这些 ID 再映射成学习得到的 embedding，用数字向量承载语义。因为注意力机制本身不知道顺序，所以还需要位置编码补充 token 的先后关系。在每个 Transformer 层内部，自注意力会让 token 之间交换信息：模型为 token 生成 Query、Key、Value 向量，计算匹配分数，再用 softmax 权重混合 Value；在只能从左到右生成文本的模型里，因果掩码会阻止模型看到未来 token。多头注意力会并行运行多组注意力，让模型同时跟踪不同关系；分组查询注意力则降低内存成本。随后，前馈网络会独立处理每个 token，模型的大量语义和事实知识都存放在这些参数中。残差连接和归一化让很深的网络仍然可训练且稳定。最后，模型把最后一个 token 的隐藏状态转换成整个词表上的 logits，并在循环中一个 token 一个 token 地采样生成。文章还区分了共享的 Transformer 架构和训练得到的权重、后训练步骤，说明现代模型的差异主要来自训练、规模和配置，而不是完全不同的核心机械结构。&lt;/p&gt;</description></item></channel></rss>