[{"data":1,"prerenderedAt":338},["ShallowReactive",2],{"blog-posts":3,"content-\u002Fposts\u002Fwhy-llm-seems-worse-after-launch":212},[4,15,26,32,38,49,55,59,69,76,82,86,91,99,106,114,119,125,131,136,141,148,155,162,168,175,183,189,195,201,207],{"path":5,"title":6,"description":7,"date":8,"categories":9,"tags":10,"draft":14},"\u002Fposts\u002Fwhy-llm-seems-worse-after-launch","为什么模型上线后，体感像是“降智”了？","权重与 KV cache 的量化都能降低 serving 成本，也可能改变输出；但体感变弱不足以证明服务后来切换了精度。","2026-09-29 21:44:08","技术杂谈",[11,12,13],"LLMs","Serving","量化",false,{"path":16,"title":17,"description":18,"date":19,"categories":20,"tags":21,"draft":14},"\u002Fposts\u002Fspinning-up-policy-optimization","[译] 深度强化学习入门（三）：策略优化入门","OpenAI Spinning Up 教程第三部分的全文翻译：推导最简单的策略梯度、log-derivative trick、EGLP 引理、reward-to-go 与基线，配 PyTorch 示例代码。","2026-09-28 17:49:25","技术",[22,23,24,25],"强化学习","RL","Spinning Up","翻译",{"path":27,"title":28,"description":29,"date":30,"categories":20,"tags":31,"draft":14},"\u002Fposts\u002Fspinning-up-rl-intro-2","[译] 深度强化学习入门（二）：强化学习算法的分类","OpenAI Spinning Up 第二部分的全文翻译：无模型与基于模型的 RL、策略优化与 Q-learning 的取舍，以及规划、专家迭代和经验增强等方法。","2026-09-28 10:20:21",[22,23,24,25],{"path":33,"title":34,"description":35,"date":36,"categories":20,"tags":37,"draft":14},"\u002Fposts\u002Fspinning-up-rl-intro","[译] 深度强化学习入门（一）：RL 的关键概念","OpenAI Spinning Up 教程第一部分的全文翻译：智能体与环境、状态与观测、动作空间、策略、轨迹、奖励与回报、价值函数、贝尔曼方程、优势函数，附 MDP 形式化。","2026-09-28 09:29:40",[22,23,24,25],{"path":39,"title":40,"description":41,"date":42,"categories":43,"tags":44,"draft":48},"\u002Fposts\u002Fwhen-machines-come-alive","冰箱之后，生活还会怎样改变？","从厨房里的果蝇想到冰箱、移动互联网与 AI 的多轮调用：AGI 已经到来，只是昂贵的智能会怎样改变生活？","2026-09-25 06:36:22","生活杂谈",[45,46,47],"AI","随笔","科技",true,{"path":50,"title":51,"description":52,"date":53,"categories":52,"tags":54,"draft":48},"\u002Fposts\u002Fmathematical-foundations-of-llms-1","LLM的数学基础（1）：","","2026-09-19 22:59:55",null,{"path":56,"title":57,"description":52,"date":58,"categories":52,"tags":54,"draft":48},"\u002Fposts\u002Ftowards-maximize-serving-capatity","如何在 offline bench 里最大化 LLM serving system 的吞吐","2026-09-19 05:45:05",{"path":60,"title":61,"description":62,"date":63,"categories":9,"tags":64,"draft":14},"\u002Fposts\u002Fllm-memory-compute-tradeoff","LLM 的 Memory-Compute Trade-off：从 MHA 到 MLA、Sparse 与 Linear Attention","ds4.1f 上线了。它的架构 novel 在哪，便宜和快又是从哪省出来的。","2026-09-11 12:00:00",[11,65,66,67,68],"Attention","MLA","DeepSeek","长上下文",{"path":70,"title":71,"description":72,"date":73,"categories":9,"tags":74,"draft":48},"\u002Fposts\u002Fmarkdown-extensions","Markdown 扩展语法速查","本站 Markdown 支持的扩展语法演示与速查：admonition 提示块、GitHub 仓库卡片、spoiler 遮罩、ABC 乐谱、音频播放器、浏览器可运行代码块。","2026-09-01 15:30:00",[75],"博客",{"path":77,"title":78,"description":79,"date":80,"categories":43,"tags":81,"draft":14},"\u002Fposts\u002Fwhy-we-still-need-to-write-a-blog","为什么还需要手写博客？","AI这么强，还要古法写博客吗？","2026-09-01 13:17:53",[75],{"path":83,"title":84,"description":52,"date":85,"categories":52,"tags":54,"draft":48},"\u002Fposts\u002Fllm-serving-1","LLM Serving（一）:以在H200上部署GLM-5.2为例","2026-07-21 06:15:44",{"path":87,"title":88,"description":52,"date":89,"categories":90,"tags":54,"draft":14},"\u002Fposts\u002Finteresting-music-rhythm","有趣的音乐节奏","2026-07-16 12:47:24","音乐",{"path":92,"title":93,"description":94,"date":95,"categories":20,"tags":96,"draft":14},"\u002Fposts\u002Ftowards-monosemanticity","LLM 可解释性（一）：SAE与单语义","读 Anthropic《Towards Monosemanticity》。从难以解释的神经元出发, 讲清superposition为什么让单个神经元混成一团, SAE怎么把多语义的激活分解成单语义特征。","2026-07-12 22:00:00",[11,97,98],"可解释性","SAE",{"path":100,"title":101,"description":102,"date":103,"categories":43,"tags":104,"draft":48},"\u002Fposts\u002Fpiketty-ai-china-k-shaped","用皮凯蒂的镜头看 AI 与中国 K 型社会","一次凌晨的对话整理。从 r>g 出发，看 AI 时代的资本分配、中国的世袭化趋势、体制内的二元劳动力市场，以及一个普通 00 后在一线打拼的真实牌面。","2026-06-24 03:00:00",[46,105,45],"经济",{"path":107,"title":108,"description":52,"date":109,"categories":52,"tags":110,"draft":48},"\u002Fposts\u002Fclaude-code-compact-behavior","cluade code compact 行为","2026-06-23 20:17:42",[111,112,113],"Agent","AI Agent","Claude Code",{"path":115,"title":116,"description":52,"date":117,"categories":20,"tags":118,"draft":14},"\u002Fposts\u002Fclaude-code-settings","Claude Code 配置分享","2026-06-23 14:22:12",[11,112,111,113],{"path":120,"title":121,"description":122,"date":123,"categories":9,"tags":124,"draft":14},"\u002Fposts\u002Fmy-thoughts-on-the-ai-industry","简单聊聊对 AI Agent 行业的理解","写这篇文章的初衷，是我发觉逐渐忘了前两个月的 AI\u002FLLMs 是什么样的能力和情况了。意识中似乎某些在突然加速，但理性和直觉告诉我这不对，作为行内人，我知道这是一个渐进的、累积的过程。我想自己回忆一下，Agent的发展。","2026-06-20 13:14:25",[11,112,111],{"path":126,"title":127,"description":52,"date":128,"categories":20,"tags":129,"draft":14},"\u002Fposts\u002Frotational-positional-encoding","RoPE","2026-06-17 18:31:40",[11,130,127],"Transformer",{"path":132,"title":133,"description":52,"date":134,"categories":20,"tags":135,"draft":14},"\u002Fposts\u002Fintroduction-to-large-language-model","大语言模型入门基础","2026-06-16 22:36:11",[130,11],{"path":137,"title":138,"description":52,"date":139,"categories":9,"tags":140,"draft":14},"\u002Fposts\u002Fthought-about-coding-agent","关于 Coding Agent 使用的遐思","2026-06-03 17:54:20",[111],{"path":142,"title":143,"description":144,"date":145,"categories":20,"tags":146,"draft":14},"\u002Fposts\u002Fabout-ssh-usage","关于SSH的使用——客户端篇","介绍SSH客户端的用法。","2025-06-17 02:44:57",[147],"工具",{"path":149,"title":150,"description":151,"date":152,"categories":9,"tags":153,"draft":14},"\u002Fposts\u002Fopensourcesoftwarestarttutorial","如何开始一个开源项目？","浅谈我对开源项目的认知。","2025-04-17 18:00:00",[154],"开源",{"path":156,"title":157,"description":158,"date":159,"categories":160,"tags":161,"draft":14},"\u002Fposts\u002Fmotivation","渴求动力","有意识的生活并主动地行动会使得生活更美好。","2025-03-05 00:44:57","生活-情感",[46],{"path":163,"title":164,"description":165,"date":166,"categories":160,"tags":167,"draft":14},"\u002Fposts\u002F2024summary","2024年终总结","啊，痛彻的时光；啊，悲怆的人！","2025-01-01 01:00:00",[46],{"path":169,"title":170,"description":171,"date":172,"categories":20,"tags":173,"draft":14},"\u002Fposts\u002Fvps-crash-startup","快速搭建个人VPS","如何快速搭建个人VPS。","2024-12-31 19:00:00",[174],"VPS",{"path":176,"title":177,"description":178,"date":179,"categories":20,"tags":180,"draft":14},"\u002Fposts\u002Fdata-label-software","AI数据（自动）标注软件概述","对市面上目前的AI数据（自动）标注软件进行调研。","2024-12-20 14:00:00",[181,182],"数据标注","深度学习",{"path":184,"title":185,"description":186,"date":187,"categories":160,"tags":188,"draft":14},"\u002Fposts\u002Fself-destruction","生活的崩坏与自我毁灭","是什么在牵引着我？我的行为，我的思想？我的感受？我所处的地方？它们在何处？","2024-12-19 12:00:00",[46],{"path":190,"title":191,"description":192,"date":193,"categories":20,"tags":194,"draft":14},"\u002Fposts\u002Fcs194-196_llmagents","LLM Agents 课程笔记","UCB CS294\u002F194-196 Large Language Model Agents 的课程笔记。","2024-11-30 20:00:00",[111],{"path":196,"title":197,"description":198,"date":199,"categories":160,"tags":200,"draft":14},"\u002Fposts\u002Fwhatsyourworth","价值、位置","你们的生存究竟有何价值？如果毫无价值，你们究竟为何存在？","2024-11-29 02:00:00",[46],{"path":202,"title":203,"description":204,"date":205,"categories":160,"tags":206,"draft":14},"\u002Fposts\u002Fblogrelifever2","重启博客v2","忙里偷闲学习前端，还是决定结合想法手搓一个自己的博客。","2024-11-25 00:00:00",[75],{"path":208,"title":209,"description":210,"date":211,"categories":160,"tags":54,"draft":14},"\u002Fposts\u002Fblogrelife","重启博客","在我的表达欲与现实所需(问题解决记录)驱动下，我决定重写博客。","2024-10-21 20:44:57",{"id":213,"title":6,"body":214,"categories":9,"date":8,"description":7,"draft":14,"extension":332,"meta":333,"navigation":48,"path":5,"seo":334,"stem":335,"tags":336,"__hash__":337},"posts\u002Fposts\u002Fwhy-llm-seems-worse-after-launch.md",{"type":215,"value":216,"toc":325},"minimark",[217,221,226,237,258,267,271,274,282,285,288,296,299,302,305,308,311,322],[218,219,220],"p",{},"如果你觉得某个模型刚上线时表现更好，但过一段时间后，同一个模型名下的回答却像变迟钝了，serving 侧的量化值得排查。量化能降低显存占用和推理成本，也可能改变模型输出。",[222,223,225],"h2",{"id":224},"checkpoint-与-serving-配置","Checkpoint 与 serving 配置",[218,227,228,229,233,234,236],{},"仅知道训练得到的 checkpoint，并不能判断线上服务是否直接按 checkpoint 保存时的精度运行。Serving 配置涉及模型计算所用的 ",[230,231,232],"code",{},"dtype","、权重量化方案和 KV cache 的存储 ",[230,235,232],{}," 等方面；这些配置能否组合使用，以及量化是否同时覆盖权重与激活，取决于量化方案、模型和硬件。",[218,238,239,240,243,244,251,252,257],{},"以 vLLM 为例，在线量化可以在加载 BF16\u002FFP16 模型时把 Linear、MoE 权重转换为 FP8；KV cache 也有独立的 ",[230,241,242],{},"--kv-cache-dtype"," 设置。",[245,246,250],"a",{"href":247,"rel":248},"https:\u002F\u002Fdocs.vllm.ai\u002Fen\u002Flatest\u002Ffeatures\u002Fquantization\u002Fonline\u002F",[249],"nofollow","vLLM 在线量化文档","、",[245,253,256],{"href":254,"rel":255},"https:\u002F\u002Fdocs.vllm.ai\u002Fen\u002Flatest\u002Fcli\u002Fserve\u002F",[249],"serving 参数文档"," 展示了这条技术路径，但没有说明任何特定厂商怎样部署。",[218,259,260,261,266],{},"因此，量化不一定以替换 checkpoint 文件的方式发生；服务可以从上线之初就使用量化配置，也可以之后调整配置。对外模型名本身无法告诉用户后端使用的精确 revision、路由或数值格式；“上线时直接跑训练 checkpoint，后来才换成量化 checkpoint”只是众多可能部署过程中的一种。",[245,262,265],{"href":263,"rel":264},"https:\u002F\u002Fdocs.vllm.ai\u002Fen\u002Flatest\u002Fapi\u002Fvllm\u002Fconfig\u002Fmodel\u002F",[249],"vLLM 模型配置文档"," 也分别配置了对外服务名与模型 revision。",[222,268,270],{"id":269},"权重量化与-kv-cache-量化","权重量化与 KV cache 量化",[218,272,273],{},"权重量化用较少位元表示参数，能压缩权重显存占用，并减少解码时读取权重的内存流量；端到端延迟是否下降，取决于量化内核和硬件能否高效执行。数值近似会改变前向计算得到的 logits。如果最高分 token 与其他候选 token 接近，细微误差就可能改变下一个 token，自回归解码随后会沿着新的文本继续。输出因此可能变化，任务质量却不必然明显下降。",[218,275,276,281],{},[245,277,280],{"href":278,"rel":279},"https:\u002F\u002Farxiv.org\u002Fhtml\u002F2210.17323v2",[249],"GPTQ（GPT 模型后训练量化方法）论文"," 在 OPT（Open Pre-trained Transformer）、BLOOM（BigScience Large Open-science Open-access Multilingual Language Model）等模型及 perplexity、zero-shot 基准上评测了离线权重量化。",[218,283,284],{},"例如，OPT-175B 在 WikiText2 上的 perplexity，FP16 基线为 8.34，4-bit GPTQ 为 8.37。该结果表明这一方案在这个指标上保留了质量，但不能保证其他量化方法、模型或线上对话也有相同表现。论文报告的速度收益依赖定制 GPU kernel 和减少内存搬运的实现。",[218,286,287],{},"权重之外，推理还会保存已处理 token 的 key\u002Fvalue，供后续 token 生成时计算 attention。活动序列越长、并发请求越多，KV cache 通常占用越多显存，因此压缩它能腾出并发空间。KV cache 精度与权重精度是不同的配置维度，调整 KV cache 精度也可能影响回答。",[218,289,290,295],{},[245,291,294],{"href":292,"rel":293},"https:\u002F\u002Farxiv.org\u002Fhtml\u002F2402.02750v2",[249],"KIVI（KV cache 非对称量化方法）论文"," 给出了一个 2-bit KV cache 方案：key 按 channel 量化，value 按 token 量化，并为近期 token 保留全精度残余区。它在 Llama、Mistral 的若干基准上报告较小的质量下降，也评测了 LongBench 长上下文任务；论文同时指出，Falcon 的多查询注意力让原始 KV cache 较小，2-bit 方案在部分任务上可能明显退化。",[218,297,298],{},"论文摘要报告，Llama-2-7B 使用 KIVI 时的峰值总显存约为 FP16 基线的 1\u002F2.6（统计口径包含模型权重）。",[218,300,301],{},"第 4.2.4 节另报告一组吞吐实验：研究者在单张 80GB A100 上使用 ShareGPT 衍生负载，逐步增大 batch 至显存耗尽。以 FP16 基线为比较对象、显存上限相近时，KIVI 可容纳最高 4 倍 batch size，吞吐为基线的 2.35 到 3.47 倍。结果受论文所用模型、硬件和负载限制，不能直接外推为生产服务的速度保证。量化效果取决于方案、模型、任务和运行条件；长上下文质量也不能只凭位宽判断。",[222,303,304],{"id":304},"怎样判断服务是否改过精度",[218,306,307],{},"运营者采用低精度配置有成本动机：较小的权重与 cache 能释放显存，有机会容纳更多并发请求。但研究论文和开源引擎文档证明的是技术可行性，不是某家服务实际做过哪次变更。同样的体感还可能来自模型 revision 或路由、系统提示词、采样参数和推理预算的变化。",[218,309,310],{},"用户侧要判断服务是否变过，需要保留上线初期的同题输出作基线，固定可见的模型版本、输入、采样参数和工具设置，再重复测试短、长上下文任务并盲评。没有历史基线，只能测量当前表现；如果系统提示词、路由或模型 revision 不公开，前后结果的变化也无法定位到量化。",[218,312,313,314,317,318,321],{},"能访问 serving 配置时，可以固定 checkpoint ",[230,315,316],{},"revision","、代码与量化内核、硬件、tokenizer、模板和采样配置，分别比较权重量化与 ",[230,319,320],{},"kv_cache_dtype","。两者可能相互作用，因此还可以补齐四种配置：都不量化、仅量化权重、仅量化 cache、两者都量化。若权重量化方案同时改变激活精度，测到的是整套方案的效果；要单独归因权重，还需固定激活精度或选用 weight-only 方案。",[218,323,324],{},"因此，量化是“体感变弱”的一种可检验解释。要断定某项服务上线后才切换了精度，还需要部署变更记录或能够隔离变量的服务端对照。",{"title":52,"searchDepth":326,"depth":327,"links":328},2,3,[329,330,331],{"id":224,"depth":326,"text":225},{"id":269,"depth":326,"text":270},{"id":304,"depth":326,"text":304},"md",{},{"title":6,"description":7},"posts\u002Fwhy-llm-seems-worse-after-launch",[11,12,13],"faqWYnPlzyu93-KhjKazoPGQKav9S0OY5xeuEC7P1i8",1790730353289]