最近尝试用 LLM 进行一些知识的学习,也会在博客记录一些学习的过程,但发现抛开代码后, LLM 的回答的用词有时候非常奇怪,甚至有些不符合人类的表达习惯。最近学习了一些 Transformer 原理后,对这个事情有了进一步认知,也写了个可视化小工具探索词表,并用它找到了词表里的近义词! 原理 我们以 DeepSeek v4 Flash 为例,来看看它的模型结构,其他 Transformer 模型的结构也大同小异: flowchart TB IN(["input_ids"])…
从 Qwen 3.8 谈谈模型量化与硬件支持
1. 前言 最近 Qwen 3.8 27B 火了起来,很容易在网上看到大家纷纷用 24G 显存的显卡或者统一内存的笔记本跑起来。我实测了一下 Coding 和 Debug 能力也确实有接近 Opus 4.6 的水准,而且配合 Speculative Decoding…
LLM 新人的压榨本地 DeepSeek V4 Flash 推理记
0. 背景 最近 DeepSeek-V4-Flash-0731 模型能力的提升令人瞩目,刚好自己有一台 AMD Strix Halo, 于是就想看看在这台统一内存的 APU 上能跑多快。因此,我跟着 Fable-5 学习了一些 LLM 的基础知识,让 AI 帮我进行了一些优化实验,最终把 batch-1…