大语言模型自注意力机制究竟是怎么工作的?
这一期用最直白的方式把大语言模型里的自注意力讲一遍,不做很深入的解析,目标是普通人看完也能大概明白 self-attention 到底是怎么回事。 以「我喜欢吃」为例。输入进入大语言模型之后,先走 tokenizer,再配合 word embeddings,得到这四个分词各自对应的向量;这些向量组成一个矩阵,跟着被送进 Transformer,而 Transformer 的第一层就是 self-attention。self-attention 内部有三个已经训练好的矩阵 Wq、Wk、Wv,作用就是算出每一个向量自己的 query、key 和 value。其中 query 是用来去问「我要找前面哪些词跟我相关」的,它需要跟前面其他词的 key 相乘;key 是这个向量的特征值;value 才是这个向量真正携带的信息。 每个向量分别乘上 Wq、Wk、Wv,就都得到了自己的 Q、K、V。轮到「吃」这个词时,就用它的 query 去乘第一个词「我」的 key。向量相乘就是点积,也就是一个向量的长度乘以另一个向量在它方向上的投影——两个向量方向越一致,说明越接近,乘出来的数字就越大。...
PPT Master!生成可编辑PPT!AI PPT从此不再只读!
一个做 PPT 的开源项目,凭什么能在 GitHub 上拿到快 6 万颗星?这可能是我见过的开源 PPT 项目拿过的最多星数了。 答案就一句话:别人家的 AI PPT 导出来是贴图,它导出来的是真的 PowerPoint 图表。右键能编辑数据公式,双击就能改形状,自带调节手柄随便拖,模板版式都是正经继承的。你在 PowerPoint 里手工能做到的,它生成出来就能接着做。 用法一点不复杂:装好 Python,开一个带 agent 的 AI 工具(Claude Code、Cursor、Codex 都行),把 PDF 报告丢进文件夹,在聊天框说句「做套 PPT」,它会先把论点捋顺了,再动手排设计。还有个狠活——把你们公司现有的 PPT 喂给它,它能提炼出品牌模板,以后每套片子自动长成公司的样子。 转场动画和演讲配音也能加,小红书图文、微信封面这类尺寸也能出。全程跑在你自己电脑上,资料不用上传。经常被 PPT 格式折磨的朋友,去它的示例页下载个 PPTX 亲手拖两下,就知道这星数没有一颗是白给的。 访问入口
RAG核心工作原理之余弦相似度!小白也能看懂!
这集接着讲 RAG 里最核心的一步——余弦相似度,它到底是怎么算的。 RAG 的一个核心功能,是把我们的输入向量化,映射到向量空间里,再去向量数据库中找到跟这个输入向量相似的那部分内容取回来,交给大语言模型。那它是怎么找到「相近」的内容的?用的就是余弦相似度。 上一集讲 self-attention 的 Q、K、V 时提过,核心就是两个向量的点积。一个向量乘以另一个向量,结果等于这个向量的长度,乘以另一个向量在它方向上的投影。写成公式就是:a 向量乘以 b 向量,等于 a 的长度乘以 b 的长度,再乘以它们夹角的 cosine。 余弦相似度的公式则是:a 和 b 的点积,除以 a 的长度乘以 b 的长度。而点积本身就等于 a 的长度乘 b 的长度再乘 cos Theta,上下约分一约掉,结果就只剩下 cos Theta。 所以余弦相似度的意思其实就是两个向量的夹角:夹角是 0,说明两个向量基本完全一样;夹角越小代表越相似;离得越远、甚至方向相反,就代表越没有关系。 RAG 正是靠这个来工作的:拿我们输入的向量去和向量库里每个目标向量算余弦相似度,比一比 Theta 夹角的大...
大语言模型基础!全网最简自注意力机制!
上期聊了 DeepSeek 的投机解码,有粉丝接着问了个更基础的问题:self-attention 到底是怎么知道一个词跟哪个词相关的?公式先放一边,把「两个向量相乘」弄明白就够了。 每个词先被切成 token、转成向量,进入 self-attention 之后,每个向量都有自己的 Q、K、V(这三个值具体怎么算出来的,可以留到以后再讲)。要判断「吃」和「我」有多相关,就拿「吃」的 query 去乘「我」的 key;要判断「吃」和「喜欢」的关系,就拿「吃」的 q 去乘「喜欢」的 k。注意力就是靠这种向量相乘算出来的。 为什么两个向量相乘能表示相似度?点积的意义是:一个向量的长度,乘以另一个向量在它方向上的投影。方向基本一致、几乎没有夹角时,投影接近满值,长度乘得多,数字就快速变大;夹角是 90 度时投影为 0,乘出来也是 0,代表这两个向量没有任何关系;如果方向相反,结果就是负数,代表两个向量想表达的意思刚好是相反的。 回到「吃」这个例子:「吃」的 query 乘「我」的 k,如果两个向量方向基本一样,得到的数就比较大,说明它们比较相关;如果乘出来是 0 或者负数,就说明它...
Saluki-27B! 8G 显卡跑 27B 模型!工具调用小钢炮!
Underdog 团队开源的 Underdog-Saluki-27B-1.0,把 27B 参数的 Qwen3.8-27B 压进了 8 个 G 以内,工具调用的能力还基本留着。它在 Hugging Face 上线 3 天就快 6 万次下载,热度来得很直接。 原版 Qwen3.8-27B 全精度要 54 个 G,普通显卡根本放不下。Saluki 这份 2 比特量化的文件只有 7.89 个 G,用标准的 llama.cpp 就能跑:下载完一条 llama-server 命令把服务起起来,8080 端口上就是 OpenAI 那套接口,你手上现成的代码改个地址就能指过来。工具调用和思考都走 Qwen3.8 原生的模板。 量化最容易砸的就是工具调用,而他们是专门往保住这块调的。官方拿 120 道函数调用题测,它过了 88 道,全量版本反而只有 84;100 道并行调用的题它过了 42 道,全量 35 道;9 项基准平均保住了 96%。 想让它响应快点,把思考关掉、温度设成零,一次调用就完事;想让它在难题上多想想也行,默认就是开着的。需要看图,就再下个 600 多兆的视觉文件,启动时挂上...
大语言模型中的投机解码究竟是什么鬼?
今天有粉丝在 B 站私信问:大语言模型里的投机解码(Speculative Decoding)到底是怎么一回事?要把它讲清楚,得先从最基础的 Transformer 说起。 先看一个最简单的大语言模型——只有一层 Transformer、不涉及 MoE 的那种——是怎么工作的。我们输入一段提示词(prompt),第一步是 tokenization:tokenizer 把中文这类文字切成一个个 token。拿到 token 之后,还要去查 word embeddings 这张表,把每个 token 变成对应的向量。向量有了,就往下走 self attention 那一层,算出各个 token 与上下文之间的关系,接着过 FFN。顺带一提,现在常说的 MoE 其实就是在上层加一个路由、用专家池取代传统的 FFN,听不懂也不影响理解后面的内容。 FFN 出来之后还有一个 LM head。它本身很简单,就是一个线性变换:把主干 Transformer 最后输出的隐藏向量作为输入,做一次线性变换,再走一个 softmax 算出概率,判断词表里哪个 token 应该是下一个词。整条链路...
Qwen Image 2.1 Turbo 测评!真的能打吗?
本期测评新发布的 Qwen-Image-2.1-Turbo 图片生成模型,全程在官方千问 AI 平台上实测,并用我们最新的 Benchmark 六道题逐一打分。 第一题考验中文长文本排版,要求生成水彩风的珠海五天行程插画。结果第一天的渔女是测评过的众多模型里做得较好的一个,更让人惊喜的是「鹈鹕」两个字竟然写对了;不过仍有瑕疵——第三天「外伶仃」的「仃」字写错,第五天「推荐」的「推」字也崩了。 第二题是文生图综合能力测试,画面是左撇子咖啡馆里写信的场景。问题不少:提示词要求左手拿笔、右手拿烟斗,模型却反了过来;杯子里的清水本应满到快溢出,也没做到;墙上时钟要求指向 3:45,时针分针都没指对位置;要求清晰可见的「亲爱的阿珍,见字如面」旋转过来看后发现字不对、字数也不对;提示词还要求窗玻璃映出执笔的左手,最终同样没能实现。 第三题考同一角色多视角一致性,要求画出女孩四宫格不同角度的图片。首先布局就不是四宫格;提示词要左手单手抱猫,四个都没做对;粉色发夹应在右鬓却戴到了左边;猫咪眼睛本应左蓝右黄,图一、图三都不对;人物左眉的痣几乎看不到,图一放大后依稀可见反倒在右边;缺口门牙这一...
可灵图片3.0测评报告!结果惨不忍睹!免费没好货啊!
这一集用最新的 Benchmark 测评可灵免费用户当前能用的最高图片版本可灵3.0,看下和之前测过的各种文生图模型比起来表现如何。 第一题:中文长文本排版支持测试(水彩风珠海五天行程插画) 生成效果问题颇多。首先左边”珠海渔女”完全不是珠海渔女的形象,上次测的 Nano Banana 2.1 和 Flux 3 生成的渔女都比它好。其次文字布局混乱,有些在上方有些在下方,数字也杂乱无章让人摸不着头脑——渔女和日月贝下面各标了个”2”,长隆海洋王国下面也有个”2”,不知道想表达什么。第三错别字太多,多到懒得去数。国产模型生成中文水平如此,实在出人意料。 第二题:文生图综合能力测试(左撇子咖啡馆写信) 生成图完全不对。首先完全看不到男人,其次很难判断右上方那个男人是镜子内的像——提示词说的是窗外反射看到拿笔的左手,并没有要求有镜子。第三左手拿笔右手拿烟斗的肢体要求也完全反了。第四文字方向不对。第五文字内容应该是”亲爱的阿珍,见字如面”,实际完全不符。第六杯子里的水应该满到快溢出,实际不是。第七咖啡应该是半杯。第八要求有个空杯子没看到。第九墙上的挂钟明显不是三点四十五分。问题太多...
千问办公实战(32)!AI表格数据可视化神器!
老板给你一张销售明细Excel表,想要做成精美的数据看板,过去可能要花上几个小时,现在用千问办公的AI技能,10分钟就能搞定。 我们打开千问办公客户端,点击左侧菜单栏的「技能」,找到官方内置的「AI表格数据可视化」Skill,一键安装。随后开启新的任务会话,用斜杠命令唤起这个Skill,直接上传你的Excel文档。接下来只需要告诉AI你想要做成什么样的数据看板,比如「做成钉钉数据看板」,AI就会自动在钉钉文档上为你创建好数据,并生成一张漂亮的可视化图表。 整个过程全程不需要10分钟,从数据上传到看板生成全部自动化。对于需要经常做销售数据汇报的运营、市场、财务人员来说,这个Skill大幅提升了数据呈现的效率,让汇报者能把更多精力放在分析结论而非制图操作上。 访问入口
ARTEX!AI 自主渗透开源神器!Agent 攻防赛冠军!
开源才两天,就传出黑客拿它真打银?这个名叫 ARTEX 的冠军级 AI 渗透系统,让一群 Agent 自己收资、拆任务、跑工具、找漏洞、写报告,连”修没修好”都有复测 Agent 自动回填。配个 Key、配个域名,红队活儿几乎全自动,界面上 Planner 怎么想、Worker 怎么打,全过程留痕。Docker 一键起,2000+ Star 只是个开始。 ARTEX 由 Autumn-27 团队开发,核心创新是双图架构:资产图统一管理域名、子域名、IP、端口、服务、端点等资产数据,探索图跟踪攻击目标、意图、事实和发现成果。Planner 负责生成攻击意图和任务分解,Worker 执行具体任务并调用真实安全工具(nmap、nuclei、curl、bash 等)。 系统内置人机审批工作流,高风险操作需人工确认,全程记录流量并支持审计与干预。所有发现、资产和攻击路径持久化到 PostgreSQL,解决了大语言模型常见的上下文溢出问题。支持 Docker 一键部署,默认运行在 8787 端口。需要注意的是,该工具仅限本地隔离环境使用,严禁直接对线上系统发起未经授权的扫描。 访问入...









