deja-vu!跨Agent避坑神器!打通多智能体历史会话
这个开源项目能把你电脑上 Codex、Claude Code 等所有 AI 编程工具的历史聊天记录,变成一份它们共用的记忆:一个 Agent 踩过的坑,换一个 Agent 直接就懂得怎么避。作者是个独立开发者,项目现在快 1000 颗星,但 2000 多个 commit 攒得很扎实。 用法也简单:下载一个 Go 编译好的单文件,跑一行 install,它自动扫描本机所有 Agent 存在磁盘上的会话记录,几秒钟就建好索引,你不需要改任何使用习惯。上次在 Codex 里调通的接口报错,切到 Claude Code,它自己就想起来了,还顺手告诉你哪个文件动过;哪怕是几个月前解决的问题,它都能翻出来。 官方仓库列出的已适配 Agent 有 34 个,除 Claude Code 和 Codex CLI 外,还包括 Cursor、Copilot CLI、Gemini CLI、OpenClaw、opencode、Cline、Kimi Code、DeepSeek Harness、Zed 等。召回不是靠你手动去问:会话开始时、每次提问前、编辑文件前、以及命令执行失败之后,它都会自动递上相关...
Longcat 2.5 Preview 测评报告!这个模型能用吗?
美团在中秋之夜发布了 LongCat 2.5 Preview,本期测评同样用 PI 接入,思考模式上 LongCat 只有开和关两档、不支持分 level 调节,所以直接全部打开来测。 第一题是强约束指令遵循句子生成测试。十句话的结尾确实按顺序从一数到十,约束是守住了,但读下来第六、七、八、九句都不通顺,语言质量没跟上。 第二题是鹈鹕土星环骑自行车 SVG 测试。这个模型显然没有理解土星环这条环形轨道:它不是顺着土星环骑行,而是另外又建立了一条轨道;转弯肯定是不行的,骑到下方就开始倒着走。另外鹈鹕身后那块红色的东西估计是自行车坐垫,无论是什么,一直在变动,也是不对的。 第三题是复合弓射箭 SVG 测试。问题不少:箭感觉是被推出去的而不是射出去的;弓是平射出去的,箭却往上跳跃着,想模拟成抛物线但很假;箭没有射到靶心;画面里也看不到复合弓的副弦,那跟一般弓箭有什么区别。 第四题是实现一个精美的浏览器内操作系统。UI 感觉很一般,右上角的设置弹窗根本不工作,只有一团东西在那里闪烁。压轴的太空射击游戏,虽然说实现了 WASD 控制方向,但按下后飞机只是侧了一下身、并没有移动方向,最...
Laya server!一键部署Laya!Jev开源平替!
前几天分享了当下大火的决策模型 Jev,以及它的开源平替 Laya。但 Laya 本身的问题也很直接:它就是一个 Python 库——Torch 要自己装,权重还得自己去 Hugging Face 拉。 GitHub 上这个新的开源项目 Laya Server 把这些活全干了:一条 Docker run 命令就能全部搞定,而且离线也能跑。它提供了一个网页控制台,你可以自己在上面创建 API Key,也自带 Playground 可以直接玩。 更关键的是,它对外暴露的是一个 HTTP RESTful API,调用方式和直接调用 Jev 几乎没有任何差别。改个地址,就能从云端切回自己的机器;挂个域名做反向代理,就能直接给团队用。 访问入口
Deepseek Harness 官方桌面RC版终于来了!
先祝大家中秋快乐!这期带来一个好消息:DeepSeek Harness 官方 Desktop 版本终于要来了。目前网上已经释出了 macOS 和 Windows 两个版本,不过官方还没有正式官宣——是有眼尖的同学在 DeepSeek Harness 的技术论坛里发现的。 我已经把这两个安装包放到了本站的「AI工具严选」页面,Windows 版和 macOS 版都在,按自己的操作系统点对应链接下载安装就行。 如果你想自己编译官方源码来安装,可以搜一下我上一期「一键编译 DeepSeek Harness 官方桌面端源码」的视频教程,步骤很简单。用这种方式安装还有个好处:每次都能拿到最新版本,而不用等官方打包好再发出来。 感兴趣的话赶紧去试一下吧。AI产品狙击手每天分享免费 AI 工具和技巧,关注我。 访问入口
Deepseek Harness 官方桌面版来了!一键安装教程!
DeepSeek Harness Desktop 桌面版现已可用,功能上完全对齐 Web UI。它把原本需要命令行启动的 Harness 封装成了图形客户端,免去终端和 Node.js 环境,开箱就能用。 目前这个版本暂未正式发版,处于预览阶段,也可以通过源码自行构建。安装方式很简单:在 WebUI 中传入官方 Desktop 入口,即可自动完成安装,稍等片刻就能得到桌面客户端,直接上手使用。桌面端同时提供 macOS 与 Windows 两个平台的安装包,按自己的操作系统选择对应版本即可。 访问入口
Deepseek V4.1 Flash 新版鹈鹕SVG测评报告!
之前有粉丝留言,希望我把 Benchmark 里「鹈鹕骑车」这道题的难度调低之后再重测一遍,这样也能和其他几个模型、包括最近测过的 GPT-6 放在一起横向对比。这一期就来兑现这个承诺。 说起来,这道题原版的提示词确实太难了。后来我专门标注了「转弯的时候动作必须自然平滑,不能出现车身倒立或瞬间闪现掉头」,把难度降了下来,这次就先从 DeepSeek 开始测。开始之前,我们先回顾一下上一次的测评效果。 看结果:这次鹈鹕终于是沿着土星环骑行了,转弯的效果比之前好了很多,整个转弯过程也算比较顺畅。 不过问题还是得说。第一,自行车下方那个很大的「鸡爪」是什么鬼?第二,鹈鹕的翅膀没有扶着车把;第三,鹈鹕的脚跑哪去了?这三个问题在上一次测评里都是没有出现过的,可见 DeepSeek 对这道题的处理确实很不到位。 其余题目没有改动,所以博客上的分数我会继续沿用之前的得分。坦白说,这次总体结果并不比上次好。大家怎么看呢? 访问入口
GPT 6 Luna测评报告!打得过Deepseek吗?
昨天测了 GPT-6 Sol,粉丝们说想看一下比 Deepseek V4 Flash 还便宜的 GPT-6 Luna 在祖传测试用例上的表现。博客上对比了两个模型的价格,确实如此。好,那就来吧。还是在 PI 上接入,思考深度用 Max。 第一题强约束指令遵循句子生成测试,速度挺快的。结尾全部从1到10,全部通顺。但仔细看会发现,10个句子其实是同一个场景中连续的——一个叫小华的学生和老师在教室的场景,第一次见这种情况。句子都是通顺的。 第二题鹈鹕土星环骑自行车 SVG 测试,有几个问题。首先和昨天的 GPT-6 Sol 一样,转弯时用淡入淡出的方式掩盖没有顺利转弯的问题。第二,仔细看脚踏部分,鹈鹕的两只脚其实都在同一侧踩动,右脚没有被自行车挡住。 第三题复合弓射箭 SVG 测试,问题不少。首先人物手臂长度太长,和身高比例不协调,看上去挺吓人。其次弓箭似乎有自己的想法,明明平射,却先掉到地上,然后弹起来再诡异 地射中靶心。 第四题实现精美浏览器操作系统,感觉有点赛博朋克风格。右上角弹窗没有问题,Dock 栏应用也没有问题。太空射击游戏看上去是 3D 画面,但事实上只有 2D,...
大语言模型中Context Window和Maxtokens的区别
这里跟大家说一下大语言模型里面 Context Window 跟 Max tokens 究竟有什么差别。 我们上次测了小米的 MiMo 2.6 Pro,测试时说这个 128K 的 Max tokens 爆了,导致输出没法完成,Pi 那边报错 “response was truncated before completion”,即输出在完成之前被截断了。当时有粉丝留言说:你懂不懂啊,小米那个 Context Window 是 1M,不是 128K。 实际上,Context Window 是你多轮对话能容纳的总窗口,包含历史对话和系统提示词,是所有内容能丢进去的最大窗口。而 Max tokens,也叫 Max output tokens,是你单次输出包含思维链(thinking)和最终输出的总长度,不包含历史记录,是一次性的。 两者完全是两回事。在 thinking 思考阶段爆 Max tokens,在各种 Harness 里,包括 Claude Code、Codex、Deepseek Harness,你连压缩(compact)的机会都没有。 希望看了这个视频,大家能了解到大语...
Space Bunny大模型测评报告!是否能打呢?差评!
OpenCode 新上线的神秘模型 Space Bunny 测评报告来了。这次没法在 PI 里测,只能切换到 OpenCode,同时把这个模型的推理强度开到 high —— 这是它支持的最高 level。 第一题是强约束指令遵循的句子生成测试。看了一下,结尾确实都是从一到十,但只要认真读每一句就会发现,没有一句是通顺的,第一感觉就有点拉胯。第二题是鹈鹕土星环骑自行车的 SVG 动画,效果有点不忍直视,这次都不想找问题了,留给大家在弹幕和评论区一个个吐槽吧。第三题是复合弓射箭 SVG,同样没眼看 —— 这画的是忍者吧,难怪都不需要动、不需要拉弓,然后就突然有一支箭出现在靶子面前,完全是靠意念去控制,佩服佩服。 第四题是实现一个精美的浏览器内操作系统。UI 感觉有点 low,背景也是一片漆黑,太难看了;上方还一直有个「墙纸已更新」的提醒反复弹出来。右上角弹窗的配色也太烂,基本看不清文字。Dock 栏应用里,计算器的 UI 也很烂,下方按钮没法滚动下去。压轴的太空射击游戏只能通过鼠标控制位置和射击,玩下来很不好控制,但起码功能是没有问题的。 第五题是 3D 赛车游戏,功能上没有什...
VideoUse!AI自动剪视频!BrowserUse力作!
剪视频这件事正在被 Agent 重新定义。Browser Use 团队开源的 VideoUse(GitHub 上的 video-use)把剪辑变成了聊天的活:把素材原件丢进一个文件夹,跟 Claude Code、Codex 这些编程智能体说几句话,拿回来的就是剪好的视频。这个项目在 GitHub 上已经收了 2 万多颗星。 它最直接的能力,是替你做掉粗剪里最烦的那部分。素材里的「嗯」「啊」这些口头禅和 NG 停顿,它能自动识别并剪掉;每段画面自动调色;字幕也顺手烧好。口播视频、旅行 vlog、教程录课,丢进去就能让它开剪。 更进一步的是动画叠加。它会给每段动画单独派一个子智能体并行去做,而不是串行硬等,所以往片子里加动效不会把整条流程拖慢。 交付之前还有一道自检:AI 会把所有剪辑点自己过一遍,确认画面不跳、音频不炸,才让你预览。连剪辑记忆都落在 project.md 里,下周打开它还记得上次干到哪,不用从头交代一遍。 详细用法在 GitHub 的 README 里有说明。剪视频做自媒体的兄弟建议试一把——先丢 10 分钟最头疼的口播素材,看它剪得比你快不快。 访问入口









