Jev大模型是怎么玩游戏的?实现原理浅析!
上几集分享了几个最近全球大火的 Jev 决策大模型的视频,然后有粉丝说想看一下它是怎么自动玩游戏的。首先这里声明下,这个模型不是个聊天模型,它只是个决策模型——你输入当前的状态,它来做决策。你可以把它封装成一个函数,接受状态输入作为参数,然后返回决策结果,但是状态的获取和决策后下一步真要怎么移动,是其他代码或者工具要做的事情。 就以我们现在做的这个 Jev 玩贪吃蛇游戏的 Demo 来举例子。每一步输入的状态就是当前地图的大小、蛇头所在坐标、蛇身每个方块所在坐标、食物所在坐标、当前方向等,然后要 Jev 来根据这些信息决策下一步应该是上下还是左右。这些输入的状态,如果你没有源码的话,要看你的游戏有没有 API 或者什么方法获取到。 另外一个方法就是截屏,通过接入 VLLM(多模态大语言模型),把截屏发送给 VLLM 获取到整个游戏当前的状态,通过文字形式发送回来。然后我们的代码将这个信息发送给 G5 或 OpenRouter 上托管的 Jev 大模型,让它来决策下一步应该怎么做。Jev 说应该向左,那么我们的代码就可以直接调用游戏的 API 或者 Playwright 这些...
U2 Flash测评报告!是否真的能打?
有粉丝要求测评一下云知声新出的 U2 Flash 模型,义不容辞。还是在 PI 上面测试,思考深度设置到最高开始。 第一题:强约束指令遵循句子生成测试。 明显看到第四句不是 1-10 结尾的(口误),其他句子都还算通顺。 第二题:鹈鹕土星环骑自行车 SVG 测试。 有两个问题:第一个是到了右边没有转弯,下来后直接倒着开了;第二个是鹈鹕的脚在后半圈时整个关节是反过来的。 第三题:复合弓射箭 SVG 测试。 头距离脖子太远,弓箭感觉是推出去的而不是拉弦松手放出去的,箭的轨迹也很奇怪——明明是平射出去,突然就往上走了,最后箭横着贴在箭靶上而不是钉进去。 第四题:实现精美浏览器操作系统。 UI 看上去挺不错,但 WiFi 图标太大,日历高亮部分是椭圆的(通常应该是圆形,有拉伸感),计算器 UI 也比较简陋,形状有拉伸感。太空射击游戏整体还行,只是需要用鼠标控制瞄准,没有通过控制飞机方向来改变瞄准角度的选项。 第五题:3D 赛车游戏测试。 整个画面有点模糊,撞上障碍物似乎没有任何反应——或者说这些可能不是真正的障碍物,但提示词里明确要求了要有障碍物。 第六题:无第三方库实现高颜值 T...
topoexport!一键生成3D地图模型!
本期快速分享一个法国开发者做的工具 TopoExport,玩法很简单:在地图上搜索你想要的地方(比如我在珠海,就搜了一下珠海),框选出目标区域,它就会自动提取并生成对应区域的 2D 和 3D 模型素材。 这些素材涵盖建筑、道路、水系、地形起伏等要素,并且支持按图层单独选择,比如建筑、道路、等高线都可以分开导出。格式上兼容 DXF、SVG、OBJ、STL 等多种常见格式,方便导入各类设计软件做后续修改。 唯一不好的地方是它要收费。如果大家知道免费或者开源的平替方案,欢迎告诉我,到时候我再分享一期。 访问入口
Jev大模型API接入和测评报告!
Jev 这两天的风头可谓无两。上一期我们介绍过它是个什么鬼——一个只做分类和判断、不写字的模型,能有这样的热度着实难能可贵。这一期就来解决实际问题:它到底该怎么用,以及它和普通大语言模型相比,性能究竟差多少。 接入本身并不复杂。准备好 API key 后,可以直接照着 OpenRouter 上的示例调用,我这里做了一层简单封装。要记住它不是聊天模型,而是一个决策模型,决策类型只有三种:choice 做选择、score 判断得分、noul 做是非题。代码里的 state 就是你的测试用例,比如「用户抱怨被重复扣款两次」;questions 里放的是模型需要做出的判断类型和标准。我把三种类型都塞了进去:choice 按 criteria 标准判断这条陈述该归哪个部门处理,noul 判断用户是否有退款诉求,score 打分判断这件事有多紧急。 跑出来的结果很直观。重复扣款那一条,它判定应该由 billing 计费部门处理;退款意向的 noul 测试,它认为用户有 90% 的概率要求退款;工单紧急度打分 1.46,归档结论是「要尽快处理,但还没到阻塞用户的程度」——每个结果都还附带...
Jev模型究竟是个什么鬼?凭什么海外爆火?
Jev 最近红透半边天——不止海外火了,国内也火得一塌糊涂。它到底是个什么鬼?简单说,它不是聊天模型。用法非常朴素:丢一段文本进去,再给一组带类型的问题,它一个字都不写,直接回概率。问题只有三种:choice 给几个选项让它挑一个,score 按你的量表打分,布尔判断则返回「是」的概率。 这恰恰是我们过去一直用 JSON 硬凑的东西。大模型吐出的那个 0.9 只是个字符,不是真概率;而 Jev 给的是校准过的真概率——它说 90%,就真有九成概率会答对。这让人想起几年前跟着吴恩达学深度学习时最早学的监督学习:训练一个分类器,分辨哪些邮件是垃圾邮件、哪些评论是负面评论。区别在于,传统分类器每换一个任务就得重新训练,标签也是焊死的;Jev 一个模型通吃,工单归哪类、评论正不正、消息急不急,同一套接口全扔给它,还不用人标数据训模型。 速度和成本是它爆火的直接原因。实测走 OpenRouter,输入每百万 token 4.2 美分,输出免费——因为根本没有逐字生成这回事。官方给出的端到端延迟是 70 到 500 毫秒。有开发者把 20 个任务串起来跑完,成本刚过一美分的十二分之一。...
security-audit-skill:Cloudflare下场造Skill!补全分为编程最后安全这一环!
只要是网民,Cloudflare 的安全验证你肯定见过——它可以说是全球网络安全领域的扛把子了。而 Cloudflare 前两天在 GitHub 上开源了一个叫 security audit skill 的技能,只要你对项目代码有安全需求,都建议看一看。目前它在 GitHub 上已经 12K 颗星了。 它干的事说白了就一件:给你的 Claude Code 这类 AI 编程助手加上代码安全审计的能力。 用法也很简单,一行命令装上,然后跟 agent 说一句”帮我审一遍这个项目”,它就会分 6 个阶段干活——先摸清架构、画出攻击面,再派一堆相互隔离的 agent 分头找漏洞。比如接口有没有越权、依赖包有没有被投毒、AI 功能会不会被提示注入骗走数据,它都挨个排查。 值得注意的是,找漏洞的和验证漏洞的不是同一个 AI。每个疑点都会丢给一个全新的 agent 去反驳,驳不倒的才算实锤。挖出来的漏洞会直接标好哪个文件、哪一行,开发拿到就能改。 它管的也宽:第三方库有没有被人动过手脚、服务器配置有没有留后门、网页代码会不会被塞恶意脚本,十来个大类都替你盯着。官方测过一遍,就能抓到差不多...
BrowserSkill!AI接管已登录浏览器!腾讯最新开源神器!
现在只需要对 DeepSeek Harness 说一句”帮我看下B站流量情况”,它就直接进入你已经登录好的B站后台干活——不用另开浏览器让你重新登录。这就是腾讯开源的 BrowserSkill,GitHub 上已经四千多颗星。 安装只需三步:一行命令装好叫 BSK 的 CLI,给浏览器加个扩展,再跑一下 BSK doctor 确认连上。之后后台的订单数据、竞品挂的价格、邮箱里等着回的邮件,都能在你的登录态里直接搞定。 它不霸占你的浏览器。任务跑在一个独立可见的 Agent 窗口里,你自己的窗口照常干活。真要动你开着的标签页,得先申请借用,用完还得还回来。碰到验证码、扫码登录确认弹窗这种机器搞不定的坎,它会停下来喊你接手,你点完它接着往下跑。 它不挑 Agent,Cursor、Claude Code、Codex、DeepSeek Harness 这些能在 Shell 里跑命令的都接得进来。Chrome 和 Edge 装个扩展就行。天天让 AI 帮忙点网页的兄弟可以先装上,挑一个只有登录才看得到的页面让它读一遍试试。 访问入口
GLM 5.3 FlashX测评报告!究竟有多能打?
智谱最新发布的 GLM 5.3 FlashX 测评报告来了,还是在 PI 中接入、思考深度放大最高。来看看这个高速版本实际表现如何。 第一题:强约束指令遵循——句子生成测试。 生成速度相当快,有点 DeepSeek V4 Flash 的味道,起码比 GLM 5.3 Flash 快多了。仔细检查生成的句子,第四、六、七、八、十句为了凑成数字结尾都硬生生去掉了单位,读起来不太通顺。 第二题:鹈鹕土星环骑自行车 SVG 测试。 效果不错,虽然这几期提示词难度调低了,但 GLM 5.3 FlashX 依然是第一个实现得比较完整的模型,值得肯定。 第三题:复合弓射箭 SVG 测试。 如果不吹毛求疵的话,还算是可以的了。非要挑毛病的话也有不少:箭是被弓箭手推出去的而不是射出去的,弓弦应该在复合弓左边,但弓箭手却用右手拉弓,存在方向矛盾。 第四题:精美浏览器操作系统。 UI 看上去不错,右上角弹窗、dock 栏应用功能都没有问题,太空射击游戏则是这题的压轴大戏——可惜效果不大行,飞机和子弹离得太远,不移动的话根本看不出子弹是从自己飞机发射出去的,子弹大、飞机小,如果游戏能实现得更好这题应...
Qwen 3.8 Omni Flash 全模态测评!究竟有多能打?
Qwen 3.8 Omni Flash 全模态模型来袭,我们的测评报告当然不能落下。因为是全模态模型,所以先测多模态能力,然后再看大家要求要不要测推理和编程。由于在线上测试,不知道免费额度能测多少,本次测试按最关心的顺序来。 第一题:HTML 游戏复刻。 给它一个简单的左右移动接住星星的小游戏视频,让它通过 HTML 复刻这个游戏。实现完成后打开看,实际效果像模像样,但有个问题:只能通过鼠标控制,键盘上下左右无法操控——而这个游戏明显应该支持键盘控制。 第二题:鸳鸯图片辨别。 给它一张鸳鸯图片,让它分辨雄鸳鸯和雌鸳鸯的数量。图片中应该有五只雄鸳鸯、四只雌鸳鸯,最左边是一只野鸭。模型回答四雄五雌,刚好说反了。 第三题:图像细节辨析。 让模型找出图片中的不同之处,它指出第一行第四列的菱形不端正、有所倾斜。实际检查后确认确实如此,判断正确。 第四题:电影出处匹配(老无所依)。 给一张老无所依电影截图,看模型是否能找出出自哪部电影。第一次给了截取较远的图,模型回答星际穿越,错了。这道题很少有模型能做对——不是辨别不了图片内容,而是在根据内容匹配电影时出错。换成更清晰的截图后,这次成...
Union Alpha 神秘模型测评报告,真的能打吗?
OpenRouter上突然出现的神秘模型Union Alpha,开发者信息仅标注为”Stealth”,没有任何实验室背书,上线首日就消耗了20亿Token,目前预览期完全免费。赶紧来测一测它到底能不能打。 测试说明:本次测试保留了三道SVG题目(鹈鹕骑车等),难度略有降低;由于模型目前免费且限速,测评过程中会出现限速报错,属正常现象。 第一题:强约束指令遵循测试。 句子生成测试要求每句话结尾都是1到10的数字。实测发现第七句不符合结尾要求,第八句严格来说也不够通顺。 第二题:鹈鹕土星环骑自行车SVG测试。 相比之前的测试难度有所调整。总体效果不错,尤其是左边转弯做对了。细节上还有两个问题:自行车骑到右边时还是倒过来了,以及骑到顶部时不是在土星环上面骑而是骑到了土星顶部去了,空间感稍差。但这是第一个做对一半转弯的模型,还是值得肯定的。 第三题:复合弓射箭SVG测试。 复合弓做得比较简陋,弓箭箭头是反的、第二根弦没看到、拉弦方向也有问题,轮子缺少拉距调节模块和瞄准镜等细节。整体比较水。 第四题:实现精美浏览器操作系统。 UI比较清新,弹窗没问题,Dock栏应用功能正常。压轴的太...









