Jev大模型API接入和测评报告!
Jev 这两天的风头可谓无两。上一期我们介绍过它是个什么鬼——一个只做分类和判断、不写字的模型,能有这样的热度着实难能可贵。这一期就来解决实际问题:它到底该怎么用,以及它和普通大语言模型相比,性能究竟差多少。 接入本身并不复杂。准备好 API key 后,可以直接照着 OpenRouter 上的示例调用,我这里做了一层简单封装。要记住它不是聊天模型,而是一个决策模型,决策类型只有三种:choice 做选择、score 判断得分、noul 做是非题。代码里的 state 就是你的测试用例,比如「用户抱怨被重复扣款两次」;questions 里放的是模型需要做出的判断类型和标准。我把三种类型都塞了进去:choice 按 criteria 标准判断这条陈述该归哪个部门处理,noul 判断用户是否有退款诉求,score 打分判断这件事有多紧急。 跑出来的结果很直观。重复扣款那一条,它判定应该由 billing 计费部门处理;退款意向的 noul 测试,它认为用户有 90% 的概率要求退款;工单紧急度打分 1.46,归档结论是「要尽快处理,但还没到阻塞用户的程度」——每个结果都还附带...
Jev模型究竟是个什么鬼?凭什么海外爆火?
Jev 最近红透半边天——不止海外火了,国内也火得一塌糊涂。它到底是个什么鬼?简单说,它不是聊天模型。用法非常朴素:丢一段文本进去,再给一组带类型的问题,它一个字都不写,直接回概率。问题只有三种:choice 给几个选项让它挑一个,score 按你的量表打分,布尔判断则返回「是」的概率。 这恰恰是我们过去一直用 JSON 硬凑的东西。大模型吐出的那个 0.9 只是个字符,不是真概率;而 Jev 给的是校准过的真概率——它说 90%,就真有九成概率会答对。这让人想起几年前跟着吴恩达学深度学习时最早学的监督学习:训练一个分类器,分辨哪些邮件是垃圾邮件、哪些评论是负面评论。区别在于,传统分类器每换一个任务就得重新训练,标签也是焊死的;Jev 一个模型通吃,工单归哪类、评论正不正、消息急不急,同一套接口全扔给它,还不用人标数据训模型。 速度和成本是它爆火的直接原因。实测走 OpenRouter,输入每百万 token 4.2 美分,输出免费——因为根本没有逐字生成这回事。官方给出的端到端延迟是 70 到 500 毫秒。有开发者把 20 个任务串起来跑完,成本刚过一美分的十二分之一。...
security-audit-skill:Cloudflare下场造Skill!补全分为编程最后安全这一环!
只要是网民,Cloudflare 的安全验证你肯定见过——它可以说是全球网络安全领域的扛把子了。而 Cloudflare 前两天在 GitHub 上开源了一个叫 security audit skill 的技能,只要你对项目代码有安全需求,都建议看一看。目前它在 GitHub 上已经 12K 颗星了。 它干的事说白了就一件:给你的 Claude Code 这类 AI 编程助手加上代码安全审计的能力。 用法也很简单,一行命令装上,然后跟 agent 说一句”帮我审一遍这个项目”,它就会分 6 个阶段干活——先摸清架构、画出攻击面,再派一堆相互隔离的 agent 分头找漏洞。比如接口有没有越权、依赖包有没有被投毒、AI 功能会不会被提示注入骗走数据,它都挨个排查。 值得注意的是,找漏洞的和验证漏洞的不是同一个 AI。每个疑点都会丢给一个全新的 agent 去反驳,驳不倒的才算实锤。挖出来的漏洞会直接标好哪个文件、哪一行,开发拿到就能改。 它管的也宽:第三方库有没有被人动过手脚、服务器配置有没有留后门、网页代码会不会被塞恶意脚本,十来个大类都替你盯着。官方测过一遍,就能抓到差不多...
BrowserSkill!AI接管已登录浏览器!腾讯最新开源神器!
现在只需要对 DeepSeek Harness 说一句”帮我看下B站流量情况”,它就直接进入你已经登录好的B站后台干活——不用另开浏览器让你重新登录。这就是腾讯开源的 BrowserSkill,GitHub 上已经四千多颗星。 安装只需三步:一行命令装好叫 BSK 的 CLI,给浏览器加个扩展,再跑一下 BSK doctor 确认连上。之后后台的订单数据、竞品挂的价格、邮箱里等着回的邮件,都能在你的登录态里直接搞定。 它不霸占你的浏览器。任务跑在一个独立可见的 Agent 窗口里,你自己的窗口照常干活。真要动你开着的标签页,得先申请借用,用完还得还回来。碰到验证码、扫码登录确认弹窗这种机器搞不定的坎,它会停下来喊你接手,你点完它接着往下跑。 它不挑 Agent,Cursor、Claude Code、Codex、DeepSeek Harness 这些能在 Shell 里跑命令的都接得进来。Chrome 和 Edge 装个扩展就行。天天让 AI 帮忙点网页的兄弟可以先装上,挑一个只有登录才看得到的页面让它读一遍试试。 访问入口
GLM 5.3 FlashX测评报告!究竟有多能打?
智谱最新发布的 GLM 5.3 FlashX 测评报告来了,还是在 PI 中接入、思考深度放大最高。来看看这个高速版本实际表现如何。 第一题:强约束指令遵循——句子生成测试。 生成速度相当快,有点 DeepSeek V4 Flash 的味道,起码比 GLM 5.3 Flash 快多了。仔细检查生成的句子,第四、六、七、八、十句为了凑成数字结尾都硬生生去掉了单位,读起来不太通顺。 第二题:鹈鹕土星环骑自行车 SVG 测试。 效果不错,虽然这几期提示词难度调低了,但 GLM 5.3 FlashX 依然是第一个实现得比较完整的模型,值得肯定。 第三题:复合弓射箭 SVG 测试。 如果不吹毛求疵的话,还算是可以的了。非要挑毛病的话也有不少:箭是被弓箭手推出去的而不是射出去的,弓弦应该在复合弓左边,但弓箭手却用右手拉弓,存在方向矛盾。 第四题:精美浏览器操作系统。 UI 看上去不错,右上角弹窗、dock 栏应用功能都没有问题,太空射击游戏则是这题的压轴大戏——可惜效果不大行,飞机和子弹离得太远,不移动的话根本看不出子弹是从自己飞机发射出去的,子弹大、飞机小,如果游戏能实现得更好这题应...
Qwen 3.8 Omni Flash 全模态测评!究竟有多能打?
Qwen 3.8 Omni Flash 全模态模型来袭,我们的测评报告当然不能落下。因为是全模态模型,所以先测多模态能力,然后再看大家要求要不要测推理和编程。由于在线上测试,不知道免费额度能测多少,本次测试按最关心的顺序来。 第一题:HTML 游戏复刻。 给它一个简单的左右移动接住星星的小游戏视频,让它通过 HTML 复刻这个游戏。实现完成后打开看,实际效果像模像样,但有个问题:只能通过鼠标控制,键盘上下左右无法操控——而这个游戏明显应该支持键盘控制。 第二题:鸳鸯图片辨别。 给它一张鸳鸯图片,让它分辨雄鸳鸯和雌鸳鸯的数量。图片中应该有五只雄鸳鸯、四只雌鸳鸯,最左边是一只野鸭。模型回答四雄五雌,刚好说反了。 第三题:图像细节辨析。 让模型找出图片中的不同之处,它指出第一行第四列的菱形不端正、有所倾斜。实际检查后确认确实如此,判断正确。 第四题:电影出处匹配(老无所依)。 给一张老无所依电影截图,看模型是否能找出出自哪部电影。第一次给了截取较远的图,模型回答星际穿越,错了。这道题很少有模型能做对——不是辨别不了图片内容,而是在根据内容匹配电影时出错。换成更清晰的截图后,这次成...
Union Alpha 神秘模型测评报告,真的能打吗?
OpenRouter上突然出现的神秘模型Union Alpha,开发者信息仅标注为”Stealth”,没有任何实验室背书,上线首日就消耗了20亿Token,目前预览期完全免费。赶紧来测一测它到底能不能打。 测试说明:本次测试保留了三道SVG题目(鹈鹕骑车等),难度略有降低;由于模型目前免费且限速,测评过程中会出现限速报错,属正常现象。 第一题:强约束指令遵循测试。 句子生成测试要求每句话结尾都是1到10的数字。实测发现第七句不符合结尾要求,第八句严格来说也不够通顺。 第二题:鹈鹕土星环骑自行车SVG测试。 相比之前的测试难度有所调整。总体效果不错,尤其是左边转弯做对了。细节上还有两个问题:自行车骑到右边时还是倒过来了,以及骑到顶部时不是在土星环上面骑而是骑到了土星顶部去了,空间感稍差。但这是第一个做对一半转弯的模型,还是值得肯定的。 第三题:复合弓射箭SVG测试。 复合弓做得比较简陋,弓箭箭头是反的、第二根弦没看到、拉弦方向也有问题,轮子缺少拉距调节模块和瞄准镜等细节。整体比较水。 第四题:实现精美浏览器操作系统。 UI比较清新,弹窗没问题,Dock栏应用功能正常。压轴的太...
一只鹈鹕难倒海内外一众顶尖大语言模型!
想将一张视频封面图片里”小鸟”的文字改成”鹈鹕”,竟然发现难倒了海内外一众号称最能打的模型,最终只有最后一个做到。 首先看一下字节豆包的效果——风马牛不相及。Kimi 则是把可怜的免费积分用完了都没弄完,还自己写代码去做,最后恬不知耻地告诉用户”代码写好了直接跑,你这些都是虚拟机上的路径和环境,我跑个毛线啊”。百度的文心一言做出来的也不知道是什么鬼,不忍直视。腾讯混元选了 HY4 Preview,也是接近但不行。 国内的全军覆没,那看一下海外最强的两家。谷歌的 Nano Banana Pro 有点意外,前面的题字对了,但第二个字错了,如果偏旁也做成古字就成功了。OpenAI 最新的 GPT Image 2.5 其实成功生成了”鹈鹕”两个字,只是没有调整原来文字的位置和大小,导致挤压在一起了。迄今为止生成中文最接近的竟然是个海外模型,心里五味杂陈。 最后看下千问的——竟然成功了,简直不敢相信自己的眼睛。以防万一再试一次,卧槽还是成功了,国内模型扳回一局。 整个测试下来发现,中文文字结构稍微复杂点,大部分大模型都处理不好,但大家都在高大上地吹 AI 要取代人类了。要不先做好”鹈...
豆包2.1 Pro测评报告!真的能打吗?
豆包刚出的 doubao-seed-2.1-pro 测评报告来了。这次测评依然在 Pi 上接入来做,上下文、Max tokens 和思考模式全都开到最大。 第一题是强约束指令遵循句子生成测试。句子确实都从 1 到 10 结尾,乍看没什么问题——但不仔细看差点被它糊弄过去:只看尾部几个字的话所有句子都挺顺,可读完整句就会发现,第 5、7、9 句都是不通顺的,挺狡猾。 第二题鹈鹕土星环骑自行车 SVG 测试,前几天测了好几个国内顶尖大模型都做不好,结果豆包更离谱——鹈鹕和自行车直接不见了。 第三题复合弓射箭 SVG 测试,真抠细节的话问题不少:头断了,轮子也不是复合弓的轮子,反而像个闹钟。不过毕竟是 SVG,可能不用太强求。这里比较严重的问题是弓弦只有一根,而复合弓和一般弓箭不同,不会只有一根弦。 第四题浏览器内操作系统,UI 看上去还可以,但右上角的弹窗点下去却跑到左上角去了;Dock 栏的计算器不工作,点几次等于号都没算出结果;压轴的太空射击游戏其他都还好,就是没法移动——按下左右键一放手,飞机立刻回弹到原来的位置,根本没法好好控制。 第五题 3D 赛车游戏,画面太模糊,根...
千问办公实战(26),一键生成专业图表!数据可视化神器!
做数据展示时,手动绘制专业图表费时费力。千问办公内置的 EChart 技能,可以让你用自然语言一句话生成折线图、饼图、柱状图等多种专业图表。 操作方法很简单:点击左侧技能菜单,找到 EChart 技能并安装。EChart 是前端开发者熟悉的专业图表库,千问办公的这项 skill 背后调用的正是该库的能力。安装完成后,新建任务,通过斜杠命令唤起技能,直接输入提示词描述你想要的图表即可。 以折线图为例,只需告诉它你要展示的数据维度和标题,几秒钟内就能生成一张带样式主题的专业图表。适合需要经常做数据汇报、做 PPT 写文档的朋友收藏使用。 访问入口









