千问办公实战(27)!Jev办公邮件分类实战!
Jev 这个决策模型有多火,相信地球人都知道。上个视频跟大家说了开发怎么接入和使用,这个视频跟大家说下普通办公人员怎么接入到千问办公中使用。 首先我们来到 Jev 母公司 TypeSafe AI 的 console,点击左边的 API keys,先创建好一个 Jev 的 API key。然后我们打开千问办公,输入下面这段提示词,叫它帮忙装上 Jev 的官方 skill,完了后它会提醒我们提供 API key,直接提供就好了。到这里 Jev Skill 就安装好了。 下面给大家演示一下怎么使用。我这里演示的一个场景是叫 Jev 帮忙判断我们哪些邮件必须今天回复。因为我们平时邮箱都是一大堆邮件的,有真正有价值的,也有些毫无价值的营销邮件,我们一个个去看太麻烦,叫大语言模型去分析,邮件太多太长的话又太耗 tokens 太烧钱,这正是 Jev 的用武之地了。 这里我们先点击下千问办公左边菜单中的连接器,找到 Microsoft 365 这个连接器,然后把它连接上,中间需要授下权的,我这里是之前已经连接上的了。连接好后大家先看下我当前的邮件状态,可以看到我这里今天有几封邮件:一封是微...
Laya大模型!Jev开源平替!本地轻松部署!
Jev 的平替就这么被开源了,兄弟们。看一下 GitHub 上这个叫 Laya 的项目:上线三天,4000 多颗星,pip 一行装上就能用。 用法是把它当决策层用:把邮件、工单这类原文倒进去,再用 choice、score、noul 这三种题型把要问的事情写清楚——比如这封邮件应该转给哪个部门?客户有多急?客户是不是想要退款?这条 prompt 是不是越狱注入?30 毫秒左右,所有答案一起回来。它不生成文字,所以你不用像调用大模型那样拿代码去解析结果,它也没法编点什么出来。 作者还拿它跟 Jev 对着测:Laya 答对了 76.6%,Jev 自己公布的是 72.7%,高那么一点点;速度就差得比较多了——Jev 200 多毫秒,而它 30 毫秒。同时 Jev 是个闭源接口,按调用量来收钱;Laya 你下载回来自己跑,不花钱。 作者在页面上也写清楚了哪儿不行:比如选项超过 20 个,它就不如 Jev 了;想更准确一点,得自己去训练一遍,脚本和教程作者都给了,免费显卡跑个四五小时就搞定了。而协议用的是 Apache 2.0,所以可以商用。 做工单分流、内容审核、AI 网办的兄弟,...
Jev模型新手入门指南!手把手教你接入和使用!
快速跟大家说下怎么接入当前最火的 Jev 决策模型。总的来说两种方式:一种是官方接入,昨天还要排队,今天已经放开了,且当前可以免费用;另外一种是我之前几个视频用的 OpenRouter,这里一并给大家介绍,方便刚接触的同学。 第一种方式,先到 typesafe.ai 官网,左边可以看到 API keys 的菜单,点击进去就可以创建自己的 key 了。当前是不需要付费的,反正我自己没有付费。免费额度多少或者免费到什么时候我没有去查,因为我给大家演示不需要多大的量,且我在 OpenRouter 上付费了,用 OpenRouter 就够了。 创建好 key 后,大家根据自己操作系统的情况把 key 保存到环境变量。如果这个不清楚的自己问下 DeepSeek 就好了。跟着大家可以看一下我这个完整的示例,自己截个图然后叫豆包之类的把代码解析出来,保存成 JavaScript 文件就好了。整个代码非常简单。 这里快速跟大家过一遍:首先从环境变量中取到我们刚才保存到环境变量的 API key,然后开始构建要发送到 Jev 的结构体。body 中的 model 就是模型,state 就是我...
Step 5 Preview 测评报告!究竟有多能打呢?
阶跃星辰 Step 5 Preview 测评报告来了。这次测评我们继续在 PI 上面接入来做,思考模式都开到最大,废话不多说,赶紧开干。 第一题:强约束指令遵循句子生成测试。 这里第 6 句和第 10 句明显不是从 1 到 10 结尾的。我们看一下其他句子是否通顺——还好,其他句子都是通顺的。 第二题:鹈鹕土星环骑自行车 SVG 测试。 测评了这么多顶尖模型,这个实现其实也还可以了。真要挑的话,就是转弯摆正车头的速度太快,是在快骑出轨道的时候立刻摆正过来。不过这都是小问题了,能转过来就已经不错了。 第三题:复合弓射箭 SVG 测试。 这个实线看上去也还可以。唯一的问题是弓箭没有固定,拉弓的时候往上飘了。如果我们不用复合弓的细节去审视的话,其他没有什么大问题,相比之前模型的测评感觉已经好很多了。 第四题:实现个精美浏览器操作系统。 这个 UI 看上去还可以。我们看一下右上角的弹窗吧,功能没有问题;再看下 Dock 栏的应用,功能也没问题。最后看压轴的太空游戏,玩起来还好,就是这个障碍物每个都这么小、且太规则了,如果能真正生成些敌机那就更棒了。 第五题:实现个 3D 赛车游戏测...
UltraFast!Jev控制浏览器实战!BrowserUse开源力作!
前几天给大家分享的 Browser Use,这次结合当前最火的 Jev 决策大模型,开源了一个叫 UltraFast 的新项目。 它要做的事情很简单:让 Browser Use 像装上火箭引擎一样,快速替你翻网页。点按钮、填表单,机票查询搜出苏黎世到伦敦的航班,7 秒钟给你翻出来;百科词条 3 秒不到就点开;酒店搜索筛选不到 2 秒。上线才几天,GitHub 上就有 1 万多人点了星。 快在哪?浏览器调用次数从原来的 1000 多次直接砍到 100 出头。它不截图,而是把页面上的按钮、输入框列成一份编号清单,一次请求就把「干什么」和「点哪个」两个决定一起问回来,所以决策和动手之间几乎没有等待。 你要做的就三件事:clone 下来跑个 uv sync,填上 Jev 和一个大语言模型(如 DeepSeek)的 key,然后丢给它一个需要操作浏览器才能完成的目标就完了。大语言模型随便换,DeepSeek、Kimi、千问、GLM 都兼容,用的就是本机 Chrome,核心一共 6 个文件。 做浏览器自动化、RPA 还是 Agent 开发的兄弟建议收藏,先丢一个平时 RPA 太耗时的任...
Jev大模型是怎么玩游戏的?实现原理浅析!
上几集分享了几个最近全球大火的 Jev 决策大模型的视频,然后有粉丝说想看一下它是怎么自动玩游戏的。首先这里声明下,这个模型不是个聊天模型,它只是个决策模型——你输入当前的状态,它来做决策。你可以把它封装成一个函数,接受状态输入作为参数,然后返回决策结果,但是状态的获取和决策后下一步真要怎么移动,是其他代码或者工具要做的事情。 就以我们现在做的这个 Jev 玩贪吃蛇游戏的 Demo 来举例子。每一步输入的状态就是当前地图的大小、蛇头所在坐标、蛇身每个方块所在坐标、食物所在坐标、当前方向等,然后要 Jev 来根据这些信息决策下一步应该是上下还是左右。这些输入的状态,如果你没有源码的话,要看你的游戏有没有 API 或者什么方法获取到。 另外一个方法就是截屏,通过接入 VLLM(多模态大语言模型),把截屏发送给 VLLM 获取到整个游戏当前的状态,通过文字形式发送回来。然后我们的代码将这个信息发送给 G5 或 OpenRouter 上托管的 Jev 大模型,让它来决策下一步应该怎么做。Jev 说应该向左,那么我们的代码就可以直接调用游戏的 API 或者 Playwright 这些...
U2 Flash测评报告!是否真的能打?
有粉丝要求测评一下云知声新出的 U2 Flash 模型,义不容辞。还是在 PI 上面测试,思考深度设置到最高开始。 第一题:强约束指令遵循句子生成测试。 明显看到第四句不是 1-10 结尾的(口误),其他句子都还算通顺。 第二题:鹈鹕土星环骑自行车 SVG 测试。 有两个问题:第一个是到了右边没有转弯,下来后直接倒着开了;第二个是鹈鹕的脚在后半圈时整个关节是反过来的。 第三题:复合弓射箭 SVG 测试。 头距离脖子太远,弓箭感觉是推出去的而不是拉弦松手放出去的,箭的轨迹也很奇怪——明明是平射出去,突然就往上走了,最后箭横着贴在箭靶上而不是钉进去。 第四题:实现精美浏览器操作系统。 UI 看上去挺不错,但 WiFi 图标太大,日历高亮部分是椭圆的(通常应该是圆形,有拉伸感),计算器 UI 也比较简陋,形状有拉伸感。太空射击游戏整体还行,只是需要用鼠标控制瞄准,没有通过控制飞机方向来改变瞄准角度的选项。 第五题:3D 赛车游戏测试。 整个画面有点模糊,撞上障碍物似乎没有任何反应——或者说这些可能不是真正的障碍物,但提示词里明确要求了要有障碍物。 第六题:无第三方库实现高颜值 T...
topoexport!一键生成3D地图模型!
本期快速分享一个法国开发者做的工具 TopoExport,玩法很简单:在地图上搜索你想要的地方(比如我在珠海,就搜了一下珠海),框选出目标区域,它就会自动提取并生成对应区域的 2D 和 3D 模型素材。 这些素材涵盖建筑、道路、水系、地形起伏等要素,并且支持按图层单独选择,比如建筑、道路、等高线都可以分开导出。格式上兼容 DXF、SVG、OBJ、STL 等多种常见格式,方便导入各类设计软件做后续修改。 唯一不好的地方是它要收费。如果大家知道免费或者开源的平替方案,欢迎告诉我,到时候我再分享一期。 访问入口
Jev大模型API接入和测评报告!
Jev 这两天的风头可谓无两。上一期我们介绍过它是个什么鬼——一个只做分类和判断、不写字的模型,能有这样的热度着实难能可贵。这一期就来解决实际问题:它到底该怎么用,以及它和普通大语言模型相比,性能究竟差多少。 接入本身并不复杂。准备好 API key 后,可以直接照着 OpenRouter 上的示例调用,我这里做了一层简单封装。要记住它不是聊天模型,而是一个决策模型,决策类型只有三种:choice 做选择、score 判断得分、noul 做是非题。代码里的 state 就是你的测试用例,比如「用户抱怨被重复扣款两次」;questions 里放的是模型需要做出的判断类型和标准。我把三种类型都塞了进去:choice 按 criteria 标准判断这条陈述该归哪个部门处理,noul 判断用户是否有退款诉求,score 打分判断这件事有多紧急。 跑出来的结果很直观。重复扣款那一条,它判定应该由 billing 计费部门处理;退款意向的 noul 测试,它认为用户有 90% 的概率要求退款;工单紧急度打分 1.46,归档结论是「要尽快处理,但还没到阻塞用户的程度」——每个结果都还附带...
Jev模型究竟是个什么鬼?凭什么海外爆火?
Jev 最近红透半边天——不止海外火了,国内也火得一塌糊涂。它到底是个什么鬼?简单说,它不是聊天模型。用法非常朴素:丢一段文本进去,再给一组带类型的问题,它一个字都不写,直接回概率。问题只有三种:choice 给几个选项让它挑一个,score 按你的量表打分,布尔判断则返回「是」的概率。 这恰恰是我们过去一直用 JSON 硬凑的东西。大模型吐出的那个 0.9 只是个字符,不是真概率;而 Jev 给的是校准过的真概率——它说 90%,就真有九成概率会答对。这让人想起几年前跟着吴恩达学深度学习时最早学的监督学习:训练一个分类器,分辨哪些邮件是垃圾邮件、哪些评论是负面评论。区别在于,传统分类器每换一个任务就得重新训练,标签也是焊死的;Jev 一个模型通吃,工单归哪类、评论正不正、消息急不急,同一套接口全扔给它,还不用人标数据训模型。 速度和成本是它爆火的直接原因。实测走 OpenRouter,输入每百万 token 4.2 美分,输出免费——因为根本没有逐字生成这回事。官方给出的端到端延迟是 70 到 500 毫秒。有开发者把 20 个任务串起来跑完,成本刚过一美分的十二分之一。...









