GPT-6 究竟强在哪?各大benchmarks详细解读!
GPT-6 跑分直接杀疯了!本期视频深度解读 OpenAI 官方放出的全套 benchmark 数据,看看 GPT-6 真正的强项在哪里。 推理能力 ARC-AGI-3 拿下 98.6%,近乎满分,主打原生智力和全新任务零提示摸索能力 Claude-Fable-5.1 得分 87.8%,GPT-6 大幅领先 数学实力 Frontier Math Tier4 斩获 97.6%,大幅抛离 Claude-Fable-5.1 的 87.8%,数学实力实测碾压 办公智能体 Agents Last-Exam 得分 59.3%,考察 AI 自主操控电脑完成复杂工作 3D 建模型空间感知 BenchCAD 达到 95.9%,相比 Fable 5.1 高出十个百分点以上,空间能力提升巨大 编程基准 DeepSWE 仅 73%,略低于 Gemini-3.8-Flash 的 73.7%,编程表现反常偏弱 其他基准 Terminal-Bench-Science 拿到 64%,终端科研实操能力出众 Exploit-Bench 漏洞挖掘安全测试直接满分 100% 跑分解读完毕,后续...
全球大模型怎么玩?Openrouter竟然支持微信支付!
分享一个很尴尬的冷知识,估计很多人早就知道,唯独我才后知后觉。OpenRouter 聚合了海量海内外大模型,我一直误以为只能靠境外信用卡才能充值,直到今天才解锁新姿势。点开个人头像,选择 credit 余额板块,点击 add-credit 充值入口,一定要勾选 use one time payment methods 这个选项,之后就能看见支付宝、微信支付的通道。不用海外银行卡,也可以轻松充值,体验平台上面各式各样的海外大模型。之前白白绕了不少弯路,属实有点尴尬…… 访问入口
AI产品狙击手!大模型性价比一览表!哪个模型最能打?
想要快速摸清一款新出大模型的真实实力、调用价格,算出它的性价比,可以看看我做的这个小工具: AI 产品狙击手平台。之前更多给大家介绍过平台的 AI 工具严选板块,选中例如 Agnes‑AI 这类工具,既能一键跳转访问入口,还可以点开视频标签,查看实测测评视频,提前了解工具真实上手效果。而查询大模型实力就打开 LLM 测评专区,所有主流模型统一使用同一套 benchmark 测试用例打分,像刚测完的 Gemini 3.8‑Flash 拿到 49 分(满分 60),点开详情就能查看每一道测试题的得分与扣分原因,配套的测评视频也可以一键直达,保证测评分数有据可查。看完性能之后再前往模型参数价格板块,谷歌 Gemini 3.8‑Flash、千问 3.8‑Flash‑0902、混元 Hy4‑Preview、GLM‑5.3、Claude‑Fable‑5.1 等一众新品的最新报价全部收录在内。结合实测得分与 API 价格两项数据对比,哪个模型才是性价比之王,一眼就能判断出来…… 访问入口
千问办公实战(21)!这一看就是AI做的?怎么一键去AI味?
做内容创作、靠 AI 产出文案的小伙一定要留意!刷视频频时你肯定听过”战斗力度拉满”这类话术,浓郁的 AI 腔很容易让观众产生抵触心理。像深耕、致力于、最前沿,都是大模型高地产出的标志性词汇,一眼就能识破机器痕迹。 我拿一段 Deepseek 生成 的自我介给给家演示,原文 AI 味很重,经过修改之后几乎分不清是人写还是 AI 生成。想要快速去掉方案的机器感,可以在千问办公启用 AI 文本优化 skill,下达去除 AI 味的指令。工具会逐项标出 AI 话术、给出修改理由,输出一份接地气、说人话的改写文稿。 掌握这个去 AI 腔的小技巧,你的内容创作效率就能再上一个台阶…… 访问入口
Gemini 3.8 Flash测评报告!真的能打吗?
谷歌 Gemini–3.8–Flash 测评报告出炉!此次依旧使用 V2.1 升级版祖宗测试用例,在 AI Studio 平台拉满思考深度进行实测。约束束句子生成全部十条通顺达标;新版 24 点三道解法全部合规正确;高难度 7 位密码锁推理顺利答对,单论推理表现甚至优于 Fable 5.1。 来到编程项目,浏览器操作系统 UI 精致,弹窗、Dock 栏运行正常;太空射击游戏具备 3D 效果,但同时按下方键和空格会中断射击,碰撞缺乏反馈效果;3D 赛车游戏画面简陋,车辆存在漂移问题;Trello 看板卡片拖拽正常,但是列表拖动换位功能失效。 综合整套测试,这款模型推理实力亮眼,不过代码实现方面还有不少短板有待优化…… 访问入口
微软开源音频转录神器!解决了什么难题?
平时测评 AI 工具我一般都会先讲痛点,而这款微软开源项目直接看 53.5K 的 Star 数量,就值得先收藏再说。它最亮眼的能力就是一次性处理 60 分钟长音频,不用手动切割分片。市面上绝大多数 ASR 识别工具遇到长录音都需要拆分音频,拆分之后很容易造成上下文断裂,原理和 RAG 文档分片问题十分相似,切割后的片段丢失全局语义,识别总结效果大打折扣。而它完整保留一小时音频的全部上下文,最适合一小时时长的会议录音一键生成纪要,也可以二次开发做成智能录音笔类应用,衍生玩法想象空间巨大。模型体积仅 1.58G,CPU 环境就可以直接运行,无需高配显卡,企业部署门槛很低…… 访问入口
Qwen 3.8 Max 新版测试!究竟有多能打?
Qwen 3.8 Max 新版实测报告来了!官宣编程能力大幅升级、登陆 CodeArena 榜单,今天就在 Deepseek Harness 拉满思考深度,用上 V2.1 祖传测试用例一探究竟。 强约束句子生成任务全部通过,十条语句通顺达标;三解 24 点题目前两个解法正确,第三个误用开立方出现违规参数;难度升级的 7 位密码锁推理宣告无解,推理环节翻车。 编程测试取消无头浏览器 UI 校验,纯看模型原生输出。浏览器操作系统 UI 精致、弹窗与 Dock 栏运行正常;太空射击游戏 3D 效果到位,但空格键和鼠标点击无法发射子弹,存在功能 bug;3D 赛车游戏整体体验尚可,少量障碍物贴图粗糙;Trello 看板 UI 观感舒适,拖拽增删改功能运行稳定。 访问入口
Fable 5.1 测试报告!究竟有多能打?
最新 Fable 5.1 测试报告出炉!直接上 V2.1 升级版祖传测试用例开测。 强约束句子生成全部 1—10 结尾,语句通顺达标;新版需要三个解法的 24 点任务,仅两条答案合格;高难度 7 位密码锁推理顺利拿下,推理实力过硬。 编程测试取消无头浏览器 UI 校验,纯看模型原生编码输出。浏览器操作系统 UI 精致、弹窗与 Dock 栏运行正常;太空射击游戏完成度堪称第一梯队,3D 渲染、战机效果一流;3D 赛车游戏画面出彩;无第三方库开发的 Trello 看板功能整体可用,只是 UI 观感比较普通。 一轮测试明显感觉当前 V2.1 测试题库已经有点跟不上它的实力,如果越来越多模型达到这个水准,祖传测试用例就得直接升级到 V3 版本了…… 访问入口
腾讯Hy4最新测评报告!究竟有多能打?
混元 Hy4‑Preview 的 Workbuddy 实测报告来了!之前在 Claude Code 付费测评体验一般,最大槽点就是响应速度慢。这次借着 Workbuddy 免费福利,同时升级到 V2.1 版基准测试用例重新开测。强约束句子生成任务当中模型输出文风偏古文,自评结果 10 条语句仅 5 条达标;新版三解 24 点题目第三个解法出现数字重复,没能通过;难度升级的 7 位密码锁推理顺利答对。编程板块表现亮眼,浏览器操作系统、太空射击游戏、3D 赛车游戏完成度较高,交互与 3D 渲染效果在线;Trello 看板拖拽增删改核心功能正常,唯独 UI 多出一个突兀加号按钮。综合整套评测来看,Hy4‑Preview 实力可圈可点,在 Workbuddy 生态加持之下适配效果更佳…… 访问入口
Qwenwork入门(20)!一键实现精美动画效果!
大家先来看看我在千问办公生成的这款可爱计算器,界面看着不错,可惜缺少动画交互,体验平平。再看第二个版本,同样可爱的外观,亮点却是流畅的交互动画,按键按下有真实回弹效果,计算数值还带有滚动动画,效果十分出彩。 放在以前,手动调试这类顺滑动画往往要耗费大半天时间。现在实现起来却格外轻松,直接发送提示词,在千问办公装上 gsap-skills 插件就搞定。之后开发页面时,你只管描述想要的动画效果,不用死记 GSAP 各类动画参数,AI 就能自动生成对应的动画代码,感兴趣的小伙伴可以动手试一试…… 访问入口









