Kimi K2 Thinking测评报告!打败GPT-5?
发表于|更新于|大语言模型
|浏览量:
早上介绍了Kimi K2 Thinking,看官网上各种benchmarks着实厉害,推理拳打GPT-5,编码脚踢Claude 4.5的。那得赶紧裤兜里套出我们大语言模型测评系列的那套测试用例,到官网上试下。废话不多说,来到官网。这里我们选择K2, 工具这里打开长思考。那就来吧…
相关推荐
2025-09-09
Kimi K2 0905发布!不全面测评报告!
Kimi K2 模型刚发布了 0905 最新版本,号称编程能力进一步做了增强,上下文长度从 128K 扩展到 256K,还提供了支持 60到100 Token每秒输出速度的高速版 API。可惜的是还是没有支持多模态和推理模式。在手机app和官方网页版已经全量进行了升级。 这里为了响应粉丝“欧豪的小格格”的要求,准备对其进行下测评,这次主要会测评下编程能力。同时也会测几道推理题。好,那就开始吧 访问入口
2025-07-24
Qwen3-2507测评!超越Kimi K2?
上个视频介绍了阿里最新推出的开源大模型Qwen3 2507, 看官方介绍的这么天花乱坠的,承诺会找些cases测评下,那就来吧。来到QwenChat,选中对应模型。开始测试 访问入口
2025-11-14
第二个DeepSeek?Kimi K2 Thinking强在哪?
这两天都在聊 Kimi K2 Thinking 有多牛,都在说这是今年我们国内出现的第二个 DeepSeek。但看到很多视频都是流于官方给出的 Benchmarks 也就是性能测试结果,很少有人真正拿出这两个模型的架构来说事。这里我特意找了下它们两个的架构图,我们稍微比较下。左边是 DeepSeek,右边是 Kimi K2 Thinking,我们来聊下它们的区别…
2025-07-15
国产版Claude?Kimi K2测评报告!
moonshot 推出开源 kimi k2,这是个万亿参数的混合专家架构,每次激活 320 亿参数,直接对标claude opus!如此厉害,我们来实测下它真是的performance究竟如何… 访问入口
2025-11-14
Kimi K2 Thinking!凭什么打败GPT-5?
Kimi K2 Thinking 杀到!这个模型有点不一样哦! 昨天聊为什么大家做开发都喜欢用 CLI 和 IDE 我就已经提了下它有点特别了。今天打算花点时间继续聊下它。这个模型厉害之处在于它和以前的思考模型有很大不一样,以前的模型都是在思考完成后,才开始干活,开始调用工具的,而 Kimi K2 Thinking 则是可以做到一边进行思考,一边调用工具,然后再根据工具的输出结果继续进行深入思考的。它这种“思考-行动-反馈-再思考”的循环模式,让它变成了一个真正的超级智能体… 访问入口
2025-09-28
Manus国内平替?Kimi通用智能体杀到!
说到通用AI智能体方面,相信大家脑海立刻出现的就是manus,但访问要魔法是一直让人诟病的。今天要介绍的Kimi K2最新推出的OK Computer,也许能成为你国产版的manus。可惜的是,每个月只有3次的免费额度,这相比manus人家每天都有免费额度赠送就差得有点远了。不过我们总有办法可以绕过去的。哈哈。这就不提了。大家喜欢的话赶紧用起来吧… 访问入口
公告





