早上介绍了Kimi K2 Thinking,看官网上各种benchmarks着实厉害,推理拳打GPT-5,编码脚踢Claude 4.5的。那得赶紧裤兜里套出我们大语言模型测评系列的那套测试用例,到官网上试下。废话不多说,来到官网。这里我们选择K2, 工具这里打开长思考。那就来吧…