QVQ-72B:世上唯一开源免费视觉推理大模型
发表于|更新于|大语言模型
|浏览量:
这应该是当今世上唯一一个完全开源免费的视觉推理大模型,相比海外如OpenAI等贵的要命的o3模型,阿里巴巴最新推出的这个QVQ-72B视觉推理大模型遵循都是Apache 2.0的协议,也就是说权重等完全开源,如果我没有搞错的话,这应该是当今世上唯一一个完全开源免费的视觉推理大模型,它只有72B的参数量,但是它在MMLU多模态测试集和MathVision等数学视觉等测试集上的benchmarks得分却不容小觑。下面我们快速的去魔撘上玩下…
相关推荐

2024-12-22
Kimi视觉推理大模型:差评!
看网上都在吹Kimi的视觉推理大模型,说得神乎其技,可以取代OpnAI 200刀每月的专业版之类的,真有这么厉害吗?这里我们也来快速测试下。 首先,我们来个简单都英语填空题,这种题一般的大模型都能做对,本来就是大语言模型的强项,仅作为最基本验证,它也是没有问题的。 再看第二道题,来个脑筋急转弯,分析推理确实是一大堆的,答案也和预期一样,但是它是实打实的脑筋不转弯都从语言学等角度得出的答案,其实这里在中文语境中用脑筋急转弯思路就能很快得出答案,太阳公公嘛,那太阳肯定是男都啰。况且太阳叫做sun,儿子也读作son,也能得到印证。所以我推定它是不适合做脑筋急转弯的,起码不适合做中文的脑筋急转弯。 下一道数学题,“一口井7米深,有只蜗牛从井底往上爬,白片爬3米,晚上下坠2米。问蜗牛几天能从井里爬出来?”这里要注意解题的关键点是最后一天可能它不会滑下来了。我们看它分析,前几天都没有问题,第四天,白天爬3米,就是到了6米,晚上滑下来2米,到了第4米,第五天,白片爬3米,4+3刚好7米,所以就爬出来了,就不用考虑晚上往下滑了。所以答案是5天就能爬出去。我们看它最终做了一大堆装模作样的推理...
2024-11-29
Nexa AI OmniVision:可本地跑多模态大模型
Nexa AI OmniVision是一款可以在本地设备上运行的多模态大语言模型。与依赖云端API的多模态模型(如GPT-4V)不同,OmniVision经过优化可以在消费级硬件上运行,无需联网即可处理文本、图像和视频输入。它能够理解图片内容、回答关于视觉输入的问题,适合隐私敏感场景和离线环境使用。本视频介绍OmniVision的本地部署方法、性能表现和实际使用体验。 官方博客

2025-02-12
Kimi 1.5推理模型:差评!
国产月之暗面 Kimi 1.5 推理模型测评报告啊!我们知道DeepSeek的推理模型r1轰动全球,而Moonshot同时间推出的Kimi 1.5推理模型号称打败GPT-4o等,还有一帮人网上鼓吹其和DeepSeek r1齐名,看benchmarks的话也确实表现不俗。如此厉害的模型,那我们得赶紧去拿出我们往常的测试用例来测评下了。 来到官网,下面这里选择上K1.5长思考,这样就用上了Kimi 1.5推理模型了… 访问入口
2024-11-29
Claude Analysis Tool-Claude最新在线编码解析文档功能
Claude Analysis Tool是Anthropic为Claude推出的在线代码分析和文档解析功能。它让Claude能够直接运行Python代码、分析数据、生成图表和处理各种文档格式。与传统的聊天界面不同,Analysis Tool提供了一个交互式的代码执行环境——你可以让Claude编写并运行代码来处理你的数据,结果以图表或表格形式直接呈现。这对于数据分析、报告生成和编程学习来说是一个极其强大的功能。 访问入口

2026-05-18
NVIDIA NVLM:比看视频还快十倍!开源视觉模型天花板!
NVIDIA NVLM(NVIDIA Vision Language Model)是英伟达推出的开源视觉语言模型,号称”比看视频还快十倍”!它在视频理解和分析方面达到了惊人的速度——可以在极短的时间内分析整段视频的内容、识别物体和动作。被评价为”开源视觉模型天花板”。本视频测评NVLM在视频理解、图像分析和多模态任务上的表现。 访问入口
2025-09-03
FastVLM! 苹果炸裂开源视觉模型!本地就能跑!
苹果隆重推出最新力作FastVLM,这是一款旨在彻底改变我们与视觉内容交互方式的全新视觉语言模型!出道即王炸,它是目前市场上响应速度最快的VLM之一。想象一下,您的AI模型不仅能实时理解您眼前的一切,还能直接在浏览器中运行,甚至完全离线使用,不用联网就能看图看视频,甚至实时生成字幕。 对于希望在网页应用中集成高性能、低延迟的视觉智能的开发者而言,FastVLM无疑是理想之选。 模型访问入口 代码示例入口 在线访问入口
公告





