梁文锋:DeepSeek背后的扫地僧
发表于|更新于|编程工具
|浏览量:
揭秘AI界“扫地僧”:他靠数学和代码,打造出中国最牛量化私募,如今又要颠覆AI行业!
相关推荐
2025-04-28
DeepSeek R2泄露:联袂华为突破封锁!
DeepSeek R2 遭泄露?当国产大模型之光碰上国产硬件之光,会碰出什么样的火花呢?我们知道R1出来有段时间了,最近通用版本V3.0也升级到v0324, 大家一直翘首以盼R2究竟什么时候出来,将会是什么样的一个配置…

2025-02-10
DeepSeek Browser Use:OpenAI Deep Research免费平替
DeepSeek版Deep Research啊!上两天我才分享了个视频介绍OpenAI最新推出的Deep Research,可以自动搜索上百个网页来帮我们生成专业的报告,可惜需要价值200刀每月的Pro账号才能用。今天我想给大家介绍一个免费的使用方案,就是DeepSeek加我之前介绍过的Browser Use,如果大家不清楚Browser Use的,可以先去翻看下我这个视频。而DeepSeek呢,我们只需要用免费的蒸馏模型就能达到想要的效果…
2025-04-02
DeepSeek Coder:免费零代码创意变APP!
llamacoder接入最新deepseek v3.1,实现免费零代码实现一个app。llamacoder我之前介绍过很多次了,是一个开源项目,由together ai搞出来的。有提供在线访问,也可以本地部署。我们先在线玩下,去到llamacoder… 访问入口
2025-05-03
DeepSeek Prover:最新炸裂模型发布!
号外号外!DeepSeek推出最新炸裂模型!数学证明的终极革命来了!DeepSeek一小时前刚推出DeepSeek-Prover-V2-671B,这将用AI重新定义数学推理的边界! 这款由 DeepSeek打造的超级数学大脑,拥有 6710亿参数 的惊人规模… HuggingFace访问入口

2025-02-08
DeepSeek是怎么做到的?
首先,我们看数据,V3训练用了2788K的GPU Hours,相当于一块GPU用了近300多年,而他们用了2000块GUP,所以用了越2个月时间就训练出来了。对比下LLama 3.1 405B, 它们用了近3100万个GPU Hours来训练,deepseek的11倍还多,同时还要考虑deepseek用的GPU肯定是没有人家老美的性能好的,这也就是为什么V3的训练花费比海外这些同等级别模型低几个数量级的原因,从而打破老美的算力霸权,也打破了顶尖大模型只能掌握在OpenAI和谷歌这些屯了大量卡的大公司的垄断… 官网入口

2025-01-29
Qwen2.5-Max:阿里最新大模型打败DeepSeek V3
阿里推出Qwen2.5 Max,performance打败DeepSeek V3啊。国产大模型真是过年都没有歇着,惊喜一波接着一波啊!废话不多说,赶紧去Demo下,准备让它写个代码试下… 访问入口
公告





