DeepSeek V4是怎么训练出来的?58页论文深入解读
在我看来,DeepSeek不是一个冲破天花板的SOTA模型。它真正的价值是把百万上下文、Agent原生能力、能接受的价格这三件事第一次绑在了一起。
做过的事,走过的路,都写在这里。
选一个手上的问题,从一篇实践开始。
AI工具、独立开发、内容创作,边读边动手。
在我看来,DeepSeek不是一个冲破天花板的SOTA模型。它真正的价值是把百万上下文、Agent原生能力、能接受的价格这三件事第一次绑在了一起。
先说个我很特么无语的事。我从2023年3月GPT-4发布起,连续订了三年多的ChatGPT Plus,两周前刚点了取消。
我昨晚在X上发了条我要开源「Huashu Design」的预告,现在已经20多万阅读了。
只工作不上班的这几年,我越来越觉得自己在运营一家「一人公司」,每隔一阵就给它添一名新的数字员工,上周跟大家介绍过我的品牌部了...这周新来的是四位投研顾问。
我只扔给它 两样东西 : 这篇文章的初稿,和一张《神奈川冲浪里》的图作为视觉参考 。它在两次对话里把下面这些东西全给我长出来了。
一、阿西莫夫的学科阿西莫夫在《基地》里虚构了一门学科叫心理史学。主角哈里·谢顿用数学方法预测银河帝国的未来。
普通人该怎么在AI时代赚钱? 以下是我见过的最好的回答,来自乔布斯.skill 👇
前段时间我在即刻上吐槽了一件事,就是一连数次,有好几个人拿着和豆包聊天的结果给我当建议...有我50多岁的丈母娘,有和我对接的某视频平台的运营。
他们发布了一个叫Claude Mythos的新模型,10万亿参数,比现在最强的Claude Opus 4.6还要高出一整个档次。然后他们说:这个模型我们不公开发布,因为它在网络安全方面的能力太强了,公开了会出大事。
但,他们说暂不打算公开发布这个模型 ? ? ? 原文:https://www.anthropic.com/glasswing
昨天我在X和即刻上玩了个抽象,说我准备出下一本书了,《把同事作为Skill》。万万没想到,很多人信以为真了,还在评论区祝贺和表示期待。
TLDR:Claude Code的1902个源文件意外泄露。我翻完之后发现,这是一份关于「harness engineering」的绝佳教材。
昨天刷X的时候,看到一张图在疯传。有人统计了Anthropic从2月1号到3月24号的产品发布记录,做了一张shipping calendar。
林俊旸,前通义千问Qwen负责人,北大外语硕士,阿里最年轻P10。
B站做了个「AI新热榜」,目的是帮助新人通过B站快速学习了解AI新概念。
3月20日,Cursor发了条推,发布了「自研」的 Composer 2 模型。
我的OpenClaw橙皮书📙好像真的有点火。最近甚至收到了一个高中的邀请,让我去给学生们讲讲龙虾到底是什么。
晚上突然看到马斯克发了一条推:「Impressive work from Kimi」。
大多数人低估了昨天 Claude开放 100 万上下文长度的更新,从 200K 到 1M,上下文长度其实不是提升到原来的 5 倍,而是 7 倍、8 倍、9 倍。
最近养龙虾🦞这事有多火,我就不赘述了,我都已经写过相当多文章了。
1所有活着的东西都有一个共同点:它们有自己的节律。心脏跳动,花开花落,细胞分裂。你不需要去叫醒一棵树,到了春天它自己会发芽。
GPT-5.4发布了。说实话,我犹豫了半天要不要写这篇。真的被模型发布搞疲了。
之前写DeepSeek R1论文解读的时候,有个细节我一直没想通。他们的Cold Start流程是用R1-Zero生成推理轨迹,过滤后当训练数据。
3月2日,阿里千问发布了Qwen3.5小尺寸模型系列。马斯克在X上点了赞,评价说「令人惊叹的智能密度」。