36:11DeepSeek V4是怎么训练出来的?73页PPT深入解析
本期借助技术报告、73页演示材料和网页解读DeepSeek V4,区分Pro与Flash的定位,重点说明MoE架构、mHC残差连接、分层注意力、Muon优化器及专家训练后蒸馏的思路。作者把百万上下文与成本下降视为主要价值,同时指出竞赛解题、实际工程、长链工具调用和创意写作的表现并不一致,建议根据任务选择,并讨论论文局限与下一代可能方向。
花叔的工作台 / 视频手记
AI工具实测、独立开发与内容创作。先看要点,感兴趣再看完整实践。
模型与趋势 83条
36:11本期借助技术报告、73页演示材料和网页解读DeepSeek V4,区分Pro与Flash的定位,重点说明MoE架构、mHC残差连接、分层注意力、Muon优化器及专家训练后蒸馏的思路。作者把百万上下文与成本下降视为主要价值,同时指出竞赛解题、实际工程、长链工具调用和创意写作的表现并不一致,建议根据任务选择,并讨论论文局限与下一代可能方向。
14:15Gemma 4发布后,花叔梳理不同尺寸模型、多模态输入和本地部署的定位,讨论小模型如何在手机、电脑等设备上承担文档识别与简单任务。视频还用较通俗的方式介绍参数效率、缓存与长上下文设计,并尝试生成一张鹦鹉介绍网页,与其他模型结果比较。案例中出现图片引用失败,因而作者建议把端侧可运行和具体任务是否合适放在一起判断。
18:15围绕一次Claude Code源码泄露事件,花叔借助AI阅读相关文件,讨论模型之外的工程系统如何影响编程工具的体验。视频重点解读静态与动态提示词、权限审查、记忆提取、上下文压缩和文本搜索等设计,并联系自己的开发与写作使用习惯说明其意义。结尾分析这些工程经验对同类产品的启发,同时把源码可见与团队持续迭代能力区分开来。
19:04从DeepSeek一次长时间服务中断切入,花叔回顾当时的用户体验与V4发布传闻,转向解读mHC、原生稀疏注意力和V3.2相关技术思路。视频用电梯、会议等类比解释训练稳定性与长文本计算成本,再据此推测后续模型的方向。结尾把关注点放到智能体任务的调用成本:新模型的意义,除了能力提升,还取决于能否让更长、更复杂的任务用得起。
16:27本期用智谱的龙虾客户端与其默认模型分析英伟达,先完成数据收集和价值投资框架分析,再引入趋势、波浪与CAN SLIM等视角,最后调用已有Skill生成网页报告。作者观察工具调用、复杂指令遵循和长任务执行,强调AI的作用是增加信息与分析视角,最终决策仍由人承担。开场提及的个人收益不构成这套流程能复制回报的证明。
16:00围绕当时的DeepSeek V4发布传闻,花叔选择Engram、mHC和R1论文更新三个切口,讨论模型如何减少不必要的计算。视频把条件记忆比作查字典,用层间连接解释训练稳定性,再关注R1补充披露的训练过程和失败尝试。作者从这些材料提炼出「用更少计算做更多事」的共同方向,并据此提出对下一代模型的预期,强调的是技术线索与个人判断。
9:30本期解读亚马逊云科技re:Invent发布的开发、安全和运维智能体,重点介绍Kiro自主代理的目标驱动、规范确认、并行任务和长时间执行。视频引用大会上的内部项目案例,讨论从逐个指令转向明确目标与验收标准的工作方式;随后介绍情景记忆如何沉淀流程和审查反馈,以及这些工具与云端模型平台的关系。效率数字来自发布会案例,不能直接推定所有团队都会获得相同收益。
19:33本期实演用ClaudeCode搭建的自动化写作流程:从一个新产品选题出发,先调研并保存资料,再给出多个方向供选择,学习参考文章,搜索个人素材,完成初稿、三轮审校与配图,最后在公众号排版器中处理。花叔进一步拆解工作区路由和分步骤规则,强调真实个人素材与优质样文决定文章是否贴近自己的观点和品位,也说明测试类选题需要本人补充实测信息。
7:05本期结合Claude Opus 4.1与OpenAI开放权重的GPT-OSS系列,讨论选择模型时为何要同时考虑任务适配和使用平台。作者分享编程中的个人感受,区分跑分与项目表现,并介绍AWS Bedrock、SageMaker及配套工具链的作用。视频的重点是根据任务组合模型,减少部署、调用和运维负担,而不是只按一个榜单决定使用对象。
5:12在2025年亚马逊云科技中国峰会现场,花叔从展台与分享中梳理生成式AI的企业应用:内容生产延伸到运营,游戏涉及资产生成和体验调整,医药研发用智能体辅助资料处理与文档初稿,安克把AI用于研发及产品创新。视频也记录独立开发者的互动作品,关注模型如何与行业知识和工程流程结合。企业成效主要来自现场案例介绍,医药文档仍明确需要人工参与。
10:13花叔介绍Amazon Bedrock如何把不同厂商模型放进统一的开发与测试环境,并演示申请模型访问权限、在Playground试用的过程。案例包括让DeepSeek R1生成拼图游戏,以及用Amazon Nova生成球鞋图片、制作环绕视频,再根据图片写商品介绍。视频把文本代码、图像、视频与视觉理解串成具体应用场景,也概览当时云服务的账号开通步骤。
14:50本期介绍ClaudeOpus4和Sonnet4发布时的定位,围绕扩展思考与工具调用、并行执行、文件记忆和长任务持续性讨论它们对智能体的意义。实测部分用Cursor生成模型介绍网页,并以同一套提示词制作播客应用原型,对照旧版Claude及Gemini的结果。花叔主要从需求遵从、界面细节和交互完成度评价体验,同时区分普通编程任务与更复杂任务的模型选择。
15:26花叔尝试复刻《坦克世界》一个PVE玩法的部分机制,用AI生成坦克图片与3D资产,再借Unity和DeepSeekV3逐步实现移动、射击、敌人刷新与场景配置。视频讲解对象、组件、脚本和资源导入,也呈现碰撞设置不当导致坦克掉出地面的失败。最终得到的是粗糙的可玩Demo;作者明确指出,它距离商业游戏的完成度、氛围与细节仍很远,创意拆解和持续调试依然由人推动。
17:09本期解读OpenAI的o3与o4-mini发布,重点解释推理模型如何在思考中缩放、裁剪图片,并结合搜索与代码工具完成任务。除官方读图案例外,花叔用两张照片测试地点和活动识别,再讨论编程评测、工具调用、计算投入与模型表现的关系。视频认为模型与智能体应用的边界正在变化,但更全面的真实任务比较仍留待后续验证。
6:37本期围绕GPT-4o图像生成更新展示社区案例和个人尝试,包括照片转绘、场景化单词图、商品与人物组合、广告图、漫画、年龄模拟和UI设计。视频还介绍从草图到生成图片、再接入海螺生成短视频的流程,并讨论文字呈现、风格一致性与细节控制带来的创作空间,以及对设计工作可能产生的影响。
4:28本期围绕「丑咪排行榜」介绍Zion无代码平台的使用:上传猫咪照片获得AI评价,并把用户登录、点数、支付和历史记录接入同一产品。花叔说明,此前模型调用成本与支付接入使产品难以放量,这次通过可视化数据库和行为流补全流程,同时分别调用视觉理解与文本生成能力。视频展示了支付后恢复点数及继续体验,但没有提供长期运营或盈利数据。
14:16本期演示Cursor配合Claude 3.7 Sonnet生成多界面高保真App原型,并讲解提示词如何经过多轮试错形成。为减少长代码截断,作者改用Agent模式,将每个界面拆成独立HTML,再汇总平铺展示。视频依次检查播客、社区和影音等原型,最后现场生成图文视频社交应用,并修复缩略图与设置页,说明视觉原型仍需逐项查看和反馈。
13:18花叔演示「先做可视原型,再转成应用初版」的AI开发流程,用Cursor和Claude 3.7制作习惯养成应用。第一步让AI分析需求、规划页面,再以HTML集中展示多个界面;第二步创建Xcode项目,把原型作为参考继续生成iOS代码。过程中展示长代码被截断的补全方法、编译报错的反馈修复,以及添加习惯、打卡和统计界面的检查,并明确初版距离正式上架仍有工作。
7:29本期围绕GPT-4.5发布时的系统卡和API价格展开评论。花叔梳理官方材料中的知识、幻觉、语言与写作能力描述,对照部分软件工程评估,并质疑较高调用成本与能力提升是否匹配。视频还展示让其他模型翻译报告、推测合理价格并评论实际报价的过程。这些回应被用于辅助讨论,不能作为训练成本或定价合理性的独立证据;本期没有展示GPT-4.5的直接任务实测。
18:14本期介绍Claude 3.7 Sonnet的混合推理与编程特点,讨论为什么应结合真实软件任务和人类偏好评估模型,而不只看竞赛跑分。演示包括网页开发盲测、天气动效页面、参照截图复刻首页,以及将文章整理为SVG信息卡。视频也介绍Cursor中常规与思考模式的选择;Claude Code当时尚未取得测试机会,相关判断属于初步观察。
10:32本期通过腾讯元宝中的DeepSeekR1和混元T1,演示六类日常工作任务:检索新信息、核查文章事实、总结文档并提出问题、撰写邮件、润色已有文字,以及为产品想法生成PRFAQ。案例中既有纠正发布日期,也有从文档里发现产品体验问题。花叔强调把AI放进真实工作流程,提供原始材料与明确视角,并结合来源检查结果,避免只把模型当作答题工具。
3:12本期记录微信AI搜索接入DeepSeekR1时的灰度体验,介绍从搜索框进入功能并选择模型的方式。花叔用自己的账号介绍和小猫补光灯两个问题查看答案,认为当次结果较完整,随后提出观察AI搜索的三个角度:入口是否常用、平台语料是否丰富、信息检索与推理是否有效。他据此讨论微信及其他内容平台的竞争机会,关于市场格局的判断属于当时预测,不能视作已证实结果。
13:00本期针对DeepSeek服务拥堵,梳理本地蒸馏模型、云API、自租服务器和第三方整合产品四类使用路径,再介绍Perplexity、秘塔、Cursor、Windsurf、Monica及自制的DeepSeek伴侣。视频按搜索、文档编辑和聊天等需求说明差异,最后用批量生成脱口秀内容的脚本说明,API还可服务于自动化流程,不只是接入聊天界面。
7:15本期解读DeepSeekJanusPro的技术报告,介绍同时处理图像理解与图像生成的模型思路。视频重点讲述把两类视觉编码分开、扩充训练数据及调整模型规模,并查看报告中的地标识别、文字理解和生成图片示例。花叔也提醒当时展示的生成分辨率较小,不能仅凭部分评分期待所有图像效果领先;对于后续接入聊天产品的设想,视频将其作为个人预测。
公开视频提供字幕整理的摘要与章节;充电专属内容请到B站查看。