花叔的工作台 / 视频手记

跟着花叔,动手试试。

AI工具实测、独立开发与内容创作。先看要点,感兴趣再看完整实践。

模型与趋势 83条

11:44
01摘要与章节

GPT-6 Astra做3D绝了!我两天建了一座能开车的巴黎(赠300页手把手教程)

花叔把此前的巴黎地图项目升级成可驾驶的3D场景,演示Codex与Tripo分工完成素材和交互的流程:先生成参考图,再制作模型、调整网格、拆分部件、绑定动作,最后由AI编程接入游戏。近景地标、车辆和树木使用生成资产,远景街区与河流则保留程序化建模,以兼顾细节和性能。视频还展示Unity游乐园与小王子星球,说明素材生成之后仍需要组装和功能实现。

看摘要与章节 →AI3DTripo
36:38
02摘要与章节

买了最贵的模型,为什么还是用不好AI?|B站AI圆桌全程回放+Reaction

花叔与三位创业者、开发者从各自的AI投入聊起,讨论同样的模型为何会产生不同工作成果。花叔分享按项目组织文件、渐进读取上下文和维护工作流程的方法,并提醒一人公司仍要找到真实需求、交付产品、接触用户。圆桌还结合自行车研发、供应商会议和软件验证,展示知识库如何进入实际业务;视频作者在回看中补充团队转型与公开分享的实践反思。

看摘要与章节 →AI工作流知识库
12:18
03摘要与章节

你敢让手机里的AI替你付钱吗?全球首款大模型原生智能体手机拆解!

本期以桌面智能体的使用经验为参照,拆解阶跃智能体手机与StepAOS的系统设计思路。视频认为手机智能体需要原生接口、工具协议、跨任务记忆及端云调度,才能把目标转化为跨应用操作,并讨论感知、权限、过程留痕和撤回机制。旅行规划等场景是基于发布会资料的推演;作者明确表示尚未拿到真机,因此这是一组架构判断与体验预期,而非产品实测结论。

看摘要与章节 →智能体手机系统架构
17:07
04摘要与章节

Claude Fable 5最后的绝唱!我用它 5 小时做了个桌面App,已开源!【B站AI创造公开赛】

本期先介绍ClaudeFable5发布时的能力与使用安排,再展示花叔用其开发的Mac桌面应用。这个开源工具围绕终端智能体工作流,把文件浏览、上下文提供、结果预览和任务提醒放到同一界面,减少在Finder、终端与编辑器之间切换。视频还演示图片标注、HTML查看、浏览器录屏和跨平台图文填充等小工具,强调从自己的具体工作障碍出发,用AI快速实现并持续完善产品。

看摘要与章节 →自家产品Claude
16:14
05摘要与章节

我逆向了Claude Design!一句话帮你生成任何出色设计,开源后狂揽GitHub 1.6万+stars!【B站AI创造公开赛】

花叔展示将AI设计工作整理为可复用流程的尝试,围绕演示稿、个人主页、待办应用原型和产品宣传动画做四个案例。流程从确认听众、目标与风格开始,先提供样稿,再根据反馈继续制作,并通过截图检查和修复布局。个人主页案例还演示从一张饮料店照片提取色彩与视觉规则。视频关注的是如何让设计更贴近具体内容、品牌和用途,而不只生成一个页面。

看摘要与章节 →AI设计交互原型
13:42
06摘要与章节

我让一个AI,帮我装另一个AI

花叔用MAVIS演示让AI操作电脑完成任务的过程,从安装Ollama、查询设备配置并选择本地模型开始,再延伸到技能适配、文件整理和手机远程交办。后半段同时推进软件安装、知识解释、文章配图、桌面归类与文件查找,展示任务如何分给不同执行模块,以及遇到安装错误后继续排查的过程。视频关注自然语言指派到实际操作之间的衔接,也保留任务耗时和检查结果的环节。

看摘要与章节 →MAVIS电脑自动化
36:11
07摘要与章节

DeepSeek V4是怎么训练出来的?73页PPT深入解析

本期借助技术报告、73页演示材料和网页解读DeepSeek V4,区分Pro与Flash的定位,重点说明MoE架构、mHC残差连接、分层注意力、Muon优化器及专家训练后蒸馏的思路。作者把百万上下文与成本下降视为主要价值,同时指出竞赛解题、实际工程、长链工具调用和创意写作的表现并不一致,建议根据任务选择,并讨论论文局限与下一代可能方向。

看摘要与章节 →DeepSeek模型训练
17:25
08摘要与章节

【首发】GPT-5.5实测!吊打Claude 4.7?DeepSeek紧随其后

花叔先阅读GPT-5.5的发布介绍与系统卡,梳理编程、工具使用和工作任务方面的官方评测,再用SVG绘图、动态介绍视频、地震监测网页与演示稿做体验比较。实测既展示可用的页面和视觉效果,也指出文字重叠、图片排布等问题,并对照Claude的不同设计取向。视频特别提醒,模型自报完成不能替代结果核验,发布数据和实际交付仍需分别观察。

看摘要与章节 →模型实测GPT-5.5
15:22
09摘要与章节

【实测+解读】Claude Opus 4.7发布!最强模型刷新

本期解读Claude Opus 4.7的编程、视觉与文档能力更新,并围绕系统卡讨论评估情境识别、模型自述和思维链监督等实验发现。随后用Skill配合模型生成带天气动效的网站,以及基于英伟达季报的多视角分析和演示文稿。视频主要观察任务执行与视觉交付,同时提出对模型行为研究的兴趣;有关情绪或意识的表述属于讨论,不能直接证明模型具有人的体验。

看摘要与章节 →Claude模型评测
14:15
10摘要与章节

谷歌最新模型Gemma4发布!深度解析+送42页资料

Gemma 4发布后,花叔梳理不同尺寸模型、多模态输入和本地部署的定位,讨论小模型如何在手机、电脑等设备上承担文档识别与简单任务。视频还用较通俗的方式介绍参数效率、缓存与长上下文设计,并尝试生成一张鹦鹉介绍网页,与其他模型结果比较。案例中出现图片引用失败,因而作者建议把端侧可运行和具体任务是否合适放在一起判断。

看摘要与章节 →Gemma端侧AI
18:15
11摘要与章节

Claude Code源码泄露!首发解读51万行代码!

围绕一次Claude Code源码泄露事件,花叔借助AI阅读相关文件,讨论模型之外的工程系统如何影响编程工具的体验。视频重点解读静态与动态提示词、权限审查、记忆提取、上下文压缩和文本搜索等设计,并联系自己的开发与写作使用习惯说明其意义。结尾分析这些工程经验对同类产品的启发,同时把源码可见与团队持续迭代能力区分开来。

看摘要与章节 →Claude CodeAI编程
19:04
12摘要与章节

DeepSeek史上最长宕机!新模型V4来了?

从DeepSeek一次长时间服务中断切入,花叔回顾当时的用户体验与V4发布传闻,转向解读mHC、原生稀疏注意力和V3.2相关技术思路。视频用电梯、会议等类比解释训练稳定性与长文本计算成本,再据此推测后续模型的方向。结尾把关注点放到智能体任务的调用成本:新模型的意义,除了能力提升,还取决于能否让更长、更复杂的任务用得起。

看摘要与章节 →DeepSeek模型解读
16:27
13摘要与章节

🦞美股收益629%,智谱的匿名龙虾模型写出了投行级分析

本期用智谱的龙虾客户端与其默认模型分析英伟达,先完成数据收集和价值投资框架分析,再引入趋势、波浪与CAN SLIM等视角,最后调用已有Skill生成网页报告。作者观察工具调用、复杂指令遵循和长任务执行,强调AI的作用是增加信息与分析视角,最终决策仍由人承担。开场提及的个人收益不构成这套流程能复制回报的证明。

看摘要与章节 →智能体Skill
16:00
15摘要与章节

DeepSeek V4将发布!梁文锋连发3篇论文,我读完发现一个规律

围绕当时的DeepSeek V4发布传闻,花叔选择Engram、mHC和R1论文更新三个切口,讨论模型如何减少不必要的计算。视频把条件记忆比作查字典,用层间连接解释训练稳定性,再关注R1补充披露的训练过程和失败尝试。作者从这些材料提炼出「用更少计算做更多事」的共同方向,并据此提出对下一代模型的预期,强调的是技术线索与个人判断。

看摘要与章节 →DeepSeek论文解读
16:46
16摘要与章节

【实测+解读】GPT5.2发布:74%的打工人任务,被AI攻克了

本期解读GPT-5.2发布材料,重点讨论面向真实知识工作的GDPval评估,说明参考文件、角色背景与交付物要求如何构成复杂任务。视频同时提醒,评测表现不能直接等同于所有工作场景的能力。由于录制时账号尚未获得GPT-5.2,后半段采用官方海浪网页示例,与其他模型按同一提示词生成的结果对照,记录视觉效果和运行稳定性差异,并未直接实测GPT-5.2。

看摘要与章节 →GPT-5.2模型解读
9:30
17摘要与章节

新Kiro有多强?30人18个月的项目,6人76天干完|亚马逊云科技发布三大前沿Agents

本期解读亚马逊云科技re:Invent发布的开发、安全和运维智能体,重点介绍Kiro自主代理的目标驱动、规范确认、并行任务和长时间执行。视频引用大会上的内部项目案例,讨论从逐个指令转向明确目标与验收标准的工作方式;随后介绍情景记忆如何沉淀流程和审查反馈,以及这些工具与云端模型平台的关系。效率数字来自发布会案例,不能直接推定所有团队都会获得相同收益。

看摘要与章节 →Kiro智能体
20:06
18摘要与章节

【解读+实测】DeepSeek V3.2发布!超GPT-5,对标Gemini 3.0 Pro

本期结合官方发布材料、论文解读和前端任务实测,介绍DeepSeekV3.2及其强化推理版本。视频以通俗比喻解释稀疏注意力、扩大强化学习投入,以及「难解答、易验证」的智能体任务合成方法;随后检查复杂指令执行、网页设计和知识问答。花叔认为其推理与工具使用进步明显,但前端审美、知识新鲜度和日常任务体验仍有短板,区分了官方评测表现与个人使用感受。

看摘要与章节 →DeepSeek模型评测
16:49
19摘要与章节

【首发】Google发布Gemini 3:地表最强模型解读&实测!

本期梳理Gemini 3 Pro的发布信息、评测表现与使用入口,并介绍Google的新编程工具Antigravity。视频区分官方材料、社区案例与个人尝试,重点展示网页设计、小游戏、带AI能力的应用和视频理解。实测中还通过追问特定人物及潜水画面的时间点,检查模型是否读取了视频画面,而不只是依据语音或字幕总结。

看摘要与章节 →Gemini多模态
19:33
20摘要与章节

Claude Code:最强自动化写作agent!99%的人都低估了cc的能力

本期实演用ClaudeCode搭建的自动化写作流程:从一个新产品选题出发,先调研并保存资料,再给出多个方向供选择,学习参考文章,搜索个人素材,完成初稿、三轮审校与配图,最后在公众号排版器中处理。花叔进一步拆解工作区路由和分步骤规则,强调真实个人素材与优质样文决定文章是否贴近自己的观点和品位,也说明测试类选题需要本人补充实测信息。

看摘要与章节 →ClaudeCode写作工作流
16:28
21摘要与章节

【首发】Claude4.5发布,首款AI操作系统上线!深度解读+实测

本期解读Claude Sonnet 4.5发布及相关产品更新,介绍编程、电脑操作、Agent SDK和编辑器插件,并重点试用Imagine with Claude动态生成界面的体验。演示包含主题桌面、天气、计算器和进化论小游戏,也检查了多类网页原型。作者认为交付稳定性有所改善,但前端设计尚无明显飞跃,更复杂的长期任务仍需进一步测试。

看摘要与章节 →ClaudeAI编程
7:05
22摘要与章节

OpenAI开源了,Claude更强了!但最惊喜的是AWS的底牌

本期结合Claude Opus 4.1与OpenAI开放权重的GPT-OSS系列,讨论选择模型时为何要同时考虑任务适配和使用平台。作者分享编程中的个人感受,区分跑分与项目表现,并介绍AWS Bedrock、SageMaker及配套工具链的作用。视频的重点是根据任务组合模型,减少部署、调用和运维负担,而不是只按一个榜单决定使用对象。

看摘要与章节 →多模型Claude
10:28
23摘要与章节

OpenAI发布GPT-5!全网首发解读&对比评测!

本期在GPT-5发布后梳理模型系列、自适应思考和编程方向,并结合公开评测讨论其与Claude Opus 4.1的差距。由于录制时作者尚不能直接使用GPT-5,末尾采用发布会展示的提示词,让Claude生成法语学习网站和财务仪表盘,再与官方演示比较。作者认为代码表现有进步,但这一展示并不是两款模型在相同环境下的直接实测。

看摘要与章节 →GPT-5Claude
13:58
24摘要与章节

【解读+实测】马斯克发布Grok4,登顶全球最佳大模型!

Grok 4发布后,花叔从订阅用户视角梳理官方公布的评测、第三方综合指标和后续产品计划,并解释不同测试主要考察哪些能力。随后他用同一网页生成需求,对照Grok、Gemini、Claude和DeepSeek的前端结果,观察页面结构、审美和图片引用。实测中高榜单分数没有直接转化为令他满意的网页表现,视频因此把模型评测成绩与具体工作体验分开讨论。

看摘要与章节 →Grok模型对比

公开视频提供字幕整理的摘要与章节;充电专属内容请到B站查看。