11:44GPT-6 Astra做3D绝了!我两天建了一座能开车的巴黎(赠300页手把手教程)
花叔把此前的巴黎地图项目升级成可驾驶的3D场景,演示Codex与Tripo分工完成素材和交互的流程:先生成参考图,再制作模型、调整网格、拆分部件、绑定动作,最后由AI编程接入游戏。近景地标、车辆和树木使用生成资产,远景街区与河流则保留程序化建模,以兼顾细节和性能。视频还展示Unity游乐园与小王子星球,说明素材生成之后仍需要组装和功能实现。
花叔的工作台 / 视频手记
AI工具实测、独立开发与内容创作。先看要点,感兴趣再看完整实践。
模型与趋势 83条
11:44花叔把此前的巴黎地图项目升级成可驾驶的3D场景,演示Codex与Tripo分工完成素材和交互的流程:先生成参考图,再制作模型、调整网格、拆分部件、绑定动作,最后由AI编程接入游戏。近景地标、车辆和树木使用生成资产,远景街区与河流则保留程序化建模,以兼顾细节和性能。视频还展示Unity游乐园与小王子星球,说明素材生成之后仍需要组装和功能实现。
36:38花叔与三位创业者、开发者从各自的AI投入聊起,讨论同样的模型为何会产生不同工作成果。花叔分享按项目组织文件、渐进读取上下文和维护工作流程的方法,并提醒一人公司仍要找到真实需求、交付产品、接触用户。圆桌还结合自行车研发、供应商会议和软件验证,展示知识库如何进入实际业务;视频作者在回看中补充团队转型与公开分享的实践反思。
12:18本期以桌面智能体的使用经验为参照,拆解阶跃智能体手机与StepAOS的系统设计思路。视频认为手机智能体需要原生接口、工具协议、跨任务记忆及端云调度,才能把目标转化为跨应用操作,并讨论感知、权限、过程留痕和撤回机制。旅行规划等场景是基于发布会资料的推演;作者明确表示尚未拿到真机,因此这是一组架构判断与体验预期,而非产品实测结论。
17:07本期先介绍ClaudeFable5发布时的能力与使用安排,再展示花叔用其开发的Mac桌面应用。这个开源工具围绕终端智能体工作流,把文件浏览、上下文提供、结果预览和任务提醒放到同一界面,减少在Finder、终端与编辑器之间切换。视频还演示图片标注、HTML查看、浏览器录屏和跨平台图文填充等小工具,强调从自己的具体工作障碍出发,用AI快速实现并持续完善产品。
16:14花叔展示将AI设计工作整理为可复用流程的尝试,围绕演示稿、个人主页、待办应用原型和产品宣传动画做四个案例。流程从确认听众、目标与风格开始,先提供样稿,再根据反馈继续制作,并通过截图检查和修复布局。个人主页案例还演示从一张饮料店照片提取色彩与视觉规则。视频关注的是如何让设计更贴近具体内容、品牌和用途,而不只生成一个页面。
13:42花叔用MAVIS演示让AI操作电脑完成任务的过程,从安装Ollama、查询设备配置并选择本地模型开始,再延伸到技能适配、文件整理和手机远程交办。后半段同时推进软件安装、知识解释、文章配图、桌面归类与文件查找,展示任务如何分给不同执行模块,以及遇到安装错误后继续排查的过程。视频关注自然语言指派到实际操作之间的衔接,也保留任务耗时和检查结果的环节。
36:11本期借助技术报告、73页演示材料和网页解读DeepSeek V4,区分Pro与Flash的定位,重点说明MoE架构、mHC残差连接、分层注意力、Muon优化器及专家训练后蒸馏的思路。作者把百万上下文与成本下降视为主要价值,同时指出竞赛解题、实际工程、长链工具调用和创意写作的表现并不一致,建议根据任务选择,并讨论论文局限与下一代可能方向。
17:25花叔先阅读GPT-5.5的发布介绍与系统卡,梳理编程、工具使用和工作任务方面的官方评测,再用SVG绘图、动态介绍视频、地震监测网页与演示稿做体验比较。实测既展示可用的页面和视觉效果,也指出文字重叠、图片排布等问题,并对照Claude的不同设计取向。视频特别提醒,模型自报完成不能替代结果核验,发布数据和实际交付仍需分别观察。
15:22本期解读Claude Opus 4.7的编程、视觉与文档能力更新,并围绕系统卡讨论评估情境识别、模型自述和思维链监督等实验发现。随后用Skill配合模型生成带天气动效的网站,以及基于英伟达季报的多视角分析和演示文稿。视频主要观察任务执行与视觉交付,同时提出对模型行为研究的兴趣;有关情绪或意识的表述属于讨论,不能直接证明模型具有人的体验。
14:15Gemma 4发布后,花叔梳理不同尺寸模型、多模态输入和本地部署的定位,讨论小模型如何在手机、电脑等设备上承担文档识别与简单任务。视频还用较通俗的方式介绍参数效率、缓存与长上下文设计,并尝试生成一张鹦鹉介绍网页,与其他模型结果比较。案例中出现图片引用失败,因而作者建议把端侧可运行和具体任务是否合适放在一起判断。
18:15围绕一次Claude Code源码泄露事件,花叔借助AI阅读相关文件,讨论模型之外的工程系统如何影响编程工具的体验。视频重点解读静态与动态提示词、权限审查、记忆提取、上下文压缩和文本搜索等设计,并联系自己的开发与写作使用习惯说明其意义。结尾分析这些工程经验对同类产品的启发,同时把源码可见与团队持续迭代能力区分开来。
19:04从DeepSeek一次长时间服务中断切入,花叔回顾当时的用户体验与V4发布传闻,转向解读mHC、原生稀疏注意力和V3.2相关技术思路。视频用电梯、会议等类比解释训练稳定性与长文本计算成本,再据此推测后续模型的方向。结尾把关注点放到智能体任务的调用成本:新模型的意义,除了能力提升,还取决于能否让更长、更复杂的任务用得起。
16:27本期用智谱的龙虾客户端与其默认模型分析英伟达,先完成数据收集和价值投资框架分析,再引入趋势、波浪与CAN SLIM等视角,最后调用已有Skill生成网页报告。作者观察工具调用、复杂指令遵循和长任务执行,强调AI的作用是增加信息与分析视角,最终决策仍由人承担。开场提及的个人收益不构成这套流程能复制回报的证明。

16:00围绕当时的DeepSeek V4发布传闻,花叔选择Engram、mHC和R1论文更新三个切口,讨论模型如何减少不必要的计算。视频把条件记忆比作查字典,用层间连接解释训练稳定性,再关注R1补充披露的训练过程和失败尝试。作者从这些材料提炼出「用更少计算做更多事」的共同方向,并据此提出对下一代模型的预期,强调的是技术线索与个人判断。
16:46本期解读GPT-5.2发布材料,重点讨论面向真实知识工作的GDPval评估,说明参考文件、角色背景与交付物要求如何构成复杂任务。视频同时提醒,评测表现不能直接等同于所有工作场景的能力。由于录制时账号尚未获得GPT-5.2,后半段采用官方海浪网页示例,与其他模型按同一提示词生成的结果对照,记录视觉效果和运行稳定性差异,并未直接实测GPT-5.2。
9:30本期解读亚马逊云科技re:Invent发布的开发、安全和运维智能体,重点介绍Kiro自主代理的目标驱动、规范确认、并行任务和长时间执行。视频引用大会上的内部项目案例,讨论从逐个指令转向明确目标与验收标准的工作方式;随后介绍情景记忆如何沉淀流程和审查反馈,以及这些工具与云端模型平台的关系。效率数字来自发布会案例,不能直接推定所有团队都会获得相同收益。
20:06本期结合官方发布材料、论文解读和前端任务实测,介绍DeepSeekV3.2及其强化推理版本。视频以通俗比喻解释稀疏注意力、扩大强化学习投入,以及「难解答、易验证」的智能体任务合成方法;随后检查复杂指令执行、网页设计和知识问答。花叔认为其推理与工具使用进步明显,但前端审美、知识新鲜度和日常任务体验仍有短板,区分了官方评测表现与个人使用感受。
16:49本期梳理Gemini 3 Pro的发布信息、评测表现与使用入口,并介绍Google的新编程工具Antigravity。视频区分官方材料、社区案例与个人尝试,重点展示网页设计、小游戏、带AI能力的应用和视频理解。实测中还通过追问特定人物及潜水画面的时间点,检查模型是否读取了视频画面,而不只是依据语音或字幕总结。
19:33本期实演用ClaudeCode搭建的自动化写作流程:从一个新产品选题出发,先调研并保存资料,再给出多个方向供选择,学习参考文章,搜索个人素材,完成初稿、三轮审校与配图,最后在公众号排版器中处理。花叔进一步拆解工作区路由和分步骤规则,强调真实个人素材与优质样文决定文章是否贴近自己的观点和品位,也说明测试类选题需要本人补充实测信息。
16:28本期解读Claude Sonnet 4.5发布及相关产品更新,介绍编程、电脑操作、Agent SDK和编辑器插件,并重点试用Imagine with Claude动态生成界面的体验。演示包含主题桌面、天气、计算器和进化论小游戏,也检查了多类网页原型。作者认为交付稳定性有所改善,但前端设计尚无明显飞跃,更复杂的长期任务仍需进一步测试。
7:05本期结合Claude Opus 4.1与OpenAI开放权重的GPT-OSS系列,讨论选择模型时为何要同时考虑任务适配和使用平台。作者分享编程中的个人感受,区分跑分与项目表现,并介绍AWS Bedrock、SageMaker及配套工具链的作用。视频的重点是根据任务组合模型,减少部署、调用和运维负担,而不是只按一个榜单决定使用对象。
10:28本期在GPT-5发布后梳理模型系列、自适应思考和编程方向,并结合公开评测讨论其与Claude Opus 4.1的差距。由于录制时作者尚不能直接使用GPT-5,末尾采用发布会展示的提示词,让Claude生成法语学习网站和财务仪表盘,再与官方演示比较。作者认为代码表现有进步,但这一展示并不是两款模型在相同环境下的直接实测。
13:58Grok 4发布后,花叔从订阅用户视角梳理官方公布的评测、第三方综合指标和后续产品计划,并解释不同测试主要考察哪些能力。随后他用同一网页生成需求,对照Grok、Gemini、Claude和DeepSeek的前端结果,观察页面结构、审美和图片引用。实测中高榜单分数没有直接转化为令他满意的网页表现,视频因此把模型评测成绩与具体工作体验分开讨论。
公开视频提供字幕整理的摘要与章节;充电专属内容请到B站查看。