花叔的视频手记 · 实践记录
AI基础课02:28分钟给你讲清楚ChatGPT是怎么被训练出来的

点击后加载播放器,播放由你开始。
在B站观看 ↗从感兴趣的地方开始
章节根据字幕内容整理,点击可定位到相应片段。
先读这一段
这段视频讲了什么
本期面向普通用户解释ChatGPT的典型训练流程:预训练、监督微调、奖励建模与强化学习。视频从语料构成、Token和预测下一个词讲起,区分基础模型的续写行为与助手式回答,再说明人类示例、偏好排序和奖励信号如何影响输出。作者希望通过理解训练目标,帮助用户认识模型的优势与局限,并为选择模型和编写提示词建立基础。
值得带走的几点
- 01预训练利用大量文本学习语言规律,基础目标是预测后续内容。
- 02Token化将文本转成有限词表中的单位,支持处理不同词形。
- 03监督微调用指令与回答示例引导模型形成助手式行为。
- 04奖励模型学习人类偏好,强化学习进一步调整生成策略。
- 05符合偏好不等于所有任务都最优,模型选择仍要考虑用途。
摘要、要点与章节根据视频字幕整理;机器字幕可能误识别人名、产品名与数字,细节请以原视频为准。
内容是面向入门者的简化讲解;GPT-4训练细节未公开,部分语料说明借用其他模型,不能视为其确切训练配方。
AI基础模型训练提示词ChatGPT
这次看完了,下次一起动手。
花叔 Alchain
《一本书玩转DeepSeek》作者,小猫补光灯、女娲Skill生态创作者。不会写代码,用AI做产品,分享独立开发、AI工具与内容创作的实践。
继续看一段实践
全部视频 →
14:35摘要与章节
豆包工作手把手教程,让你工作提效200%!(赠51页橙皮书)
本期用11个技巧演示豆包工作如何处理文档、表格、报告、PPT与视觉素材。作者强调先说明目的、材料和交付要求,读取已有资料、核对数据口径,让缺失信息留白,再根据修改意见同步更新产物。后半段介绍本地与云电脑、手机遥控、独立任务并行,以及把跑通的方法保存为Skill并在新对话复验,形成可持续复用的工作流程。
看摘要与章节 →豆包工作Skill
11:44摘要与章节
GPT-6 Astra做3D绝了!我两天建了一座能开车的巴黎(赠300页手把手教程)
花叔把此前的巴黎地图项目升级成可驾驶的3D场景,演示Codex与Tripo分工完成素材和交互的流程:先生成参考图,再制作模型、调整网格、拆分部件、绑定动作,最后由AI编程接入游戏。近景地标、车辆和树木使用生成资产,远景街区与河流则保留程序化建模,以兼顾细节和性能。视频还展示Unity游乐园与小王子星球,说明素材生成之后仍需要组装和功能实现。
看摘要与章节 →AI3DTripo
20:21摘要与章节
🦞OpenClaw从入门到精通:9个使用技巧,让龙虾真正帮你干活
以腾讯QClaw的实际界面为例,本期把OpenClaw用法整理成九个技巧:明确人格、用户和操作规则,接入远程消息,按需安装技能,维护长期记忆,安排定时任务,再按任务选择模型和拆分多个智能体。后半部分讨论提示注入、工具权限与备份,展示用Git保存工作区的思路。核心是把日常工作要求、上下文和交付标准持续沉淀,让智能体逐步承担具体任务。
看摘要与章节 →OpenClawQClaw