发现千问更新了,欢迎用我的skill做出更有审美的PPT!
我随手往下翻,翻到一张有点眼熟的卡片:「花叔设计助手」,作者写的是花叔😳
做过的事,走过的路,都写在这里。
选一个手上的问题,从一篇实践开始。
AI工具、独立开发、内容创作,边读边动手。
我随手往下翻,翻到一张有点眼熟的卡片:「花叔设计助手」,作者写的是花叔😳
DeepSeek V4 Pro正式版发布! DeepSeek刚刚悄无声息的更新了V4 Pro的版本号,看起来是明天会有正式的发布信息。 以我自己最近使用DeepSeek V4 flash的体感来说,那是个又快能力又基本接近Opus 4.8的模型。这次V4 Pro的正式版我估计会是接近Opus 5/Fable 5的表现。
昨天Anthropic发了篇文章说,他们把Claude Code系统提示词删掉了80%以上,编码评测表现没有明显下降。然后写了篇文章,把这次删减背后的判断做了波阐述,标题叫《The new rules of context engineering for Claude 5 generation models》,作者是C…
在加勒比海上收到了OpenAI的工作邀约,看邮箱后缀本以为是钓鱼,没想到经过X网友验证,居然是真的…
这两天新模型跟不要钱一样往外冒。7月8日Grok 4.5,7月9日更热闹,GPT-5.6和Meta的Muse Spark 1.1挑了同一天发。
【花叔注】我最近一直在美国旅行,正好赶上他们的250周年独立日,美国人对这事还真挺重视,到处都是各种庆典活动。
今天Anthropic可解释性团队发了篇新论文,官方推文几个小时就冲到320万+浏览。
昨天我在X上刷到一张排行榜,Arena的Code Arena: Frontend,前端代码能力的真人盲投对战榜。发现榜上有多家国产模型在列,而且许多排名比我预期的高不少。
这还真是个挺有代表性的事,以后你的Agent真的能替你花钱了… 但是我想大家更希望的应该是发个指令,让Agent直接给自己收钱赚钱去…
前几天,海外的AI圈和基础科学的学术圈有个传闻挺热闹的:尹希,哈佛史上最年轻的华人正教授,弦理论这门基础科学里最难啃方向的顶尖学者,据爆料离开哈佛去了OpenAI。当然,到目前为止OpenAI、哈佛和他本人都还没正式回应,也有人说他只是停薪留职去那边待一阵。
前阵子Opus 4.8出来,我印象最深的不是分数,是它新增的Dynamic Workflows:你描述一件大事,它自己写出一段脚本,一口气调起几十上百个子agent并行干活,把活拆开同时跑完。
昨天在X上刷到 Artificial Analysis 一条推文。
今天对我而言,算是解锁了一个新体验。上了CCTV-1和新闻频道的焦点访谈节目,而且居然不是打酱油的角色,还有不少台词。
最近我在重读亚当·斯密的《国富论》。作为一个本科学经济学的,其实挺不好意思的是我从来没完整读完过这本经济学的开山之作。
这本《创始人行动手册》是 Anthropic上周发布的官方手册,原版 36 页。从Anthropic产品两天一小版,每周一大版的更新节奏来说,我觉得他们是这个时代最AI Native的大公司了。这本手册里融入了不少他们内部的经验以及他们所服务的最先进的AI native初创公司的做法。
https://weread.qq.com/r/weread-skills
前几天看姚顺宇在张小珺最近那期4小时访谈里说,他在Google DeepMind主要做ML Coding和Long Horizon(长程任务)。后者就是让模型能够连续干好几个小时甚至好几天才能完成的复杂活。他说的是让单个AI变得更聪明。
一昨天,我突然收获了一个人生少有的顿悟时刻。过去两三年,关于AI最主流的两种叙事几乎是相反的。
花了大半天把张小珺访谈姚顺宇的4小时长访听了一遍。这位去年刚从Anthropic跳到Google DeepMind的哥们,参与过Claude 3.7/4.5和Gemini 3。他给了很多实诚的头部大模型一线研究员的视角。访谈信息密度相当高。说几条我觉得最有意思的:
花叔:AI 编程进入多 Agent 阶段后, 真正稀缺的不是执行力, 而是人类的注意力、判断力和调度力。
我是也成老登了么😢最近常常在各种场合被要求给年轻人提供学AI的建议。 昨天在参加一个黑客松圆桌的时候,又面对了这样的问题。
最近一个月模型发布太卷了。Claude Opus 4.7、GPT-5.5、DeepSeek V4 一个接一个,我每天打开 X 都觉得自己快被新模型淹没。
一家公司里,真正在发生的「数据」,有一大半根本不在线上。而缺乏数据这件事,让AI在企业内的落地变得尤其困难。
最近,我的女娲.skill 和 Huashu Design 似乎太出圈了。