用 AI 规划技能,把模糊大项目拆成一步步可执行
本文由 AI 自动整理生成,可能存在错漏,请以原文链接为准。
今天最让我心里一动的是 DeepMind 把手语 AI 放进了 Pixel 手机,聋人朋友总算能用手语发消息了。另外还有两个挺实用的做法,帮你把大项目交给 AI 时不再一团乱。
灵感百宝袋
开发者 Matt Pocock 演示了一个叫 Wayfinder 的 AI 规划技能,能把你想不清的大项目拆成能跨多个 AI 会话执行的计划。
他拍了个视频,讲这个技能怎么把一团模糊的想法变成一份看得见、能上手的具体步骤,而且大型项目可以分给好几个 AI 会话接着干。说白了,以前你心里有个大项目但不知道从哪下手,它能先帮你铺出一条路。你也能拿手头一件一直想不清的事,丢给它先缕一缕,看它拆出来的第一步是不是靠谱。
原文:https://www.youtube.com/watch?v=F3lL98Pj90o
YouTube 上的 Greg Isenberg 把「图工程」讲得挺明白:提示工程是问 AI,图工程是给 AI 画张流程图。
他自己录了期视频,说提示工程是琢磨怎么把问题问好,图工程则是把你想要的结果画成几个节点连起来的图,让 AI 按图一步步走。他说这么干能把 Claude、Codex 的使用效果拉高不少。听着有点玄,其实挺实用。下次要让 AI 做一个复杂任务,先别急着打字问,拿张纸把大步骤画成几个框连起来,再把这个图说给它听,你会发现它跑偏的次数少很多。
原文:https://www.youtube.com/watch?v=JWhICz1QR8M
江湖快报
DeepMind 出了个手语转文字的模型 SL2T,首发进了 Pixel 手机的键盘和实时字幕。
AI 做口语翻译已经很强,但世界上 200 多种手语、约 7000 万聋人和听障朋友一直没被跟上。这个新模型第一次把手语 AI 从实验室带进了日常产品。在 Pixel 11 上,你可以对着手机比美国手语,它直接转成英文文字,用来搜索、写消息、让 Gemini 干活;实时字幕里也能用手语回复,不用再打字。目前先支持美国手语转英语,更多设备和语言慢慢来。
原文:https://deepmind.google/blog/putting-sign-language-ai-into-users-hands
贤者视角
一款新游戏的编剧和公司 CEO 为「到底有没有用 ChatGPT 替换人」吵起来了。
据 The Verge 报道,前首席编剧 Stella Sacco 在 Bluesky 上说自己做到一半被 ChatGPT 替换,还说乘客语音也都是 AI;公司 CEO Matthew Karch 则否认,说故事全由真人写,只有一个实验模式例外。这事的看点不是谁对谁错,而是创作团队和 AI 的分工边界,越来越需要事先说清楚:哪些部分用 AI、用在哪、会不会标注。观众和从业者其实都想要个明白。
原文:https://www.theverge.com/games/978558/rideshare-stimulator-writer-ai-saber-interactive
The Verge 报道,那个澳洲创业者用 AI 给自家宠物狗做了件事,现在他把这件事做成了一家公司。
Paul Conyngham 之前因为用 AI 工具给狗做了一个个性化方案出过名,现在这家公司叫 Gamgee。网站说以后还打算把同样思路用到更多物种身上。The Verge 的标题带着点「果然走到这一步」的调侃。从个人实验到创业项目,这条路在 AI 圈正在变多,后面会不会有更多人跟,还得看它实际跑得怎么样。
开发者补给站
SkiaSharp 4 连着发了几个版本,GPU 渲染在阴影和分层场景下最高提速 24%,WebAssembly 支持也升级了。
微软和 Uno Platform 把 SkiaSharp 的版本节奏跟上游 Skia 里程碑对齐,从 m148 一路追到 m151。对 .NET 开发者来说,GPU 渲染界面更快,CPU 侧的某个噪声着色器测试快了约六倍,但文本、图表为主的场景几乎没变化。这是个破坏性升级:旧的 SKPaint 文字和字体成员会直接编译报错,得迁到 SKFont;无参 SKFont 也不再默认有字体,得显式指定。升级前先翻官方迁移说明,别直接蹦上去。
原文:https://www.infoq.cn/article/pKprBfc9MPLZVaNpMQgg
OlmoEarth Studio 现在能把自定义 embedding 导出来,喂给下游分析任务用。
Allen AI 在 Hugging Face 上发了这个更新。OlmoEarth 是一组做遥感影像的预训练和微调基础模型,之前你在 Studio 里看结果,现在能直接导出 embedding。做遥感、地理空间分析的伙伴可以少写一层导出管线,直接把特征拿去跑聚类、检索或分类。目前信息还不多,先翻翻它的博客和文档,看看格式和任务边界。
原文:https://huggingface.co/blog/allenai/olmoearth-embeddings
Simon Willison 试了个把文档所有历史版本塞进 SQLite 并压缩存储的原型,比较了两种存法。
他想的办法是把一篇文章每次改动的完整文本放进 JSON 数组,再整坨 zlib/zstd 压缩,因为重复字符串多,压缩率应该不错。他做了两个原型:一个每个编辑写一整块压缩历史,一个把历史分块封存,长文档下扩展性更好。两个原型都保留历史文本和时间戳,默认跳过没变化的替换,写时用 BEGIN IMMEDIATE 保证原子更新。代码应该在他博客里,做版本历史或文档追踪的开发者可以拿去当起点。
原文:https://simonwillison.net/2026/Aug/9/sqlite-text-history-prototype
好物挖掘机
Product Hunt 上看到一个小工具 Click,说是给 ChatGPT 和 Claude 补上实时研究上下文。
介绍真的很少,只说能在这两个聊天工具里提供实时研究背景。具体是浏览器插件还是别的,我还没摸清。如果你平时常拿 ChatGPT 或 Claude 查资料、写东西,可以去它页面瞄一眼,看是不是正好缺的那块。