◄ 返回每日萃
2026-08-14

给 AI 一块钱看它干多少活,选模型别光看智商

本文由 AI 自动整理生成,可能存在错漏,请以原文链接为准。

今天想跟你聊三件事:Suno 开始像个正经音乐工具了,MIDI 都能接;AI 反复修不好的 bug,可能得回到数据源头找人才有解;选模型不再光看智商,开始算每块钱产出。

灵感百宝袋

让 AI 写论文,先把「需要哪些证据」钉死,再让它动笔,编造能少很多。

这是一群研究者做的叫 Spark-to-Paper 的工作流,跑在现成的编码助手里,不用另搭一套复杂的智能体平台。它把「做实验」和「写结论」拆成两步:先想清楚要拿什么数据当证据,再根据实际测出来的结果改说法,不让 AI 边写边圆。今天就能试:你让 AI 写任何带结论的东西,先让它列出「结论成立需要哪些证据」,你扫一眼再让它写正文。

原文:https://arxiv.org/abs/2608.11924

做视频、分镜别让 AI 一次性出图——先把场景和镜头存成一个能反复改的草稿世界。

电影、游戏和建筑设计里,经常要先做「预可视化」,把想法草草搭出来看效果。以前的 AI 生成视频是一次性出片,想改个镜头角度、挪个物体会很麻烦。StateFlow 的思路是先把场景元素、摄像机位置存成一个持久化的 3D 状态,后续只做局部修改和重组,想要更高画质时再接现成的视频模型。这个想法也能用在你身上:让 AI 做视觉方案时,别一上来就要最终图,先要一个可以反复调整的粗糙初稿。下次生成海报或分镜时,试着把「先给我一个可编辑的初稿」加进需求里。

原文:https://arxiv.org/abs/2608.12314

江湖快报

Suno 开始像一个正经音乐制作工具了:MIDI、效果插件、自带合成器,还加了代劳机器人。

Suno 发布了 Studio 2.0。最亮眼的是加上了 MIDI 支持——团队说这是用户呼声最高的功能,也是正经音乐制作软件的门槛。同时补了效果插件和合成器,明显是想从「AI 编曲玩具」往能用的数字音频工作站靠。另外还有个几乎什么都能帮你做的聊天机器人。不过它现在还加载不了第三方插件,只能用自带的一台基础合成器,可玩性还没到专业级别。对只拿 Suno 生成歌的人来说,以后至少能接 MIDI 键盘、把作品导到更专业的流程里继续调,算是个进步。

原文:https://www.theverge.com/ai-artificial-intelligence/979345/suno-studio-2-0-midi-chatbot-custom-effects

贤者视角

AI 反复修不好的 bug,问题可能不在代码,在你没人说得清数据从哪来。

开发者 Florian Herrengt 写了一个场景:用户报一个怪 bug,团队已经请 AI 修了四次还没搞定。最后去问当初做这个功能的人,数据从哪儿来,对方说不知道,要问 Claude。两人盯着屏幕看 AI 很自信地吐出一大段,谁也不知道真假。他又点了一句:这个项目已经堆了太多层和服务,团队里没人能真正说清整体在干嘛。Django 联合创始人 Simon Willison 把这段话转了出来,意思很明白——AI 能帮你补代码,补不了「没人理解系统」这笔账。下次 AI 修不动 bug,先别急着换提示词,去问一句数据到底从哪来。

原文:https://simonwillison.net/2026/Aug/12/florian-herrengt

选模型不能光看智商,Agent 时代更得看每块钱能替你干多少活。

爱范儿最近用一个很小的预算试了几款模型做同一个活:生成一个 DeepSeek API 的状态监控页。DeepSeek V4 Flash Max 跑了 25 次调用,一共花 0.0758 美元;换 Claude Sonnet 4.6 效果更精致,但一次就花了 2.5 美元,直接超预算。他们又试了一个叫 Ling-3.0-Flash 的模型,同样 25 次调用只花 0.0402 美元,比前者便宜约四成。文章把这叫「智效比」:分子是模型真正解决问题的能力,分母是这套活背后要花的算力、Token、时间和价格。说白了,别再只追跑分第一,先算算它长期给你打工要多少钱。

原文:https://www.ifanr.com/1675156

以后用服务可能不用再找 App 了,系统会在合适的时候把功能直接推到你面前。

InfoQ 一篇文章用京东和深圳万象城讲鸿蒙元服务的思路。京东没有把老应用推倒重来,而是把原来小程序里的代码直接搬过去,拆成两百多个场景卡片,一次开发就能适配直板机和折叠屏。背后的 ASCF 框架能把旧代码自动转换,AI 还会帮着修问题——一个两万多行代码的工程,自动识别出 121 处异常并修好;一家园区服务商把约 45 人天的工作量压到 15 人天,相当于原来的三分之一。线下这边,深圳万象城把停车从找车位到离场缴费打包成一个元服务,免去你在几个 App 之间来回切。这个方向有意思的地方是,AI 做产品不一定从零开始,把老资产平滑挪过去也一样能用。

原文:https://www.infoq.cn/article/idSeoMsu4WCrNlxYNC5H

开发者补给站

Uno Platform 6.6 给五个平台都上了原生 AOT,Android 启动最快能快 61%。

用 .NET 和 WinUI 风格 XAML 做跨平台应用的朋友可以看下。Uno Platform 支持 Windows、WebAssembly、Android、iOS、macOS、Linux,这次 6.6 的重点是运行时性能:原生 AOT 会提前把代码编译好,不在启动时靠 JIT,官方用 .NET 10 的示例应用测下来,iOS 启动提升 21%,Android 最夸张能到 61%。还有可选的 Vulkan 渲染后端,官方说某些测试里每帧渲染成本最多降一半,适合动画多或图形密集的应用。AI 这块,App MCP 和 Docs MCP 服务器现在能自动注册到 Visual Studio、VS Code Copilot、Claude Code、Cursor、Codex CLI、Gemini CLI 这些智能体上。老项目升级记得更新 global.json 里的 Uno SDK 条目,按迁移指南核对。

原文:https://www.infoq.cn/article/s1HsC9y7mPAAXRN4VgYs

TanStack Table V9 测试版重构了状态和打包:小表格能瘦身到 5kb 左右。

做前端表格和数据网格的人留意。V9 beta 最大的改变是特性按需注册,不再一次全量打包——一个最简单的表格可能只有 5kb 上下,等要排序、过滤、分页时再引入对应功能,TypeScript 会强制这一点。状态管理从 useReactTable 换成 useTable,状态走 table.state、table.store 和切片 atoms,配合新的 Subscribe 方法做细粒度重渲染。主维护者 Kevin Van Cott 说这次重写参考了 TanStack Form 和 Store,也和 React Compiler 稳定有关。跨框架支持还是 React、Preact、Angular、Solid、Vue、Svelte、Lit 那批。迁移是渐进的,可以用 useLegacyTable 接旧 API;相比商业表格库,它保持 headless 且免费,也值得一验。

原文:https://www.infoq.cn/article/sw9Wgh5VPpzpuUmQvFo1

谷歌开源了 Credentio——一个本地验证 C2PA 内容凭证的 C++ 库。

给做媒体处理、内容来源标识的开发者。C2PA 是内容出处和真实性的一个标准,Credentio 支持 2.2 和 2.4 两个版本,已经在谷歌近四十款符合标准的产品里被用来处理数百亿资产,包括图片、视频、音频和文档。它主打本地验证——媒体文件不用上传到云端就能校验,省流量、快,也少一层隐私顾虑。如果你们要在自己的应用里做内容确权或来源校验,可以拿它做个最小验证看接口对不对路。

原文:https://developers.googleblog.com/introducing-credentio-open-source-c-library-for-c2pa-content-credentials-from-google

好物挖掘机

不用写代码,用 AI 就能搭一个 AR 互动场景。

想做 AR 展示(比如商品试摆、活动打卡)但不会开发的朋友,可以看看 Kivicube。它主打无代码,用 AI 引导你生成增强现实体验,不需要自己写程序。上手最直接的办法是先翻它现成的模板,看你的场景在不在覆盖范围里。

原文:https://www.producthunt.com/products/kivicube

在 ChatGPT、Claude、Gemini 之间搬对话,一键完成,不用复制粘贴。

如果你平时几个 AI 助手混着用,ThreadPort 能把一段对话从一个平台搬到另一个平台。对同时比较多个模型回答、或者想把某段上下文带过去继续聊的人,省事不少。因为它需要读取你的对话,用之前最好先看下它申请的权限范围再决定。

原文:https://www.producthunt.com/products/threadport

让 AI 自动干活之前,先加一道「动手前停一下」的护栏。

Phinq 做的事从名字就能猜个大概:在 AI 代理要执行可能出问题的操作前拦住它。如果你已经在让 AI 自动处理邮件、文件、订单这类敏感动作,可以用它给自动流程加个急刹车。具体拦到什么粒度、支持哪些代理,得看它文档里写的能力边界。

原文:https://www.producthunt.com/products/phinq