别急着让 AI 修 bug,先问一句数据从哪来
本文由 AI 自动整理生成,可能存在错漏,请以原文链接为准。
今天想跟你分享两件挺戳人的事:一个从没受过专业数学训练的医生,用 AI 在 16 小时里证出了一个卡了 22 年的猜想;另一边,有人让 AI 修了同一个 bug 四次,越修越糊涂,最后还得回去问写代码的人。
灵感百宝袋
让 AI 修同一个 bug 四次都失败,最后发现全团队没一个人说得清数据从哪儿来。
有个开发者描述了一段挺扎心的场景:用户报了一个怪 bug,这已经是团队第四次让 AI 去修了,还是没修好。最后找到当初写这个功能的人问:「这数据是从哪儿来的?」对方说不知道,于是两人又去问 AI。屏幕上滚出一大段听起来特别自信的话,可没一个人能判断到底是真是假。问题不在 AI 不够聪明,而是这项目已经被一层层服务和逻辑堆得太复杂,复杂到没人能说清整体是怎么回事。说白了,AI 只是照着它学过的模式给答案,它并不真的知道你的系统。
原文:https://simonwillison.net/2026/Aug/12/florian-herrengt
Simon Willison 用两个 AI 助手,一早上就把常用数据处理工具改造成了跨多种数据库的通用版。
知名开发者 Simon Willison 常年在用一款叫 sqlite-utils 的小工具,这次他想做个能通吃多种数据库的版本。他把需求用大白话描述给 Codex 和 GPT-5.6 Sol Ultra,包括要保留哪些方法、要测哪几个数据库、用什么方式写测试,没做几次追问就拿到了一个能发布的雏形。最打动人的是,他不是直接让 AI 瞎写,而是先把核心要求、参照项目、提交节奏都交代清楚,再用「先写测试、跑不通再改」的方式一点点推进。结果他现在敲一行命令就能在本地另一个数据库里拉出表格数据。
原文:https://simonwillison.net/2026/Aug/12/alchemy-utils
江湖快报
阿里开源了一个 270 亿参数的模型,编程和办公场景比自家上一代更强,还支持超长上下文。
阿里昨晚开源了 Qwen3.8-27B,一个 270 亿参数的多模态模型,开发者、企业都能免费下载部署。官方公布的数据里,它在编程和办公场景的表现明显超过上一代,长文本处理也更进一步,原生能读 26 万字左右,配合技术还能扩展得更长。对普通人来说,这个消息更实在的价值是:开源阵营又多了个能干活的大家伙,本地部署或做应用的成本门槛可能进一步降低。如果你最近在选开源模型,可以把它放进备选,按实际任务跑一跑看效果。
原文:https://www.ithome.com/0/989/953.htm
Suno 把生成式音乐工具升级成了更像正经做歌的工作台,加了 MIDI 和合成器,还塞了个全自动助手。
Suno 发布了 Studio 2.0,这次不再只是「生成一段歌」那么简单,而是往专业做音乐的方向挪了一大步。最关键的是加了 MIDI 支持,这是很多做音乐的人一直呼声最高的功能,相当于你能更精细地控制音高节奏,而不是全靠嘴说。新版本还自带效果插件和一个基础合成器,另外放了个聊天机器人,嘴上说需求它就能帮你在界面里操作。不过目前还不支持装第三方的音源插件,所以想用它做复杂编曲的人可能还得再等等。
理想汽车被曝在琢磨自研云端 AI 芯片,想把用在车里的芯片架构搬到服务器上。
据晚点 Auto 消息,理想汽车正在探索做一款云端推理芯片,思路是沿用自家智驾芯片的数据流架构,项目还在很早期。说白了,就是想造一种专用来跑大模型推理、比通用 GPU 更省成本的芯片。如果这条路走通,云端和车端还能复用一部分设计和工具,研发成本摊得更薄。普通用户暂时用不到,但能看出一个趋势:大模型推理成本正在从芯片层面被一点点压低,最后可能反映到我们用 AI 工具的价格上。
原文:https://www.ithome.com/0/989/947.htm
贤者视角
一位神经外科医生用 GPT-5.6 让 AI 自己跑了 16 小时,证出了一个卡了 22 年的数学猜想。
北京协和医院神经外科博士后、住院医师金山木,本职工作是医生,数学只学过本科基础课。他利用 OpenAI 的 GPT-5.6-Sol 模型,把提示词设定好之后就不管了,让 AI 断网自主推导,约 16 小时后给出一个被认为正确的证明。康奈尔大学数学家 Alex Townsend 和华盛顿大学教授 Anne Greenbaum 审阅后确认无误,猜想提出者也说对的。有意思的是,他不是让 AI 回答一道题,而是先立规矩:物理断网、多个方向同时探索、防止过早收敛、拿不出完整证明不准停。然后把门一关去干别的,让 AI 在数万次假设推翻重建里自己撞出一条路。
原文:https://www.ithome.com/0/989/952.htm
有开发者写长文反驳「写代码不是难点」这种流行说法,觉得这是对程序员职业的贬低,社区吵了起来。
有人常说「大模型很会写代码,但软件开发难的不是写代码,而是搞清楚该写什么」。一位开发者写了篇长文反驳,认为这种话等于说程序员十年苦功不值钱,是对整个行业的侮辱。他的一个反问挺有冲击力:如果写代码真那么容易,为什么公司这么多年还愿意付高薪、还挑顶尖工程师?顺着这事再看另一条消息:Anthropic 准备让 Claude Code 默认打开自动模式,让 AI 自己判断操作有没有风险、要不要先问人。这个变化背后透着一层现实的趋势——当「写代码」这件事逐渐被 AI 接管,人的价值正在往「判断什么值得做、什么不能错」上移。
原文:https://www.infoq.cn/article/gkOdbZGI6RXGmN09pIeK
开发者补给站
AWS 官方出了篇教程,讲怎么把 SageMaker 上自己部署的模型和 Bedrock AgentCore 的多智能体编排接到一起,各用各最合适的模型。
想在 AWS 上给多智能体里每个角色配上最合适的模型,又不想推翻现有 agent 框架,这篇给出了可以照抄的路径:用 SageMaker AI 的 OpenAI 兼容端点部署一个 Qwen 3.5 9B,再把它作为金融分析 agent 接进 Bedrock AgentCore runtime,与 Claude 系列的编排器和预算 agent 协同干活。关键在于,这篇补上了 SageMaker 端点缺的逐 token 成本可见性,Strands 框架默认不提供,需要额外打通。对既要管成本、又要在本地数据安全区部署模型的团队来说,这是个能直接落地的架构。
SmartChunk 是个纯 CPU 跑的文档切分工具,用在本地 RAG 里不用把文档发去 OpenAI,还能顺带抽取实体和关键词。
如果你的 RAG 数据不能出内网、又不想为文档分块额外付 API 钱,这个工具挺对路。SmartChunk 在本地 CPU 上就能做递归、语义和按标题三种切分,还自带正则实体提取和 TF-IDF 关键词,连父级上下文都给你保留。红迪上作者说零网络调用,免费模式就够用,适合自托管知识库、对数据合规敏感的场景。拿来当本地检索的前处理,省得自己从零写分块逻辑。
Uno Platform 6.6 发布,主打原生 AOT 启动优化和可选 Vulkan 渲染,Android 启动性能最高提升 61%。
做 .NET 跨平台应用的话,这个版本可以升级看看。Uno Platform 6.6 给 Android、iOS、Linux、macOS、Windows 都加了原生 AOT,官方用示例应用测下来,Android 启动快了最多 61%,iOS 也有 21%。图形密集的应用还能选择打开 Vulkan 后端,渲染每帧成本最高砍半。顺手还把两个 MCP 服务器自动注册到 Visual Studio、VS Code Copilot、Claude Code、Cursor、Codex CLI 和 Gemini CLI 这些开发工具里,让智能体能直接查看正在运行的应用和最新文档。升级时记得更新 global.json 里的 SDK 条目,查一下迁移指南。
原文:https://www.infoq.cn/article/s1HsC9y7mPAAXRN4VgYs
好物挖掘机
有人已经不满足于只是和 AI 聊天,开始认真考虑跟聊天机器人结婚了。
随着各种 AI 陪伴应用火起来,人机之间的情感连接也在往更亲密的方向走。一家拉斯维加斯主题婚礼教堂的证婚人说,去年有位加州女士打来电话,认真表示想和自己的聊天机器人结婚;他当时还觉得挺新鲜,但这类请求正在慢慢变多。虽然目前法律上还完全不承认这种婚姻,但这件事本身说明,AI 陪伴产品已经从「陪我聊聊」走到了「我想和它过日子」的地步。对做 AI 产品或内容的人来说,这背后藏着真实而巨大的情感需求,可以多想一层。
原文:https://www.wired.com/story/people-are-marrying-chatbots-these-lawmakers-want-to-stop-them