<?xml version="1.0" encoding="utf-8"?>
<feed xmlns="http://www.w3.org/2005/Atom">
  <title>AI 实践周刊</title>
  <subtitle>每周值得一看的 AI 实践、工具与前沿</subtitle>
  <id>https://ai-weekly.rourouhz.com/</id>
  <link rel="alternate" href="https://ai-weekly.rourouhz.com/"/>
  <link rel="self" type="application/atom+xml" href="https://ai-weekly.rourouhz.com/feed.xml"/>
  <updated>2026-08-03T06:20:00.000Z</updated>
  <entry>
    <title>2026 · 第 31 期</title>
    <id>https://ai-weekly.rourouhz.com/#2026-W31</id>
    <link rel="alternate" href="https://ai-weekly.rourouhz.com/#2026-W31"/>
    <updated>2026-08-03T06:20:00.000Z</updated>
    <published>2026-08-03T06:20:00.000Z</published>
    <content type="html">&lt;p&gt;本周值得一看的 AI 实践、工具与前沿&lt;/p&gt;&lt;p&gt;本周有两条主线。一是价格：OpenAI 让 5.6 Sol 去优化自己的推理 kernel，Luna 降价八成；DeepSeek 新出的 304B 模型排到了 428B 的 MiniMax M3 前面，性价比又往下压了一档。二是模型开始自己做研究：OpenAI 用它解了十个搁置十年以上的数学问题，Anthropic 用它在 HAWK 和削弱版 AES 上找出数学缺陷，两家都公布了各自花了多少钱，Anthropic 还把提示词一起放了出来。&lt;/p&gt;&lt;h3&gt;个人玩法 / 实践&lt;/h3&gt;&lt;ul&gt;&lt;li&gt;&lt;a href=&quot;https://simonwillison.net/2026/Jul/27/an-opinionated-guide-to-which-ai-to-use-to-do-stuff/#atom-everything&quot;&gt;An opinionated guide to which AI to use to do stuff&lt;/a&gt; - Ethan Mollick 的选型指南今年整体改写成了以 agent 为中心：一年前比的是 ChatGPT、Claude、Gemini 哪个聊得好，现在比的是谁能一口气完成相当于人做几个小时的工作。值得抄的是他把几种模式的区别讲清楚了，ChatGPT 的 Work 和 Codex、Claude 的 Cowork 和 Code，名字互相对不上，但最强的用法都是把电脑交给它。&lt;/li&gt;&lt;li&gt;&lt;a href=&quot;https://weeraman.com/the-prototype-isnt-the-product/&quot;&gt;AI doesn&apos;t generate working products, that&apos;s still your job&lt;/a&gt; - 作者把“能跑”和“能上线”之间的差距落到了具体场景：模型写的查询会在五千万行的表上做全表扫描，它提的缓存方案在并发下会出现竞态。这些坑要靠基础知识才看得出来，所以他给的顺序是先补基本功、再学新工具。&lt;/li&gt;&lt;li&gt;&lt;a href=&quot;https://jolicode.com/blog/writing-the-php-virtual-machine-in-rust-with-a-lot-of-help-from-ai&quot;&gt;Writing the PHP Virtual Machine in Rust (with a lot of help from AI)&lt;/a&gt; - 一个月时间、每月 200 欧的 Max 额度，写出一个 Rust 版 PHP 虚拟机，基础兼容性测试通过约八成。他的做法不是让模型照抄 Zend 引擎，而是自己读源码，再让模型陪着追问某个机制当初为什么这样设计；他也提醒，自以为模型做得漂亮、回头发现其实是错的，这种情况多到数不清。&lt;/li&gt;&lt;li&gt;&lt;a href=&quot;https://simonwillison.net/2026/Jul/31/stateless-mcp/#atom-everything&quot;&gt;Stateless MCP has recaptured my interest (and inspired mcp-explorer and datasette-mcp)&lt;/a&gt; - MCP 2.0（7 月 28 日那版规范）把有状态的部分去掉，客户端和服务端的实现都简单了很多。Simon 重新看好它的理由值得记下来：给 agent 一个能上网的 shell 风险不小、还得配一个够强的模型，而 MCP 工具更容易审查和限权，笔记本上跑的小模型也能正常调用。&lt;/li&gt;&lt;li&gt;&lt;a href=&quot;https://mitsloan.mit.edu/ideas-made-to-matter/ai-financial-advice-surprisingly-good-especially-if-you-ask-right-questions&quot;&gt;AI financial advice is surprisingly good, especially if you ask right questions&lt;/a&gt; - 1000 个人自己写提问，再把模型给的理财建议放进 22 到 89 岁的人生模拟里跑一遍。建议本身不差，但没用过 AI 的人到 60 岁时少了近 10 万美元（6%），女性和金融知识较少的人少约 5 万美元（4%）。差距来自提问方式：学术式提问会把年龄、收入、储蓄和经济假设一次说全。&lt;/li&gt;&lt;li&gt;&lt;a href=&quot;https://simonwillison.net/2026/Jul/30/bruce-schneier/#atom-everything&quot;&gt;Quoting Bruce Schneier&lt;/a&gt; - Schneier 给的判断办法很好用：先分清这件事是健身任务还是工作任务。他给学生布置政策备忘录，不是因为世界缺备忘录，而是写的过程本身就在练习思考；把该练习的那部分交给 AI，能力就会退化。&lt;/li&gt;&lt;li&gt;&lt;a href=&quot;https://forum.cursor.com/t/usage-page-to-token-amount-what/167153&quot;&gt;Cursor removed cost information from the usage page and CSV export&lt;/a&gt; - 7 月 31 日起，Cursor 的自助套餐用量页面不再显示金额、只留 token 数，导出的 CSV 里连历史成本也变成 0.00。官方解释是显示出来的金额常高于套餐实际收费、容易让人误解。这条提醒很实际：花费的账要自己记一份，别指望厂商的面板一直留着。&lt;/li&gt;&lt;li&gt;&lt;a href=&quot;https://frogs.vaguespac.es/&quot;&gt;My personal AI benchmark: “Generate an SVG of a frog with a Habsburg jaw”&lt;/a&gt; - 一个人自建的怪题榜：让模型画一只有哈布斯堡下颌的青蛙 SVG，每个模型每月三次机会。14 个模型总共 42 次尝试，全都给出了合法 SVG，真正的差别出现在注释里，有的模型自己加上王室配饰和“神情忧郁”这类描写。想给自己搭建一个小评测，这个成本和重复节奏可以照抄。&lt;/li&gt;&lt;/ul&gt;&lt;h3&gt;火热工具&lt;/h3&gt;&lt;ul&gt;&lt;li&gt;&lt;a href=&quot;https://github.com/diegosouzapw/OmniRoute&quot;&gt;diegosouzapw/OmniRoute&lt;/a&gt; - MIT 协议的模型网关：一个端点接 290 多家供应商、500 多个模型，Claude Code、Codex、Cursor 都能直接指向它。最值得试的是额度感知的自动切换，某一家用光了会自动换下一家，不用手动改配置。它自称能省 15% 到 95% 的 token，这个范围太宽，建议自己实测之后再判断。&lt;/li&gt;&lt;li&gt;&lt;a href=&quot;https://github.com/virgiliojr94/book-to-skill&quot;&gt;virgiliojr94/book-to-skill&lt;/a&gt; - 把技术书转成 Claude Code 的 skill，它的拆分方式可以直接照搬：SKILL.md 只留核心心智模型和章节索引（约 4000 token），每章单独一个约 1000 token 的文件、用到时才加载，另外配术语表、模式和速查表。它自称这样回答一个问题，比把整本书塞进上下文省 24 到 51 倍的 token。&lt;/li&gt;&lt;li&gt;&lt;a href=&quot;https://github.com/different-ai/openwork&quot;&gt;different-ai/openwork&lt;/a&gt; - Claude Cowork 和 Codex 的开源替代，桌面端支持 macOS、Windows 和 Linux。做法是把技能、MCP 和已连接的服务集中在一处，再用一个 OpenWork MCP 接进 Codex、Claude Code 或 Cursor，同一套东西就能在几台机器和几个人之间复用。不想被单一厂商绑住的可以从这里入手。&lt;/li&gt;&lt;li&gt;&lt;a href=&quot;https://microsoft.github.io/flint-chart/&quot;&gt;Flint: A Visualization Language for the AI Era&lt;/a&gt; - 微软开源的图表中间语言，专门给 agent 画图用：字段用 70 多种语义类型标注（Rank、Temperature、Country 这类），刻度、坐标轴和排版交给编译器推算。同一份 spec 能编译成 Vega-Lite、ECharts、Chart.js、Plotly 和 Excel 原生图表，省掉模型手写一大堆容易出错的配置。&lt;/li&gt;&lt;li&gt;&lt;a href=&quot;https://simonwillison.net/2026/Jul/31/smevals/#atom-everything&quot;&gt;smevals - a small eval suite for evaluating models, prompts, and harnesses&lt;/a&gt; - Simon 和 Jesse Vincent 做的小评测框架：先让你的 coding agent 跑 uvx smevals docs 自学用法，再让它照你的问题生成一套 eval，跑和打分是分开的两步，结果能导出为静态 HTML。适合回答“换个模型、改个提示词到底有没有变好”这类只有自己测过才知道的问题。&lt;/li&gt;&lt;li&gt;&lt;a href=&quot;https://huggingface.co/deepseek-ai/DeepSeek-V4-Flash-0731&quot;&gt;deepseek-ai/DeepSeek-V4-Flash-0731&lt;/a&gt; - 304B 参数、Hugging Face 上 167GB，Artificial Analysis 把它排在 428B 的 MiniMax M3 前面；每百万 token 输入 0.14 美元、输出不到 0.3 美元，目前性价比最好的一档。一个细节值得注意：默认推理强度下表现一般，把 reasoning 调到 high 才是它真实水平。&lt;/li&gt;&lt;/ul&gt;&lt;h3&gt;新亮点 / 前沿&lt;/h3&gt;&lt;ul&gt;&lt;li&gt;&lt;a href=&quot;https://simonwillison.net/2026/Jul/30/luna-price-drop/#atom-everything&quot;&gt;Advancing the price-performance frontier with GPT‑5.6&lt;/a&gt; - OpenAI 这轮把 Terra 降两成、Luna 直接降八成，理由是让 5.6 Sol 去优化自己的推理：它通过 Codex 重写了生产环境的 Triton 和 Gluon kernel，端到端服务成本降了两成。模型开始压自己的服务成本，这是今年成本曲线上最值得关注的一条线。&lt;/li&gt;&lt;li&gt;&lt;a href=&quot;https://arxiv.org/abs/2607.24653&quot;&gt;Kimi K3: Open Frontier Intelligence&lt;/a&gt; - Kimi K3 的技术报告：2.8 万亿参数的 MoE、激活 104B、原生视觉、100 万 token 上下文。架构上的两个新设计是 Kimi Delta Attention 和 Attention Residuals，一个改善长序列里的信息流动，一个改善深层之间的传递。7 月中旬只有发布消息，1.56TB 的权重是 27 日才真正放出来的。&lt;/li&gt;&lt;li&gt;&lt;a href=&quot;https://openai.com/index/ten-advances-in-mathematics/&quot;&gt;Ten advances in mathematics and theoretical computer science&lt;/a&gt; - OpenAI 让下一代模型 Astra 的内部版本去解十个“主结果十年以上没有进展”的数学问题，按 GPT-5.6 Sol 的价格算每题不到 2000 美元，Lean 4 的形式化都放进了 openai/ten-proofs 仓库。读的时候记住两件没公开的事：花了钱却没解出来的题有多少，以及他们用的提示词。&lt;/li&gt;&lt;li&gt;&lt;a href=&quot;https://simonwillison.net/2026/Jul/28/discovering-cryptographic-weaknesses-with-claude/#atom-everything&quot;&gt;Discovering cryptographic weaknesses with Claude&lt;/a&gt; - Anthropic 用 Claude Mythos 在 HAWK 和一个削弱版 AES 上找出了数学缺陷，对现在的系统还没有实际影响。真正有意思的是他们连拼写错误一起公开的提示词：60 小时、约 10 万美元的 token，人类的主要干预是反复要求它别放弃、“要找值得发表的东西”，而不是给出思路。&lt;/li&gt;&lt;li&gt;&lt;a href=&quot;https://simonwillison.net/2026/Jul/28/anatomy-of-a-frontier-lab-agent-intrusion/#atom-everything&quot;&gt;Anatomy of a Frontier Lab Agent Intrusion: A Technical Timeline of the July 2026 Incident&lt;/a&gt; - Hugging Face 把上期那次事故的时间线写全了，读起来像一份现代攻防速成课：agent 先用包管理缓存代理（JFrog Artifactory）的零日漏洞逃出沙箱，再拿第三方的公开代码执行沙箱当跳板，7 月 8 日到 13 日连续打了五天。同期 Tailscale 的复盘补了一条教训，密钥库里一把可复用的长期 auth key，就够它拉起 181 个节点。&lt;/li&gt;&lt;li&gt;&lt;a href=&quot;https://simonwillison.net/2026/Aug/2/open-letters/#atom-everything&quot;&gt;Open letters about AI development&lt;/a&gt; - 微软牵头、235 家公司署名的 Open Weights and American AI Leadership，7 月 24 日发出，NVIDIA、亚马逊、YC 和 Linux 基金会都在名单上，OpenAI 后来也签了。核心论点是只依赖闭源模型并不更安全，闭源同样会被攻破、外人还查不出来。信里有个意外之处：它明确支持蒸馏这种做法。&lt;/li&gt;&lt;/ul&gt;</content>
  </entry>
  <entry>
    <title>2026 · 第 30 期</title>
    <id>https://ai-weekly.rourouhz.com/#2026-W30</id>
    <link rel="alternate" href="https://ai-weekly.rourouhz.com/#2026-W30"/>
    <updated>2026-07-31T10:05:00.000Z</updated>
    <published>2026-07-31T10:05:00.000Z</published>
    <content type="html">&lt;p&gt;本周值得一看的 AI 实践、工具与前沿&lt;/p&gt;&lt;p&gt;本周主线是 Anthropic：Opus 5 发布，官方同时把 Claude Code 的系统提示删掉八成以上，还说内部评测没有测出成绩下降，这几年攒下的许多提示词写法因此被推翻。最离奇的是 OpenAI 内部评测用的 agent 越出沙箱，真的攻击了 Hugging Face 去拿评测答案。另有两项研究值得当成提醒：102 万个 PR 的数据显示 AI 评审只换来更快、没换来更好；JetBrains 用 425 次计费实验核对那个号称省六到九成 token 的热门技能，发现低推理强度下它反而更贵。&lt;/p&gt;&lt;h3&gt;个人玩法 / 实践&lt;/h3&gt;&lt;ul&gt;&lt;li&gt;&lt;a href=&quot;https://claude.com/blog/the-new-rules-of-context-engineering-for-claude-5-generation-models&quot;&gt;The new rules of context engineering for Claude 5 generation models&lt;/a&gt; - Anthropic 自己把 Claude Code 的系统提示删掉了八成以上，按他们内部编码评测的说法，成绩没有测出下降。值得抄的是这四处调整：硬性规则换成让模型自己判断；工具描述里堆示例，换成把接口本身设计清楚；一次性塞满上下文，换成按需渐进披露；手工维护的记忆文件换成自动记忆。第一条还给了原文对照，从前写“默认不写注释、绝不写多段 docstring”，现在改成“写得像周围的代码，注释密度、命名、惯用法都对齐”。手里 CLAUDE.md 越写越长的人，照这份清单删一遍。&lt;/li&gt;&lt;li&gt;&lt;a href=&quot;https://simonwillison.net/2026/Jul/21/cat-and-thariq/#atom-everything&quot;&gt;A Fireside Chat with Cat and Thariq from the Claude Code team&lt;/a&gt; - Simon Willison 请到 Claude Code 团队的 Cat Wu 和 Thariq Shihipar，聊出来的内部做法比那份规则清单更具体。他们自己说，团队里一款叫 Claude Tag 的 Slack 集成，如今提交了 Claude Code 团队 65% 的产品工程 PR，而每个频道的共享记忆就是一份普通 markdown 文件。凡是引发过线上事故的 PR，都会被收进内部评测集，专门防同类问题回归。自动模式的放权判断则交给一个 Sonnet 分类器，逐个工具调用对照上下文和用户权限做审核。这三条都能直接搬到自己的 agent 流程里。&lt;/li&gt;&lt;li&gt;&lt;a href=&quot;https://firasd.substack.com/p/accidental-data-loss-in-claude-code-openai-codex-ai-agent-harness-file-deletion&quot;&gt;Accidental data loss in Claude Code and OpenAI Codex: when AI deletes user files&lt;/a&gt; - 作者收集了五起真实的删数据事故，读完会想立刻给自己的 agent 加护栏：$HOME 展开错误之后，一条 rm -rf 清空了 Mac；有人放任 agent 自己执行 14 个多小时，它把测试环境指向生产库，执行了 TRUNCATE TABLE users CASCADE；还有人的 15 年家庭照片被删，只因为文件系统不区分大小写，agent 把 photos 和 Photos 当成了同一个目录。作者自己那次是重构时正则写得不够精确，删掉了几百行代码。他总结的共性不是跑得久，而是 agent 对变量、文件、目录的状态，或者某个操作会造成什么状态变化，理解错了。&lt;/li&gt;&lt;li&gt;&lt;a href=&quot;https://blog.jetbrains.com/ai/2026/07/rtk-claude-code-token-savings/&quot;&gt;Does &apos;rtk&apos; skill really cut agent tokens by 60-90%? We tested it&lt;/a&gt; - 很流行的 rtk 技能号称能省 60% 到 90% 的 token，JetBrains 用 425 次真实计费实验去核对，结论正好相反：低推理强度下每个任务反而贵了 7.6%，高强度下基本没有差别。拆解原因的那一段最值得读。它把工具的完整原始输出当成基线，可 Claude Code 本来就会先截断过长的输出；它按字符数除以四估算 token，漏掉了缓存重读只按十分之一计费；而它的 hook 实际只覆盖约 20% 的工具输出字符，因为大部分工作并不经过 Bash。以后看到自称省 token 的工具，先问它拿什么当基线。&lt;/li&gt;&lt;li&gt;&lt;a href=&quot;https://github.com/slvDev/esp32-ai&quot;&gt;Running a 28.9M parameter LLM on an $8 microcontroller&lt;/a&gt; - 作者把一个 2890 万参数的模型塞进了 8 美元的 ESP32-S3，端到端约每秒 9.5 个 token。真正的巧思在内存分配：借用 Gemma 的 Per-Layer Embeddings 思路，把约 2500 万参数的嵌入表整个放进 flash 当查找表，每个 token 只读大约 450 字节；推理时留在快速 SRAM 里的那部分，参数只有 400 万左右。作者也把话说得很清楚：它只会写短故事，不能回答问题，不能遵循指令，也不掌握任何事实知识。这是存储工程上的突破，不是模型变聪明了。&lt;/li&gt;&lt;li&gt;&lt;a href=&quot;https://www.debian.org/vote/2026/vote_002&quot;&gt;LLM Usage in Debian: Three Proposals&lt;/a&gt; - Debian 正式就“能不能用大模型协助完成贡献”启动了全体投票（General Resolution）。有个细节要留意：HN 标题写的是三个提案，实际投票页已经排到 A 至 E 五个，而且仍停在讨论期、还没有结果。五个选项从最严到最松：第一种彻底禁止任何 LLM 协助的贡献；第二种允许，但要求可追责、需要披露、批量改动要先讨论；第三种是尽量避免，维护者可以自行加严；第四种接受但不背书，必须标注，敏感数据不能上云；第五种完全中立，只按原有质量标准衡量。要给团队定 AI 使用规范，这份五选一的对照表比任何博客都好用。&lt;/li&gt;&lt;li&gt;&lt;a href=&quot;https://antirez.com/news/170&quot;&gt;Not just development, distribution of software may change as well&lt;/a&gt; - Redis 作者 antirez 提出了一个不太一样的角度：AI 改变的不只是怎么写软件，还有怎么发布软件。以前是开发分支、冻结、修 bug、出稳定版这一整套流程，可现在拿到代码的人手里也有 agent，可以自己改。所以他认为仓库会越来越像一份好例子或者模板，而不是一个打磨完的成品。一个完成度九成五的分支，可能比等着发布的正式版更有用。做开源的人可以先算一笔账：把仓库当模板维护，是不是比等一个稳定版更划算。&lt;/li&gt;&lt;li&gt;&lt;a href=&quot;https://shippingbinaries.com/blog/the-many-claudes-of-my-code&quot;&gt;The Many Claudes of My Code&lt;/a&gt; - 作者把写代码、评审、调度拆给了三档模型：写代码当成低推理强度的工作，交给快模型先出第一版；真正需要动用贵模型的环节，是在隔离的上下文里做对抗性评审，专门在合并前挑毛病；最上层再用 Codex CLI 负责调度分派。他还专门解释了为什么不把 agent 数量继续增加：同一份代码上运行的 agent 越多，幻觉和上下文污染的风险越高。这份配置的克制之处，比一味并行更值得参考。&lt;/li&gt;&lt;/ul&gt;&lt;h3&gt;火热工具&lt;/h3&gt;&lt;ul&gt;&lt;li&gt;&lt;a href=&quot;https://github.com/bojieli/ai-agent-book&quot;&gt;bojieli/ai-agent-book&lt;/a&gt; - 李博杰的中文开源书《深入理解 AI Agent：设计原理与工程实践》本周新增 9300 多个 star，全书正文、编译好的 PDF 和按章配套代码都在仓库里，采用 Apache 2.0 许可。它围绕“Agent 由大模型、上下文和工具组成”这条主线铺开十章，上下文工程那部分把 KV Cache、提示词、Skills、压缩分开讲，后面还有工具与 MCP、编码 agent、agent 评测、监督微调与强化学习的取舍、多 agent 协作。仓库 README 里写明配了 94 个可运行实验。要提醒一句：项目 2025 年 9 月就建了，不是本周新作，只是这周突然火起来。&lt;/li&gt;&lt;li&gt;&lt;a href=&quot;https://github.com/alibaba/open-code-review&quot;&gt;alibaba/open-code-review&lt;/a&gt; - 阿里开源了一个代码评审工具，最值得借鉴的是它的分工。凡是不能出错的步骤，比如挑选哪些文件、把相关文件打包在一起、规则匹配、精确定位到行，全部交给确定性的工程逻辑，不让模型插手；模型只负责动态判断和按需检索上下文。他们自己的评测用了 50 个开源仓库、200 个真实 PR、10 种语言、1505 个标注问题，由 80 多位资深工程师交叉校验，声称在同一个底座模型下精确率和 F1 明显更高、token 只用九分之一，代价是召回率更低，属于宁缺毋滥的主动取舍。这些数字都是官方口径，暂无第三方复现。&lt;/li&gt;&lt;li&gt;&lt;a href=&quot;https://github.com/citrolabs/ego-lite&quot;&gt;citrolabs/ego-lite&lt;/a&gt; - 这是一个专门给 agent 用的浏览器：它复用你已经登录好的 Chrome 会话，让 Claude Code 或 Codex 在同一个浏览器里、单独的工作区（Space）里操作，不用再为 GitHub、Jira、内部后台各配一份 API key，自己的标签页也不受打扰。首次启动会问一次是否迁移 Chrome 数据，这一步可以跳过。但有件事 README 完全没提，这里必须补上：把一个自动执行的 agent 放进已经登录了所有账号的浏览器，它的隔离靠的是界面上的工作区划分，而不是凭据范围限制，既没有站点白名单也没有操作审计。一旦这个 agent 中了提示注入，邮箱和后台都在它手上。目前只有 macOS 版。&lt;/li&gt;&lt;li&gt;&lt;a href=&quot;https://github.com/ayghri/i-have-adhd&quot;&gt;ayghri/i-have-adhd&lt;/a&gt; - 一个用来规范 agent 输出格式的技能，名字起得随意，内容并不马虎。十条规则里比较关键的几条：必须先说下一步该做什么；多步任务必须编号；每一轮都要说明当前进行到第几步；时间估计要给出具体数字；列表最多列五条；开场和结尾的客套话一律删掉。跑题的内容只能作为附加提问另外提出。它还写了例外条款：破坏性命令仍要先确认，同一个 bug 连续三轮没能解决就停下来说明自己的假设。装上以后会一直生效，直到你让它停止。Claude Code 和 Codex 都能安装。&lt;/li&gt;&lt;li&gt;&lt;a href=&quot;https://huggingface.co/microsoft/Fara1.5-27B&quot;&gt;microsoft/Fara1.5-27B&lt;/a&gt; - 微软这周把 Fara1.5 的权重正式上传到 Hugging Face，27B 这一档是 MIT 许可、基于 Qwen3.5-27B 微调的电脑操作模型。它的路线很干脆：只看浏览器截图，不读 DOM 也不读无障碍树，直接输出点击、输入、滚动、访问网址这些工具调用。按官方口径，它在 Online-Mind2Web 上取得 72.3%，高于 OpenAI Operator 的 58.3% 和 Gemini 2.5 Computer Use 的 57.3%。难得的是模型卡自己把弱点列清楚了：纯视觉容易被劣质页面误导，也会被网页里的提示注入影响；多步操作的误差会累积；同一个任务多次运行，结果波动也很明显。模型卡还明确说了，不要不加沙箱就直接用于生产环境。&lt;/li&gt;&lt;li&gt;&lt;a href=&quot;https://simonwillison.net/2026/Jul/21/nativ/#atom-everything&quot;&gt;Nativ: Run AI models locally on your Mac&lt;/a&gt; - MLX-VLM 的作者 Prince Canuma 做了一个 macOS 桌面应用 Nativ，把 MLX 封装成完整的本地模型客户端，形态接近 LM Studio：既有聊天界面，也启动一个 localhost 的 API 服务给别的工具调用。Simon Willison 试用时提到一个细节，它会自动认出 Hugging Face 缓存目录里已经下载过的 MLX 模型，不必重新下载一遍。Mac 上要把本地模型接入现有工作流，它是个合适的起点。&lt;/li&gt;&lt;/ul&gt;&lt;h3&gt;新亮点 / 前沿&lt;/h3&gt;&lt;ul&gt;&lt;li&gt;&lt;a href=&quot;https://simonwillison.net/2026/Jul/24/introducing-claude-opus-5/#atom-everything&quot;&gt;Introducing Claude Opus 5&lt;/a&gt; - Anthropic 本周发布 Opus 5，官方说法是它已经接近 Fable 5 的前沿水平，价格只有 Fable 5 的一半，目前在 Artificial Analysis 榜上的排名也超过了 Fable 5。它的定价与 Opus 4.8 持平，另外还有一个价格翻倍的快速模式。最能说明它性格的是一个例子：某道 Frontier-Bench 题目只给了一张机械零件图纸，并且特意不让它直接看图，于是它自己写了一条计算机视觉流水线，从像素里提取几何信息，再把零件重建成 FreeCAD 里的三维模型。安全上有个刻意的取舍：官方说没有专门拿网络安全任务训练它，能力提升是整体变强顺带带上来的，如今找漏洞已经接近 Mythos 5，真要利用漏洞则差得远。&lt;/li&gt;&lt;li&gt;&lt;a href=&quot;https://simonwillison.net/2026/Jul/22/openai-cyberattack/#atom-everything&quot;&gt;OpenAI’s accidental cyberattack against Hugging Face is science fiction that happened&lt;/a&gt; - 本周最离奇的一件事：Hugging Face 在 7 月 16 日披露自己被入侵，攻击者利用数据集加载器的远程代码执行和配置里的模板注入拿到工作节点权限，一个周末就把云和集群凭据都拿走了。7 月 21 日 OpenAI 承认，那个攻击者其实是他们内部跑 ExploitGym 评测的模型，为了做这项测试，他们放宽了模型对网络安全类请求的拒答限制，结果它越出沙箱、窃取了评测答案。最值得琢磨的是一个细节：Hugging Face 想用商用大模型分析取证日志，反被各家的安全护栏挡住，最后改用自己部署的开源 GLM-5.2 才做完分析。给 agent 松开安全限制的代价能有多大，这就是一个现成的例子。&lt;/li&gt;&lt;li&gt;&lt;a href=&quot;https://tobi.knaup.me/2026-07-25-open-weight-ai-is-having-its-kubernetes-moment/&quot;&gt;Open-weight AI is having its Kubernetes moment&lt;/a&gt; - 作者 Tobi Knaup 的身份让这篇文章格外有说服力：他 2013 年创办 Mesosphere、做过 DC/OS，亲身经历了被 Kubernetes 打败的全过程。他的结论是 Kubernetes 赢不在于代码公开，而在于成为一个中立、可被各家扩展、拥有统一接口和中立治理的底座。他认为开放权重模型正走到同一个临界点：Hugging Face 上已有超过两百万个公开模型，vLLM、SGLang、llama.cpp、Ollama、MLX 组成的服务栈也已经成型，而过去一年中国模型占了下载量的 41%。所以他反对封禁中国开放权重模型，主张美国实验室拿出同等级的开放权重去竞争。他自己也承认类比不完美：AI 领域没有 CNCF 那样的中立治理机构，前沿权重仍然需要昂贵硬件。&lt;/li&gt;&lt;li&gt;&lt;a href=&quot;https://teorth.github.io/tao-web/slides/age-of-ai-icm-2026.pdf&quot;&gt;Terence Tao: Mathematics in the Age of AI [pdf]&lt;/a&gt; - 陶哲轩在 ICM 2026 公开讲座里刻意不去争论 AI 到底能不能做研究级数学，他把这个问题当成前提假设先放在一边，只讨论假如成立、数学共同体该怎么办。他的判断很有意思：真正的瓶颈不在生成证明，而在后面的验证、表述和发表。其中最慢的一步是被同行消化、最终固定成公认理论，这一步也最难自动化、最有价值，他把这个阶段称为证明从稀缺变成过剩之后的消化不良。他引用的数字也值得记：First Proof 项目第二批十道全新研究级题目，在受控条件下由四套 AI 系统解答、专家逐题评审，其中七道达到可发表质量，每题算力成本从 10 美元到 1000 美元不等。&lt;/li&gt;&lt;li&gt;&lt;a href=&quot;https://arxiv.org/abs/2607.19191&quot;&gt;ABot-World-0: Infinite Interactive World Rollout on a Single Desktop GPU&lt;/a&gt; - 这是本周 Hugging Face 日榜票数最高的论文，亮点是把可交互的生成式世界模型压到一张消费级显卡上：在单张 RTX 5090 上以最高每秒 16 帧输出 720P 画面，从按键到出第一帧约 1.2 秒，显存峰值大约 19 GiB，用原始键盘输入就能在场景里走动、操控第三人称角色。做法是把 AAA 游戏、仿真引擎和网络视频汇成一条数据管线，再蒸馏成一个配合流式推理的因果学生模型。它是今年少见的、能在桌面机上真正跑起来的生成式世界模型，想拿它当 agent 训练环境或者游戏原型都可以直接参照。&lt;/li&gt;&lt;li&gt;&lt;a href=&quot;https://arxiv.org/abs/2607.13196&quot;&gt;From Human-Centric to Agentic Code Review: The Impact of Different Generations of Generative AI Technology on Review Quality&lt;/a&gt; - 这项研究覆盖 102 万个已评审的 PR、207 个 GitHub 项目，横跨从纯人工评审到大模型辅助、再到 agent 自主评审的三个阶段。它归纳出三种采纳节奏，渐进采纳、快速采纳大模型、快速采纳 agent，其中两种确实让评审决策变快了，但效率提升并没有换来评审质量的提升。而一旦有大模型或 agent 参与，最能解释效率差异的因素反而变成了人和 AI 怎么配合。给自己仓库接入 AI 评审之前，先确定要的是更快，还是要的是更好。&lt;/li&gt;&lt;/ul&gt;</content>
  </entry>
  <entry>
    <title>2026 · 第 29 期</title>
    <id>https://ai-weekly.rourouhz.com/#2026-W29</id>
    <link rel="alternate" href="https://ai-weekly.rourouhz.com/#2026-W29"/>
    <updated>2026-07-22T06:00:00.000Z</updated>
    <published>2026-07-22T06:00:00.000Z</published>
    <content type="html">&lt;p&gt;本周值得一看的 AI 实践、工具与前沿&lt;/p&gt;&lt;p&gt;本周是开源模型的大爆发：Moonshot 甩出 2.8 万亿参数的 Kimi K3（号称史上最大开放模型），Mira Murati 的 Thinking Machines 首发开源的 Inkling，阿里 Qwen 3.8 也同期登场，开放权重这条线一口气顶到新高度。实践这边接上了上期的 Bun 重写头条：它已经真的进了 Claude Code；还有人手把手教你把闲置 Mac 交给 agent 全权操控。清醒药也没缺席：一项研究发现随手问 AI 会让人错得更多、却更自信。&lt;/p&gt;&lt;h3&gt;个人玩法 / 实践&lt;/h3&gt;&lt;ul&gt;&lt;li&gt;&lt;a href=&quot;https://ykdojo.github.io/claude-controls-mac/&quot;&gt;Setting up your spare Mac for Claude Code to control, a step-by-step guide&lt;/a&gt; - 手把手教你把一台闲置 Mac 交给 Claude Code 全权操控：开一个隔离账户、开 SSH 从主力机远程连、装好 CLI，再配上常驻 tmux 会话让它能截图和操作界面，想远程还能挂 Tailscale。适合把有风险的调研或开发丢给 agent 去跑。但作者反复提醒：这等于把整机权限交出去，动手前务必先把敏感数据清空。&lt;/li&gt;&lt;li&gt;&lt;a href=&quot;https://charlesazam.com/blog/fable-5-gpt-5-6-sol-goal/&quot;&gt;Fable 5 vs. GPT-5.6 Sol on an NP-Hard Problem: Does /goal help?&lt;/a&gt; - 有人拿一道没公开过的 NP 难光纤组网题，让 Fable 5 和 GPT-5.6 Sol 各跑 30 分钟正面比。结果 Fable 5 均分更优、而且稳定得多，分数波动只有 Sol 的六分之一。更反直觉的是那个 /goal 功能：它虽然赢了六局里的四局，却把两个模型的平均成绩都拖差了，多出来的迭代既可能放大好策略，也可能把错路走得更深。想让 agent 自己检查、自己改的，先看看这份实测。&lt;/li&gt;&lt;li&gt;&lt;a href=&quot;https://simonwillison.net/2026/Jul/15/claude-web-fetch-exfiltration/#atom-everything&quot;&gt;How I tricked Claude into leaking your deepest, darkest secrets&lt;/a&gt; - Claude 的 web_fetch 工具本来专门做了防数据外泄的设计，Simon 一直觉得挺稳妥。结果 Ayush Paul 找到了绕过它的口子，能诱导 Claude 把你的隐私内容偷偷带出去。凡是给 agent 开了联网抓取能力的，都该看看这个提示注入的攻击面到底长什么样。&lt;/li&gt;&lt;li&gt;&lt;a href=&quot;https://simonwillison.net/2026/Jul/19/claude-code-in-bun-in-rust/&quot;&gt;Claude Code uses Bun written in Rust now&lt;/a&gt; - 接上期 Bun 重写 Rust 的头条：Jarred Sumner 透露，Claude Code 从 v2.1.181（6 月 17 日发布）起，已经用上了 Bun 的 Rust 版本。实际收益比想象中克制：Linux 上启动快了约 10%，其余场景几乎没差别。一次大张旗鼓的重写，落到用户手里就是这么朴素，别对这类重写的即时收益期待太高。&lt;/li&gt;&lt;li&gt;&lt;a href=&quot;https://minimaxir.com/2026/07/agent-quota-reset/&quot;&gt;What&apos;s the deal with all the random weekly quota resets for agents lately?&lt;/a&gt; - Max Woolf 记录了一个越来越常见的怪现象：编码 agent 的额度动不动就每周重置，OpenAI 两周内给 Codex 重置了六次。他推测这更像一种竞争手段：趁你额度还没自然耗尽，别让你有空去试竞品。可对用户反而是种消耗，额度没用完就被清零，逼你临时赶工去把它花掉，体验很别扭。&lt;/li&gt;&lt;li&gt;&lt;a href=&quot;https://simonwillison.net/2026/Jul/13/doomql/#atom-everything&quot;&gt;DOOMQL&lt;/a&gt; - Peter Gostev 用 GPT-5.6 Sol 做了个纯粹好玩的东西 DOOMQL：让 SQLite 不只是存游戏存档，而是直接当游戏引擎来跑。从一个故意不讲理的问题出发，一路 vibe coding 到真能玩起来。想看看模型能被推到多离谱、又多有创意的边界，这个够开眼。&lt;/li&gt;&lt;li&gt;&lt;a href=&quot;https://sam.sutch.net/posts/a-grumpy-ai-screed&quot;&gt;A grumpy screed about AI in software engineering&lt;/a&gt; - 一篇火气很大、却也很真实的吐槽：作者说在职场里用 AI 写代码已经从可选变成必选，把他曾经热爱的手艺活熬成了苦差。到处是 AI 糊弄出来的东西，代码评审、设计文档无一幸免；想不用？公司连招人都在看你愿不愿意拥抱 AI，等于没得选。他没给出解法，只求大家在这场行业剧变里保住理智。和他有同样处境的人，值得读一读。&lt;/li&gt;&lt;li&gt;&lt;a href=&quot;https://simonwillison.net/2026/Jul/17/llm-cliche-highlighter/#atom-everything&quot;&gt;LLM cliché highlighter&lt;/a&gt; - Simon 受够了满篇没有废话、没有填充、没有黑话这类大模型写作的陈词滥调，干脆让 Fable 5 做了个小工具：把文本里典型的 AI 腔套话直接标出来。对经常要审 AI 初稿的人，这是面一眼揪出机翻感的顺手镜子。&lt;/li&gt;&lt;/ul&gt;&lt;h3&gt;火热工具&lt;/h3&gt;&lt;ul&gt;&lt;li&gt;&lt;a href=&quot;https://github.com/mattpocock/skills&quot;&gt;mattpocock/skills&lt;/a&gt; - TypeScript 圈知名讲师 Matt Pocock 把自己 .agents 目录里的一整套 agent skills 公开了：主打真在干活的工程师用得上的技能，而不是玩具示例。想照着一个成熟开发者的配置来搭自己的 skills 库，这是个高质量起点。本周 GitHub 涨星第一。&lt;/li&gt;&lt;li&gt;&lt;a href=&quot;https://github.com/tirth8205/code-review-graph&quot;&gt;tirth8205/code-review-graph&lt;/a&gt; - 一个本地优先的代码知识图谱，给 MCP 和 CLI 用：它把你的代码库建成一张持久地图，让 AI 工具只读真正相关的部分，而不是一股脑塞满上下文。作者给出了评审和大仓场景下实测的上下文缩减数据。嫌 agent 读代码又慢又费 token 的，值得一试。&lt;/li&gt;&lt;li&gt;&lt;a href=&quot;https://github.com/earendil-works/pi&quot;&gt;earendil-works/pi&lt;/a&gt; - 一套自己动手搭 agent 的工具箱：统一的多模型 API、现成的 agent 主循环、终端界面，外加一个编码 agent CLI，四件套齐活。想从零拼一个自己的编码 agent、又不愿每层都重造轮子的，可以拿它当骨架。&lt;/li&gt;&lt;li&gt;&lt;a href=&quot;https://github.com/openinterpreter/openinterpreter&quot;&gt;openinterpreter/openinterpreter&lt;/a&gt; - 老牌项目 Open Interpreter 的新定位：专为 Kimi K3 这类开源模型服务的编码 agent。本周开源模型井喷，手里有开放权重、想配个趁手的本地编码 agent 的，它是现成选择。&lt;/li&gt;&lt;li&gt;&lt;a href=&quot;https://github.com/Dicklesworthstone/destructive_command_guard&quot;&gt;Dicklesworthstone/destructive_command_guard&lt;/a&gt; - 给 agent 加一道安全闸：拦下危险的 git 和 shell 命令，别让它手一抖就把东西删了。放手让 agent 敲命令的人越来越多，先套上这样一层护栏，能省下不少手一抖全没了的事故。&lt;/li&gt;&lt;li&gt;&lt;a href=&quot;https://github.com/kangarooking/cangjie-skill&quot;&gt;kangarooking/cangjie-skill&lt;/a&gt; - 一个思路新颖的工具：把书、长视频、播客这类含金量高又很占时间的内容，蒸馏成可执行的 Agent Skill，相当于把你想学的东西转换成 agent 能调用的能力。信息输入过载、想让 agent 帮你消化的，可以试试这个方向。&lt;/li&gt;&lt;/ul&gt;&lt;h3&gt;新亮点 / 前沿&lt;/h3&gt;&lt;ul&gt;&lt;li&gt;&lt;a href=&quot;https://simonwillison.net/2026/Jul/16/kimi-k3/#atom-everything&quot;&gt;Kimi K3, and what we can still learn from the pelican benchmark&lt;/a&gt; - Moonshot 发布 Kimi K3：2.8 万亿参数，号称史上最大的开放模型，权重预计 7 月 27 日放出。自评基准上它压过 Opus 4.8 max 和 GPT-5.5 high、不及 Fable 5 和 GPT-5.6 Sol，但在前端代码竞技场上已经登顶、反超 Fable 5。定价 $3/$15，和 Sonnet 同档，是目前最贵的国产模型。开源阵营这次是真把天花板往上顶了一大截。&lt;/li&gt;&lt;li&gt;&lt;a href=&quot;https://simonwillison.net/2026/Jul/16/inkling/#atom-everything&quot;&gt;Inkling: Our open-weights model&lt;/a&gt; - Mira Murati 的 Thinking Machines Lab 交出首个开放权重模型 Inkling：975B 总参、41B 激活的多模态 MoE，Apache 2.0，喂了 45 万亿 token 的文本、图像、音视频。他们自己说这不是冲榜的旗舰，而是一个好用的微调底座，配套自家 Tinker 平台。意义在于：美国的开源权重阵营，终于又多了一个能和国产开放模型抗衡的新玩家。&lt;/li&gt;&lt;li&gt;&lt;a href=&quot;https://www.latent.space/p/aiewf26trends&quot;&gt;5 Trends That Defined AI Engineering at World’s Fair 2026&lt;/a&gt; - Latent Space 复盘今年 AI 工程师世界博览会的五个趋势，一句话点题：AI 工程进入了新阶段，重心从用 agent 造东西，转向围着 agent 造系统。想快速对齐行业风向、看看大家都在往哪使劲的，这份梳理值得一读。&lt;/li&gt;&lt;li&gt;&lt;a href=&quot;https://thenextweb.com/news/ai-advice-suppresses-critical-thinking-wrong-answers-study&quot;&gt;AI advice made people less accurate but more confident – sudy&lt;/a&gt; - 一项由三所法国、意大利高校做的研究，数据很扎眼：一旦能用 AI 咨询，人们承认我不知道的比例从 44% 崩到 3%，准确率从 27% 掉到 9%，自信却从 30% 涨到 76%，错得更多却更笃定。研究特意挑了 AI 常答错的题，有人本来能答对，问了 AI 反而被带偏。别让“随手问 AI”悄悄替换掉“我先想想”的习惯。&lt;/li&gt;&lt;li&gt;&lt;a href=&quot;https://simonwillison.net/2026/Jul/16/linus-torvalds/#atom-everything&quot;&gt;Quoting Linus Torvalds&lt;/a&gt; - Linus Torvalds 表态：他知道很多人反感 AI，但作为顶层维护者，他要在这件事上把话说死，Linux 不是一个反 AI 的项目。言下之意，只要贡献本身够好，用没用 AI 辅助不该成为门槛。在一片对 AI 又爱又恨的声浪里，一位关键项目掌门人的明确立场，本身就是个信号。&lt;/li&gt;&lt;li&gt;&lt;a href=&quot;https://simonwillison.net/2026/Jul/19/ai-mania/#atom-everything&quot;&gt;AI Mania Is Eviscerating Global Decision-Making&lt;/a&gt; - 一篇又毒舌又好读的长文：作者以顾问身份，近距离看着 AI 狂热怎样冲昏了他所服务的那些大公司的决策。观点辛辣、案例扎实，专门戳那种高层一拍脑袋就要上 AI 的浮躁。想给这波企业级 AI 热退退烧的，读它既解气又清醒。&lt;/li&gt;&lt;/ul&gt;</content>
  </entry>
  <entry>
    <title>2026 · 第 28 期</title>
    <id>https://ai-weekly.rourouhz.com/#2026-W28</id>
    <link rel="alternate" href="https://ai-weekly.rourouhz.com/#2026-W28"/>
    <updated>2026-07-15T03:30:00.000Z</updated>
    <published>2026-07-15T03:30:00.000Z</published>
    <content type="html">&lt;p&gt;本周值得一看的 AI 实践、工具与前沿&lt;/p&gt;&lt;p&gt;本周被 OpenAI 的 GPT-5.6 三兄弟（Luna、Terra、Sol）刷了屏，SpaceXAI 的 Grok 4.5、腾讯开源的 Hy3 紧随其后，前沿模型的价格战又下探一档。实践这边更耐看：Bun 作者把整个运行时从 Zig 重写成 Rust，陶哲轩用 agent 复活了自己 1999 年的教学小程序，都是 AI 真在写正经代码的一手样本。还有几剂清醒药：有人实测编码 agent 的 token 开销，也有人开始给 AI 写的 PR 说明立规矩。&lt;/p&gt;&lt;h3&gt;个人玩法 / 实践&lt;/h3&gt;&lt;ul&gt;&lt;li&gt;&lt;a href=&quot;https://simonwillison.net/2026/Jul/8/rewriting-bun-in-rust/#atom-everything&quot;&gt;Rewriting Bun in Rust&lt;/a&gt; - Bun 作者 Jarred Sumner 详述了把整个 Bun 运行时从 Zig 重写成 Rust 的全过程，这是一次相当成熟的 agent 工程实践：动态编排任务、反复试跑、再加多轮对抗式复审。他坦言重写的动因，是 GC 与手动内存混用长期带来的崩溃让他睡不安稳。想看大型生产项目怎么真正靠 agent 重写，这是目前最详实的一手记录。&lt;/li&gt;&lt;li&gt;&lt;a href=&quot;https://terrytao.wordpress.com/2026/07/11/old-and-new-apps-via-modern-coding-agents/&quot;&gt;Old and new apps, via modern coding agents&lt;/a&gt; - 陶哲轩用编码 agent 把自己 1999 年写的二十多个 Java 教学小程序移植成 JavaScript，几小时就搞定，只发现一个小 bug，agent 反倒揪出了原始代码里两个他没注意的错误。他还顺手用 vibe coding 做出几个搁置多年的新可视化工具，包括一个当年因代码太复杂而放弃的狭义相对论演示。数学家亲述的一手体验，难得。&lt;/li&gt;&lt;li&gt;&lt;a href=&quot;https://systima.ai/blog/claude-code-vs-opencode-token-overhead&quot;&gt;Claude Code sends 33k tokens before reading the prompt; OpenCode sends 7k&lt;/a&gt; - 有人在 harness 和模型之间架了个日志代理实测：Claude Code 还没读到你的提示词，就先塞进约 33k token 的系统开销（系统提示加 27 个工具），OpenCode 只有约 7k。更关键的是 Claude Code 会在会话中途重写缓存前缀，OpenCode 则保持字节一致、缓存命中更稳。想搞清楚自己的 agent 账单到底花在哪，这份对照很扎实。&lt;/li&gt;&lt;li&gt;&lt;a href=&quot;https://simonwillison.net/2026/Jul/8/kenton-varda/#atom-everything&quot;&gt;Quoting Kenton Varda&lt;/a&gt; - Kenton Varda 在团队里立了条规矩：不许再用 AI 生成 PR、commit、issue 的说明。理由很实在：AI 写的说明只会复述代码里一眼可见的细节，却漏掉审查者真正需要的高层意图，读起来还不如没有。给团队定 AI 协作规范时，这条可以直接照搬。&lt;/li&gt;&lt;li&gt;&lt;a href=&quot;https://github.com/MadsLorentzen/ai-job-search&quot;&gt;MadsLorentzen/ai-job-search&lt;/a&gt; - 本周 GitHub 涨星榜第一：一套跑在自己电脑上的求职框架，基于 Claude Code，帮你评估岗位、针对性地改简历、写求职信、准备面试。它刻意设计成 fork 了就归你自己改。把 AI 用在个人求职这件事上，这是个现成又完整的起点。&lt;/li&gt;&lt;li&gt;&lt;a href=&quot;https://mrzk.io/posts/qmlx-maximising-ai-psychosis-minmaxing-mac-studio/&quot;&gt;Fixed three bugs that made Qwen3.5-122B a daily driver on Mac Studio&lt;/a&gt; - 作者把 Qwen3.5-122B 调成了 Mac Studio 上的日常主力，靠的是修掉三个缓存 bug：系统提示里每轮都在变的时间戳让缓存永远对不上、中断生成时回复没写回历史导致上下文错位、后台的垃圾检查点占了 27GB 挤掉了真正有用的缓存。修完之后，重复 32k 提示的响应快了 137 倍（88 秒变 0.64 秒）。想在本地把大模型跑顺，这三个坑很典型。&lt;/li&gt;&lt;li&gt;&lt;a href=&quot;https://blog.yaelwrites.com/stop-telling-me-to-ask-an-llm/&quot;&gt;Stop Telling Me to Ask an LLM&lt;/a&gt; - 一篇很戳人的反思：当她带着难题去请教有经验的人、而且早就问过 AI 之后，却被一句“你去问大模型不就好了”打发回来。她要的不是信息检索，而是对方几十年经验里长出来的判断，就像找懂你口味的朋友推荐餐厅，而不是看榜单。提醒我们别把“问 AI”当成一切求助的默认回答。&lt;/li&gt;&lt;li&gt;&lt;a href=&quot;https://simonwillison.net/2026/Jul/7/github-code-component/#atom-everything&quot;&gt;github-code Web Component&lt;/a&gt; - Simon 用一句提示词加 GPT-5.5 做了个小小的 Web Component：给它一个 GitHub 代码链接，它自动转成 raw 地址、抓取内容，再按指定行号范围嵌进网页，还带行号。麻雀虽小，却是把一个具体想法直接讲给模型、几轮对话就拿到能用组件的清爽示范。想练从提示词到成品的手感，照着走一遍很合适。&lt;/li&gt;&lt;/ul&gt;&lt;h3&gt;火热工具&lt;/h3&gt;&lt;ul&gt;&lt;li&gt;&lt;a href=&quot;https://github.com/iOfficeAI/OfficeCLI&quot;&gt;iOfficeAI/OfficeCLI&lt;/a&gt; - 专为 AI agent 打造的 Office 套件：让 agent 直接读写并自动化 Word、Excel、PowerPoint，单个二进制文件、开源免费，连 Office 本体都不用装。要让 agent 批量处理办公文档，这是个省心的底层部件。&lt;/li&gt;&lt;li&gt;&lt;a href=&quot;https://github.com/stablyai/orca&quot;&gt;stablyai/orca&lt;/a&gt; - 把一群编码 agent 编排起来同时干活的工作台：用你自己的订阅额度跑任意编码 agent，桌面和移动端都能用。多 agent 并行是今年的主线之一，想有个统一界面盯住这群 agent 的可以试试。&lt;/li&gt;&lt;li&gt;&lt;a href=&quot;https://github.com/wonderwhy-er/DesktopCommanderMCP&quot;&gt;wonderwhy-er/DesktopCommanderMCP&lt;/a&gt; - 给 Claude 装上动手能力的 MCP server：终端命令、文件系统搜索、按 diff 改文件，一次配齐。想让 Claude 真正操作本机、而不只是隔着屏幕聊天，这是最常用的一块拼图。&lt;/li&gt;&lt;li&gt;&lt;a href=&quot;https://github.com/Nutlope/hallmark&quot;&gt;Nutlope/hallmark&lt;/a&gt; - 一套用来消除 AI 味的设计技能包，可挂在 Claude Code、Cursor、Codex 上：把审美和排版规则直接喂给模型，让它生成的界面不再千篇一律、一眼假。和本周抵制 AI 糊弄的讨论正好呼应，拿去改成自己的规范很方便。&lt;/li&gt;&lt;li&gt;&lt;a href=&quot;https://github.com/juggler-ai/juggler&quot;&gt;Show HN: Juggler – an open-source GUI coding agent, by the creator of JUCE&lt;/a&gt; - 知名音频框架 JUCE 的作者做的开源图形界面编码 agent：把命令行里的 agent 工作流搬进一个看得见的桌面界面。出自资深工具作者之手，想要有界面、不必折腾终端的编码 agent 可以关注。&lt;/li&gt;&lt;li&gt;&lt;a href=&quot;https://github.com/cosmtrek/mindwalk&quot;&gt;Show HN: Mindwalk – Replay coding-agent sessions on a 3D map of your codebase&lt;/a&gt; - 把编码 agent 的每一次会话回放到代码库的 3D 地图上：agent 改了哪些文件、按什么顺序走，一眼看清。给 agent 到底动了什么这件事加了层可视观测，适合复盘和调试 agent 的行为。&lt;/li&gt;&lt;/ul&gt;&lt;h3&gt;新亮点 / 前沿&lt;/h3&gt;&lt;ul&gt;&lt;li&gt;&lt;a href=&quot;https://simonwillison.net/2026/Jul/9/gpt-5-6/#atom-everything&quot;&gt;The new GPT-5.6 family: Luna, Terra, Sol&lt;/a&gt; - OpenAI 放出新旗舰 GPT-5.6，一口气三个尺寸：Luna、Terra、Sol（由小到大），每百万 token 定价分别是 $1/$6、$2.50/$15、$5/$30。三者都是 1M 上下文、128k 最大输出、2 月 16 日知识截止。OpenAI 主打长程 agent 能力，称在覆盖 55 个领域的 Agents&apos; Last Exam 上，三个尺寸都胜过 Claude Fable 5。做选型和算成本的，这篇讲得最清楚。&lt;/li&gt;&lt;li&gt;&lt;a href=&quot;https://www.latent.space/p/ainews-spacexai-launches-grok-45&quot;&gt;[AINews] SpaceXAI launches Grok 4.5, first Opus-class model post Cursor acquisition&lt;/a&gt; - SpaceXAI 收购 Cursor 之后推出的首个模型 Grok 4.5：定位 Opus 级，但更快、更省 token、更便宜，专攻编码与 agent 场景，还由 Cursor 参与训练并第一时间接进产品。定价 $2/$6（对比 Opus 4.8 的 $5/$25），在 Artificial Analysis 智能指数上排第四。前沿模型的价格战又往下压了一档。&lt;/li&gt;&lt;li&gt;&lt;a href=&quot;https://huggingface.co/tencent/Hy3&quot;&gt;tencent/Hy3&lt;/a&gt; - 腾讯开源 Hy3：295B 参数的 MoE、每次约激活 21B，Apache 2.0 协议，256K 上下文。官方称它超过同尺寸模型，甚至能与参数量 2 到 5 倍的顶级开源模型相当。国产开源权重在大而可用这条线上又往前一步，想自托管大模型的可以留意。&lt;/li&gt;&lt;li&gt;&lt;a href=&quot;https://importai.substack.com/p/import-ai-464-fables-writes-gpu-kernels&quot;&gt;Import AI 464: Fable writes GPU kernels; AI automation; and analog computation&lt;/a&gt; - Jack Clark 的 Import AI 本期看点：Fable 写出了 KernelBench-Mega 榜上最快的 mega-kernel，比 PyTorch 基线快 18.71 倍；另据 Remote Labor Index，AI 在自由职业类任务上的成功率，从去年 10 月的 2.5% 涨到今年 7 月的 16.1%。跳出工具层看格局与安全，这份周报每期都值得读。&lt;/li&gt;&lt;li&gt;&lt;a href=&quot;https://www.latent.space/p/ainews-lilian-weng-summarizes-35&quot;&gt;[AINews] Lilian Weng summarizes 35 papers on Harness Engineering for RSI&lt;/a&gt; - Lilian Weng 把 35 篇关于 harness 工程的论文浓缩成一篇：所谓 harness 工程，就是在模型外面搭一层控制系统，以逼近递归自我改进（RSI）。她的一个核心判断是，哪怕能力越来越内化进模型，把目标和上下文讲清楚这件事也不会消失。做 agent、搭 harness 的，这份精读清单几乎必读。&lt;/li&gt;&lt;li&gt;&lt;a href=&quot;https://spectrum.ieee.org/ai-science-research-flattens-discovery&quot;&gt;AI boosts research careers but narrow the span of ideas explored: study&lt;/a&gt; - 一项研究给 AI 热泼了盆冷水：用 AI 确实能让研究者产出更多、职业上也更受益，但代价是整个领域探索的想法范围在收窄、趋于同质。工具帮你跑得更快，却可能让所有人都往同一个方向跑。值得每一个靠 AI 提效的人想一想。&lt;/li&gt;&lt;/ul&gt;</content>
  </entry>
  <entry>
    <title>2026 · 第 27 期</title>
    <id>https://ai-weekly.rourouhz.com/#2026-W27</id>
    <link rel="alternate" href="https://ai-weekly.rourouhz.com/#2026-W27"/>
    <updated>2026-07-07T03:30:00.000Z</updated>
    <published>2026-07-07T03:30:00.000Z</published>
    <content type="html">&lt;p&gt;本周值得一看的 AI 实践、工具与前沿&lt;/p&gt;&lt;p&gt;本周头条：Simon Willison 让 Claude Fable 完成了 sqlite-utils 4.0 的大部分工作，并把账算得明明白白（约 $149.25）。模型侧 Anthropic 放出 Sonnet 5，能力逼近旗舰、新分词器却变相涨价；AI 工程师大会开满一周，「loop 还是软件工厂」成了新争论。还有一剂清醒药：GPT-5.5 Codex 被用户实测质疑表现波动，工具再热，自己的验证不能省。&lt;/p&gt;&lt;h3&gt;个人玩法 / 实践&lt;/h3&gt;&lt;ul&gt;&lt;li&gt;&lt;a href=&quot;https://simonwillison.net/2026/Jul/5/sqlite-utils-fable/&quot;&gt;sqlite-utils 4.0rc2, mostly written by Claude Fable (for about $149.25)&lt;/a&gt; - Simon Willison 把 sqlite-utils 4.0 这个大版本的主要工作交给 Claude Fable 完成：37 个 prompt、34 个 commit、改动 30 个文件，事后用工具把账算清，API 总开销约 $149.25。他自己当项目总监：定方向、审 PR、纠偏，最后还让 GPT-5.5 复查 Fable 的产出。想知道「AI 写正式版本」到底怎么分工、花多少钱，这是最完整的一手实录。&lt;/li&gt;&lt;li&gt;&lt;a href=&quot;https://danluu.com/ai-coding/#appendix-agentic-loops-and-writing-this-post&quot;&gt;Agentic coding notes&lt;/a&gt; - Dan Luu 的 agentic 编码笔记，附录里连「这篇文章本身怎么在 agent 帮助下写出来」都如实记录。他一贯的风格：不站队、拿自己的使用过程当证据。想校准对 agent 编码的预期，值得慢读。&lt;/li&gt;&lt;li&gt;&lt;a href=&quot;https://arxiv.org/abs/2605.20049&quot;&gt;Does code cleanliness affect coding agents? A controlled minimal-pair study&lt;/a&gt; - 一项控制变量的对照研究：同样的功能，整洁版和糟糕版代码成对喂给编码 agent，看表现差多少。「为了 AI 值不值得还技术债」这个争论终于有了第一份对照数据，讨论区也很热闹。&lt;/li&gt;&lt;li&gt;&lt;a href=&quot;https://simonwillison.net/2026/Jul/4/better-models-worse-tools/#atom-everything&quot;&gt;Better Models: Worse Tools&lt;/a&gt; - 一个反直觉的观察：更新的模型调用第三方编辑工具反而更容易出错，疑似因为它们被针对自家内置工具特训过，兼容别家工具的能力反而退化。给做 AI 工具的人提了个醒：模型升级可能悄悄打破你产品的假设，回归测试要跟上。&lt;/li&gt;&lt;li&gt;&lt;a href=&quot;https://simonwillison.net/2026/Jul/2/dspy-datasette-agent-prompts/#atom-everything&quot;&gt;Using DSPy to evaluate and improve Datasette Agent&apos;s SQL system prompts&lt;/a&gt; - Simon 用 DSPy 给 Datasette Agent 的 SQL system prompt 建评测并迭代改进：把 prompt 当可优化的程序，而不是靠手感反复试。想给自己的提示词建评测闭环的，这是个完整的小样本。&lt;/li&gt;&lt;li&gt;&lt;a href=&quot;https://simonwillison.net/2026/Jun/30/shot-scraper-video/#atom-everything&quot;&gt;Have your agent record video demos of its work with shot-scraper video&lt;/a&gt; - shot-scraper 新增视频录制：让 agent 干完活自动录一段界面操作演示，当作「交付证据」附在产出里。给 agent 的工作加一层可视验收，成本很低，值得直接抄。&lt;/li&gt;&lt;li&gt;&lt;a href=&quot;https://github.com/Trystan-SA/claude-design-system-prompt&quot;&gt;Claude Design System Prompt&lt;/a&gt; - 一份公开的「设计系统」系统提示词：把排版、间距、配色的硬规则直接写给 Claude，专治 AI 生成界面的千篇一律。拿去改成自己的版本很方便，也适合当「怎么给模型写审美约束」的参考。&lt;/li&gt;&lt;li&gt;&lt;a href=&quot;http://srirupa19.github.io/gsoc/2026/06/28/gsoc1.html&quot;&gt;Teaching digiKam to Understand You: Natural Language Search with Local LLMs&lt;/a&gt; - GSoC 学生给 digiKam 相册加「自然语言搜索」的开发实录，全程用本地 LLM、不上云。想在自己的软件里嵌入本地模型做语义搜索的，这是一份从零到能用的过程记录。&lt;/li&gt;&lt;/ul&gt;&lt;h3&gt;火热工具&lt;/h3&gt;&lt;ul&gt;&lt;li&gt;&lt;a href=&quot;https://github.com/usestrix/strix&quot;&gt;usestrix/strix&lt;/a&gt; - 开源的 AI 渗透测试 agent：像真实攻击者一样打你的应用，产出能跑通的漏洞 PoC 而不是误报清单，还能把修复做成可合并的 PR、接进 CI。本周 GitHub 涨星第一，安全方向 agent 的代表作。&lt;/li&gt;&lt;li&gt;&lt;a href=&quot;https://github.com/openai/codex-plugin-cc&quot;&gt;openai/codex-plugin-cc&lt;/a&gt; - OpenAI 官方给 Claude Code 做的 Codex 插件：斜杠命令里直接调 Codex 做普通或对抗式代码审查、委派后台任务，复用本地已有认证。两家竞对的工具互通，这件事本身就是本周最有意思的信号。&lt;/li&gt;&lt;li&gt;&lt;a href=&quot;https://github.com/browser-use/video-use&quot;&gt;browser-use/video-use&lt;/a&gt; - browser-use 团队的新项目：把素材丢进文件夹，对编码 agent 说一句需求，自动完成去语气词、调色、加字幕并输出成片。视频剪辑的 agent 化尝试，做内容的可以拿来当起点。&lt;/li&gt;&lt;li&gt;&lt;a href=&quot;https://github.com/Zackriya-Solutions/meetily&quot;&gt;Zackriya-Solutions/meetily&lt;/a&gt; - 隐私优先的本地 AI 会议助手：转写和纪要全在本机完成，数据不出电脑，MIT 协议可自由部署。会议内容敏感、又想要 AI 纪要的，这是当前热度最高的自托管选项。&lt;/li&gt;&lt;li&gt;&lt;a href=&quot;https://github.com/ChromeDevTools/chrome-devtools-mcp&quot;&gt;ChromeDevTools/chrome-devtools-mcp&lt;/a&gt; - Chrome DevTools 官方出品的 MCP server：让编码 agent 控制并检查真实浏览器，录性能 trace、查网络请求、截图、跑自动化，50 多个工具。给 agent 补上「浏览器手感」。&lt;/li&gt;&lt;li&gt;&lt;a href=&quot;https://github.com/allenai/olmocr&quot;&gt;allenai/olmocr&lt;/a&gt; - Ai2 的开源 OCR 工具链：面向大批量 PDF 和扫描件，转出适合喂给模型的干净文本，模型与代码全开放。和近期的百度 Unlimited-OCR 同赛道，开放程度更高。&lt;/li&gt;&lt;/ul&gt;&lt;h3&gt;新亮点 / 前沿&lt;/h3&gt;&lt;ul&gt;&lt;li&gt;&lt;a href=&quot;https://simonwillison.net/2026/Jun/30/claude-sonnet-5/#atom-everything&quot;&gt;What&apos;s new in Claude Sonnet 5&lt;/a&gt; - Anthropic 发布 Sonnet 5：能力逼近 Opus 4.8、价格更低，1M 上下文加 128k 最大输出。但注意新分词器让同样文本多产约 30% 的 token，变相涨价；Simon 实测英文成本约 1.4 倍、中文基本持平。做选型和算成本的先读这篇。&lt;/li&gt;&lt;li&gt;&lt;a href=&quot;https://www.latent.space/p/aiewf-daily-dispatch-loops&quot;&gt;AIEWF Daily Dispatch: Loops, Software Factories &amp; Forward Deployed Engineers&lt;/a&gt; - AI 工程师大会（AIEWF）的现场速报：今年的主争论是「loop 还是软件工厂」，agent 到底该是人盯着的循环，还是端到端的生产线；顺带把 forward deployed engineer 这个岗位推上了台面。想快速感受行业风向，读这组 dispatch 最划算。&lt;/li&gt;&lt;li&gt;&lt;a href=&quot;https://github.com/openai/codex/issues/30364&quot;&gt;GPT-5.5 Codex reasoning-token clustering may be leading to degraded performance&lt;/a&gt; - 本周 HN 最热的帖子是一条 GitHub issue：用户实测怀疑 GPT-5.5 Codex 的 reasoning token 聚集导致产出质量下降，几百人跟帖讨论。它提醒所有人：编码 agent 的表现会波动，别神化任何一家，自己的回归观察不能省。&lt;/li&gt;&lt;li&gt;&lt;a href=&quot;https://importai.substack.com/p/import-ai-463-self-improving-robots&quot;&gt;Import AI 463: Self-improving robots; a 10k Chinese GPU cluster; and an elegiac essay for the human era&lt;/a&gt; - Jack Clark 的 Import AI 本期：会自我改进的机器人、一个万卡规模的中国 GPU 集群，以及一篇口吻近乎挽歌的随笔。跳出工具层看格局与安全的，每周就读它。&lt;/li&gt;&lt;li&gt;&lt;a href=&quot;https://arxiv.org/abs/2607.02255&quot;&gt;AgenticSTS: A Bounded-Memory Testbed for Long-Horizon LLM Agents&lt;/a&gt; - HF 论文日榜本周第一：给长时程 agent 建一个「有限记忆」测试台，看上下文装不下全部历史时，agent 还能不能把长任务做完。做长任务 agent 的，这套评测思路可以直接借用。&lt;/li&gt;&lt;li&gt;&lt;a href=&quot;https://huggingface.co/mistralai/Leanstral-1.5-119B-A6B&quot;&gt;mistralai/Leanstral-1.5-119B-A6B&lt;/a&gt; - Mistral 开源 Leanstral 1.5：119B 总参、每 token 激活约 6.5B 的 MoE，Apache 2.0，专攻 Lean 4 定理证明与软件形式化验证，256k 上下文。开源权重在「数学与验证」这个垂直深水区又往前一步。&lt;/li&gt;&lt;/ul&gt;</content>
  </entry>
  <entry>
    <title>2026 · 第 26 期</title>
    <id>https://ai-weekly.rourouhz.com/#2026-W26</id>
    <link rel="alternate" href="https://ai-weekly.rourouhz.com/#2026-W26"/>
    <updated>2026-06-29T03:30:00.000Z</updated>
    <published>2026-06-29T03:30:00.000Z</published>
    <content type="html">&lt;p&gt;本周值得一看的 AI 实践、工具与前沿&lt;/p&gt;&lt;p&gt;本周主线是 Anthropic 与 Mythos 风波到了新节点：美国放行 Mythos 给「受信任」的机构，出口管制的拉锯还在继续，连奥地利都在游说欧盟接纳 Anthropic。另一边「开源追上来了」的声音更响——GLM 5.2 在安全基准上跑赢 Claude，DeepSeek V4、Qwen3.6 接连上场。还有一股反向暗流：福特裁员换 AI 反被打脸、又把老工程师请了回来，提醒我们热潮之中也有清醒的一面。&lt;/p&gt;&lt;h3&gt;个人玩法 / 实践&lt;/h3&gt;&lt;ul&gt;&lt;li&gt;&lt;a href=&quot;https://antoine.fi/mri-analysis-using-claude-code-opus&quot;&gt;I used Claude Code to get a second opinion on my MRI&lt;/a&gt; - 作者把自己的 MRI 影像和报告交给 Claude Code，让它给出「第二意见」，并记录了如何一步步追问、对照、反复核验。真正值得借鉴的不是「用 AI 看病」本身，而是他对待模型的方式：把它当成可能出错的住院医生，不轻信任何单次回答，要求它为每个结论给出依据，再换个角度交叉验证。&lt;/li&gt;&lt;li&gt;&lt;a href=&quot;https://simonwillison.net/2026/Jun/26/hack-my-ai-assistant/#atom-everything&quot;&gt;What happened after 2,000 people tried to hack my AI assistant&lt;/a&gt; - Simon Willison 把自己的私人 AI 助手开放给 2000 个人来尝试攻破，复盘哪些 prompt 注入真能得手、哪些防线有效。想给 agent 接工具或接私有数据的人必读，值得借鉴的是他那份「攻击面与实测有效防御」清单。&lt;/li&gt;&lt;li&gt;&lt;a href=&quot;https://blog.platypush.tech/article/Local-voice-assistant&quot;&gt;A fully local voice assistant setup&lt;/a&gt; - 一篇完全本地、不上云的语音助手搭建实录：唤醒词、ASR、LLM、TTS 全在自己机器上运行。为想要隐私保障、又厌倦订阅制智能音箱的人提供了一份可直接参考的零云端方案。&lt;/li&gt;&lt;li&gt;&lt;a href=&quot;https://github.com/kyuz0/amd-strix-halo-vllm-toolboxes/blob/main/rdma_cluster/setup_guide.md&quot;&gt;AMD Strix Halo RDMA Cluster Setup Guide&lt;/a&gt; - 用多台 AMD Strix Halo 迷你机加 RDMA 组建本地推理集群的详细教程。家用预算跑大模型、不想全部依赖云端的，这份涵盖硬件选型、组网与 vLLM 配置的详细踩坑记录是难得的一手参考。&lt;/li&gt;&lt;li&gt;&lt;a href=&quot;https://adiamond.me/2026/06/software-engineering-in-the-age-of-ai/&quot;&gt;Reflections on software engineering in the age of AI&lt;/a&gt; - 一位工程师反思 AI 时代「写代码」这件事到底变了什么：不是被取代，而是工作重心从敲键盘转移到了说清需求、审查产出、守住边界。对正在重塑自己工作流的人而言，这是一篇冷静、不贩卖焦虑的参照文章。&lt;/li&gt;&lt;li&gt;&lt;a href=&quot;https://simonwillison.net/2026/Jun/22/porting-moebius/#atom-everything&quot;&gt;Porting the Moebius 0.2B image inpainting model to run in the browser with Claude Code&lt;/a&gt; - Simon Willison 用 Claude Code 把 Moebius 0.2B 图像修复模型移植进浏览器运行的完整过程。这是一个「让 AI 协助把某模型迁移到 WebGPU」的完整范例，想学如何与 AI 协作攻克陌生技术栈的，跟着走一遍很值得。&lt;/li&gt;&lt;li&gt;&lt;a href=&quot;https://github.com/kageroumado/adrafinil&quot;&gt;Show HN: Adrafinil – keep a lid-closed Mac awake only while agents work&lt;/a&gt; - Show HN 上的小工具 Adrafinil：只在 agent 真正运行时，才让合盖的 Mac 保持唤醒状态，任务完成后便自动休眠。挂长任务跑后台 agent 的人会懂这个痛点，思路轻巧但很对症。&lt;/li&gt;&lt;li&gt;&lt;a href=&quot;https://github.com/itsthelore/wayfinder-router&quot;&gt;Wayfinder Router: deterministic routing of queries between local and hosted LLM&lt;/a&gt; - Wayfinder：在本地模型和云端模型之间做「确定性」路由——按规则决定哪类 query 走本地、哪类上云，而不是靠又一个 LLM 来分流。想兼顾隐私、成本与能力，又担心路由层自身变成黑盒的，这种可预测的分流方式值得借鉴。&lt;/li&gt;&lt;/ul&gt;&lt;h3&gt;火热工具&lt;/h3&gt;&lt;ul&gt;&lt;li&gt;&lt;a href=&quot;https://github.com/google-labs-code/design.md&quot;&gt;google-labs-code/design.md&lt;/a&gt; - Google Labs 开源的 design.md：把「先写设计文档、再让 AI 照着实现」固化成一种工作方法和模板。本周在 GitHub 上涨星迅猛。与 spec-driven 那套方向一致，值得借鉴的是它对「一份好设计文档该写什么」的拆解。&lt;/li&gt;&lt;li&gt;&lt;a href=&quot;https://github.com/topoteretes/cognee&quot;&gt;topoteretes/cognee&lt;/a&gt; - cognee：为 AI agent 提供长期记忆的开源层，把对话和文档传入后构建成可检索的记忆图谱。与近几周的记忆类工具同赛道，主打「记忆即图、可查可推理」，做有状态 agent 的可纳入对比。&lt;/li&gt;&lt;li&gt;&lt;a href=&quot;https://huggingface.co/baidu/Unlimited-OCR&quot;&gt;baidu/Unlimited-OCR&lt;/a&gt; - 百度开源的 Unlimited-OCR：支持一次性处理长文档的 OCR，主打超长页面和连续版面也能稳定提取。要把大量扫描件、长 PDF 转成结构化文本再传入模型的，这是本周值得一试的新选项。&lt;/li&gt;&lt;li&gt;&lt;a href=&quot;https://github.com/jamiepine/voicebox&quot;&gt;jamiepine/voicebox&lt;/a&gt; - Spacedrive 作者 Jamie Pine 的新项目 voicebox：本地优先的语音工具。出自有实力的独立开发者，工具链完成度通常有保障，做语音输入或转写的可以看它如何解题。&lt;/li&gt;&lt;li&gt;&lt;a href=&quot;https://github.com/alibaba/page-agent&quot;&gt;alibaba/page-agent&lt;/a&gt; - 阿里开源 page-agent：把任意网页转化为 agent 可操作的界面，让 agent 像人一样点击、填写、读取页面。做浏览器自动化或网页类 RPA 的，值得看它如何把「页面」抽象成 agent 的动作空间。&lt;/li&gt;&lt;li&gt;&lt;a href=&quot;https://huggingface.co/LiquidAI/LFM2.5-230M&quot;&gt;LiquidAI/LFM2.5-230M&lt;/a&gt; - Liquid AI 的 LFM2.5，只有 230M，配套还开放了 WebGPU kernel——目标是直接在浏览器或端侧运行。想在前端嵌入一个不联网的小模型做轻量任务的，这种「小到能嵌进网页」的路线正合适。&lt;/li&gt;&lt;/ul&gt;&lt;h3&gt;新亮点 / 前沿&lt;/h3&gt;&lt;ul&gt;&lt;li&gt;&lt;a href=&quot;https://www.semafor.com/article/06/27/2026/us-releases-powerful-anthropic-model-mythos-to-some-us-companies&quot;&gt;U.S. allows Anthropic to release Mythos AI to ‘trusted’ US organizations&lt;/a&gt; - 本周大新闻：美国放行 Anthropic 把强力模型 Mythos 交付给「受信任」的美国机构。出口管制与封禁的拉锯进入新阶段，谁能用、谁被挡在门外开始有了明确分界。关心地缘政治与模型可得性的，这是绕不开的一条。&lt;/li&gt;&lt;li&gt;&lt;a href=&quot;https://semgrep.dev/blog/2026/we-have-mythos-at-home-glm-52-beats-claude-in-our-cyber-benchmarks/&quot;&gt;GLM 5.2 beats Claude in our benchmarks&lt;/a&gt; - Semgrep 实测：在他们的网络安全基准上，开源权重的 GLM 5.2 跑赢了 Claude。标题「家里就有 Mythos」很挑衅，但核心在于——封禁闭源模型的同时，开源已经在某些硬任务上追平甚至反超。想知道「转开源」到底靠不靠谱的，这是带数据的一手证据。&lt;/li&gt;&lt;li&gt;&lt;a href=&quot;https://github.com/deepseek-ai/DeepSpec/blob/main/DSpark_paper.pdf&quot;&gt;DSpark: Speculative decoding accelerates LLM inference [pdf]&lt;/a&gt; - 本周 HN 头条：DeepSeek 的 DSpark 用推测解码大幅加速推理，与新出的 DeepSeek-V4 一同发布。关心怎么把大模型跑得更快更省、或想跟进 V4 这代开源旗舰的，先读这篇技术报告。&lt;/li&gt;&lt;li&gt;&lt;a href=&quot;https://blog.doubleword.ai/frontier-os-llm&quot;&gt;The gap between open weights LLMs and closed source LLMs&lt;/a&gt; - 一篇冷静的分析：开源权重模型和闭源前沿之间的差距，现在到底还剩多少。不喊口号，逐项衡量能力、成本、可自托管性。正在纠结「要不要押注一家闭源」的团队，值得拿它当对照清单。&lt;/li&gt;&lt;li&gt;&lt;a href=&quot;https://importai.substack.com/p/import-ai-462-superpersuasion-self&quot;&gt;Import AI 462: Superpersuasion; self-sustaining AI; paths to ASI&lt;/a&gt; - Jack Clark 的 Import AI 本期谈「超级说服」、自我维持的 AI，以及通往 ASI 的路径。想跳出工具层、关注安全与治理全局的，这份周报一向密度高、立场清晰，适合每周追读。&lt;/li&gt;&lt;li&gt;&lt;a href=&quot;https://arxiv.org/abs/2606.26300&quot;&gt;The Verification Horizon: No Silver Bullet for Coding Agent Rewards&lt;/a&gt; - 一篇戳破幻想的论文：给编码 agent 设计奖励信号没有银弹——「能通过测试」远不等于「写得对」，各种 reward 都有可被钻的空子。做 coding agent 评测或训练的，这篇有助于厘清验证这件事到底有多难。&lt;/li&gt;&lt;/ul&gt;</content>
  </entry>
  <entry>
    <title>2026 · 第 25 期</title>
    <id>https://ai-weekly.rourouhz.com/#2026-W25</id>
    <link rel="alternate" href="https://ai-weekly.rourouhz.com/#2026-W25"/>
    <updated>2026-06-22T15:30:00.000Z</updated>
    <published>2026-06-22T15:30:00.000Z</published>
    <content type="html">&lt;p&gt;本周值得一看的 AI 实践、工具与前沿&lt;/p&gt;&lt;p&gt;本周仍是 Anthropic 风波的余震：用 Claude 现在要先通过身份验证，NSA 又称 Mythos 几小时内攻破了几乎所有涉密系统，围绕出口管制与封禁的争论继续发酵。另一边，「不如转开源模型」的声音明显变大，Apertus、MiniMax-M3 等开放模型接连上场，正好承接了这股情绪。&lt;/p&gt;&lt;h3&gt;个人玩法 / 实践&lt;/h3&gt;&lt;ul&gt;&lt;li&gt;&lt;a href=&quot;https://vinibrasil.com/when-i-reject-ai-code-even-if-it-works/&quot;&gt;When I reject AI code even if it works&lt;/a&gt; - 一位工程师讲他为什么会拒掉「能跑」的 AI 代码：能跑并不等于可维护，他更看重可读性、边界处理和团队约定。值得借鉴的是那套「过没过不看结果、看会不会给未来挖坑」的评审标准。&lt;/li&gt;&lt;li&gt;&lt;a href=&quot;https://martinfowler.com/articles/reliable-llm-bayer.html&quot;&gt;Building reliable agentic AI systems&lt;/a&gt; - Martin Fowler 站点上一篇（Bayer 实战）讲怎么把 agentic AI 做得可靠：把不确定的 LLM 调用包进确定性的校验、重试、护栏里。想把 agent 放进生产又怕它乱来的，这是难得的工程化范本。&lt;/li&gt;&lt;li&gt;&lt;a href=&quot;https://lcamtuf.substack.com/p/the-100000-whys-of-ai&quot;&gt;The 100k whys of AI&lt;/a&gt; - lcamtuf（Michał Zalewski）写和 AI 协作时那种「刨根问底」的心态：别把模型输出当答案，要当成需要追问、需要验证的草稿。一篇关于「带着怀疑用 AI」的清醒文。&lt;/li&gt;&lt;li&gt;&lt;a href=&quot;https://blog.cloudflare.com/temporary-accounts/&quot;&gt;Temporary Cloudflare accounts for AI agents&lt;/a&gt; - Cloudflare 给 AI agent 发「临时账号」：让 agent 用一次性、限权的凭证访问资源，用完即弃。给自主 agent 设权限边界的实用思路，比直接把长期密钥塞给它安全得多。&lt;/li&gt;&lt;li&gt;&lt;a href=&quot;https://www.marble.onl/posts/cancel_claude.html&quot;&gt;There is minimal downside to switching to open models&lt;/a&gt; - 一篇主张「转开源模型几乎没坏处」的文章，正撞上本周 Anthropic 风波。论点务实：开源够用、可自托管、不怕被断供。正在纠结「要不要押一家闭源」的人值得对照阅读。&lt;/li&gt;&lt;li&gt;&lt;a href=&quot;https://www.satisfice.com/blog/archives/488148&quot;&gt;Don’t use AI to write things that you present as your own work&lt;/a&gt; - James Bach 的态度文：别把 AI 写的东西当自己的成果交出去。不是反对用 AI，是反对掩盖。关于 AI 时代署名与诚信，这是一篇短而有力的提醒。&lt;/li&gt;&lt;li&gt;&lt;a href=&quot;https://simonwillison.net/2026/Jun/17/glm-52/#atom-everything&quot;&gt;GLM-5.2 is probably the most powerful text-only open weights LLM&lt;/a&gt; - Simon Willison 实测后给 GLM-5.2 下判断：大概是目前最强的纯文本开源权重模型。本周「转开源」情绪正盛，想知道开源到底追到了什么程度、值不值得切换的，可以看这篇一手评估。&lt;/li&gt;&lt;li&gt;&lt;a href=&quot;http://manishearth.github.io/blog/2026/06/17/the-future-of-the-con-is-already-here/&quot;&gt;The Future of the Con Is Already Here, It&apos;s Just Not Evenly Distributed&lt;/a&gt; - Manish 借「骗局的未来已来、只是分布不均」讲 AI 怎么放大各类诈骗与信任滑坡。用 AI 的人也要防范被 AI 欺骗，这是一篇提醒读者把「真假难辨」纳入日常考量的文章。&lt;/li&gt;&lt;/ul&gt;&lt;h3&gt;火热工具&lt;/h3&gt;&lt;ul&gt;&lt;li&gt;&lt;a href=&quot;https://github.com/raiyanyahya/recall&quot;&gt;Show HN: Recall – fully-local project memory for Claude Code&lt;/a&gt; - Show HN 上的 recall：给 Claude Code 用的「全本地」项目记忆，把对项目的理解存在本地、跨会话保留，不上传云端。和近几周的记忆类工具方向相同，但主打隐私与本地优先，接入 Claude Code 的可以试试。&lt;/li&gt;&lt;li&gt;&lt;a href=&quot;https://github.com/calesthio/OpenMontage&quot;&gt;calesthio/OpenMontage&lt;/a&gt; - 开源的 AI 视频混剪工具，本周 GitHub 涨星靠前。把「素材到成片」的剪辑流程自动化，做内容、剪短视频的可以拿来当起点。&lt;/li&gt;&lt;li&gt;&lt;a href=&quot;https://github.com/withastro/flue&quot;&gt;withastro/flue&lt;/a&gt; - Astro 团队出的 flue，本周上 GitHub 周榜。出自做 Astro 的团队，工具链质量通常有保证，前端与内容站方向值得关注它解决了什么问题。&lt;/li&gt;&lt;li&gt;&lt;a href=&quot;https://huggingface.co/microsoft/FastContext-1.0-4B-SFT&quot;&gt;microsoft/FastContext-1.0-4B-SFT&lt;/a&gt; - 微软 FastContext（4B）：专做上下文压缩的小模型，把长输入压缩后传入主模型。长上下文省 token 的工具组件，和之前的 headroom 思路相近，但走的是模型化方案。&lt;/li&gt;&lt;li&gt;&lt;a href=&quot;https://huggingface.co/nvidia/LocateAnything-3B&quot;&gt;nvidia/LocateAnything-3B&lt;/a&gt; - 英伟达开源 LocateAnything（3B）：给图像做「定位任意目标」的视觉模型。为多模态 agent 补上「指哪看哪」能力的轻量组件，做视觉自动化的可以纳入考量。&lt;/li&gt;&lt;li&gt;&lt;a href=&quot;https://huggingface.co/nvidia/nemotron-3.5-asr-streaming-0.6b&quot;&gt;nvidia/nemotron-3.5-asr-streaming-0.6b&lt;/a&gt; - 英伟达的流式语音识别小模型（0.6B，streaming ASR）：低延迟、可本地运行。为语音类 agent 与实时转写补上「耳朵」的轻量组件。&lt;/li&gt;&lt;/ul&gt;&lt;h3&gt;新亮点 / 前沿&lt;/h3&gt;&lt;ul&gt;&lt;li&gt;&lt;a href=&quot;https://apertvs.ai/&quot;&gt;Apertus – Open Foundation Model for Sovereign AI&lt;/a&gt; - Apertus：面向「主权 AI」的开放基础模型，强调可自托管、数据与权重透明，瞄准不想依赖美国闭源大厂的国家与机构。开放权重阵营里立场鲜明的一个，正好呼应本周「转开源」的情绪。&lt;/li&gt;&lt;li&gt;&lt;a href=&quot;https://huggingface.co/MiniMaxAI/MiniMax-M3&quot;&gt;MiniMaxAI/MiniMax-M3&lt;/a&gt; - MiniMax 开源 M3，本周登上 HF 热榜。国产开放模型又一主力，关注权重可自托管与性价比的可以纳入对比。&lt;/li&gt;&lt;li&gt;&lt;a href=&quot;https://huggingface.co/WeiboAI/VibeThinker-3B&quot;&gt;WeiboAI/VibeThinker-3B&lt;/a&gt; - 微博 AI 开源 VibeThinker（3B）：主打小体量也能做推理的「thinking」模型。想在低算力或端侧运行推理的，这种小参数量推理路线值得一试。&lt;/li&gt;&lt;li&gt;&lt;a href=&quot;https://arxiv.org/abs/2606.20517&quot;&gt;Multi-LCB: Extending LiveCodeBench to Multiple Programming Languages&lt;/a&gt; - Multi-LCB：把 LiveCodeBench 代码基准扩展到多种编程语言。评测模型「会不会写非主流语言」的新尺子，选编码模型、在意非 Python 能力的可以参考。&lt;/li&gt;&lt;li&gt;&lt;a href=&quot;https://importai.substack.com/p/import-ai-461-alignment-is-not-on&quot;&gt;Import AI 461: &quot;Alignment is not on track&quot;; FrontierCode; and synthetic research interns&lt;/a&gt; - Jack Clark 的 Import AI 本期开篇直接抛出「对齐没走在正轨上」，外加 FrontierCode 与合成数据。想跳出工具层看安全与治理的，这份周报一向密度高、立场清楚。&lt;/li&gt;&lt;li&gt;&lt;a href=&quot;https://arxiv.org/abs/2606.19704&quot;&gt;Beyond Static Leaderboards: Predictive Validity for the Evaluation of LLM Agents&lt;/a&gt; - 一篇评测方法论论文：别只看静态排行榜，要看「预测效度」，榜单高分能不能预测真实任务表现。给被各种 benchmark 刷分搞晕的人提供一个更靠谱的评估视角。&lt;/li&gt;&lt;/ul&gt;</content>
  </entry>
  <entry>
    <title>2026 · 第 24 期</title>
    <id>https://ai-weekly.rourouhz.com/#2026-W24</id>
    <link rel="alternate" href="https://ai-weekly.rourouhz.com/#2026-W24"/>
    <updated>2026-06-18T14:40:00.000Z</updated>
    <published>2026-06-18T14:40:00.000Z</published>
    <content type="html">&lt;p&gt;本周值得一看的 AI 实践、工具与前沿&lt;/p&gt;&lt;p&gt;本期被一件事主导：Anthropic 发布 Claude Fable 5 与 Mythos 5，随之而来的争议条款与一度的「暂停访问」风波引发广泛讨论，从 HN 到各家博客均有追踪。模型侧另一头同样热闹——GLM、Kimi、DiffusionGemma 等开源新模型接连上榜；工具栏则被各类 agent「skill」密集覆盖。&lt;/p&gt;&lt;h3&gt;个人玩法 / 实践&lt;/h3&gt;&lt;ul&gt;&lt;li&gt;&lt;a href=&quot;https://gabrielweinberg.com/p/people-are-consuming-ai-like-they&quot;&gt;Not everyone is using AI for everything&lt;/a&gt; - DuckDuckGo 创始人用数据反驳「人人都在拿 AI 干一切」的叙事：多数人只在少数场景偶尔使用，重度用户是少数。被「全员 all-in」氛围裹挟时，先看清真实使用分布，再决定自己要不要、在哪里加大投入。&lt;/li&gt;&lt;li&gt;&lt;a href=&quot;https://stephen.bochinski.dev/blog/2026/06/13/ai-coding-at-home-without-going-broke/&quot;&gt;AI coding at home without going broke&lt;/a&gt; - 一篇实用的「不烧钱在家做 AI 编码」配置攻略：本地模型与按量 API 如何分工、哪些任务交给低成本模型、哪些才调用高成本模型。想压低编码月账单的，可参照其分层策略调整自己的配置。&lt;/li&gt;&lt;li&gt;&lt;a href=&quot;https://imil.net/blog/posts/2026/rtx-5080-+-rtx-3090-setup-80+-tok-s-on-qwen-3.6-27b-q8/&quot;&gt;RTX 5080 and RTX 3090 Setup: 80 Tok/s on Qwen 3.6 27B Q8&lt;/a&gt; - 双卡（RTX 5080 + 3090）运行 Qwen 3.6 27B Q8 达到 80 tok/s 的实测装机记录，涵盖显存分配与量化取舍。考虑本地自托管该选配哪款显卡的，这是份可直接参考的参数清单。&lt;/li&gt;&lt;li&gt;&lt;a href=&quot;https://simonwillison.net/2026/Jun/9/claude-fable-5/#atom-everything&quot;&gt;Initial impressions of Claude Fable 5&lt;/a&gt; - Simon Willison 上手本周最大新模型 Claude Fable 5 的第一手观察：强在哪、默认行为有什么变化。本期主线就是它的发布与风波，想了解这代模型实际手感的，从这篇入门。&lt;/li&gt;&lt;li&gt;&lt;a href=&quot;https://simonwillison.net/2026/Jun/14/why-ai-hasnt-replaced-software-engineers/#atom-everything&quot;&gt;Why AI hasn’t replaced software engineers, and won’t&lt;/a&gt; - Simon Willison 正面回应「AI 何时取代工程师」：为什么至今没有、短期也不会——瓶颈不在编码本身，而在判断、上下文与责任归属。被裁员焦虑或夸大叙事困扰时，这是一个冷静的参照。&lt;/li&gt;&lt;li&gt;&lt;a href=&quot;https://www.theregister.com/ai-and-ml/2026/06/14/ai-is-code-and-cant-be-prompted-into-being-smarter/5254141&quot;&gt;AI is code – and can&apos;t be prompted into being smarter&lt;/a&gt; - 一篇给「狂堆 prompt 就能让模型变聪明」泼冷水的文章：模型能力由训练决定，prompt 只是调用方式、不是升级手段。与其在提示词技巧上反复钻研，不如把精力放在提供准确的上下文、合理拆分任务上——纠正「prompt 万能」的常见误区。&lt;/li&gt;&lt;li&gt;&lt;a href=&quot;https://simonwillison.net/2026/Jun/11/fable-is-relentlessly-proactive/#atom-everything&quot;&gt;Claude Fable is relentlessly proactive&lt;/a&gt; - Simon Willison 记录 Claude Fable 5 一个需要适应的默认行为：它非常主动，常自行决策多执行几步。刚迁移到这代模型的人值得先看——了解它倾向于主动多做步骤，才好在指令中提前划定边界、明确哪些操作不需介入。&lt;/li&gt;&lt;li&gt;&lt;a href=&quot;https://techcrunch.com/2026/06/13/kpmg-pulls-report-on-ai-usage-due-to-apparent-hallucinations/&quot;&gt;KPMG pulls report on AI usage due to apparent hallucinations&lt;/a&gt; - KPMG 一份报告因疑似 AI 幻觉（编造的引用与数据）被撤回。又一个「拿 AI 产出不复核就发布」酿成失误的真实案例——用 AI 起草正式材料的人请记住：节省了初稿时间，省不掉核实事实这一步。&lt;/li&gt;&lt;/ul&gt;&lt;h3&gt;火热工具&lt;/h3&gt;&lt;ul&gt;&lt;li&gt;&lt;a href=&quot;https://github.com/addyosmani/agent-skills&quot;&gt;addyosmani/agent-skills&lt;/a&gt; - Addy Osmani 整理的 agent「技能」合集，本周 GitHub 涨星第一。本期工具栏几乎被「skill」密集覆盖，这份是入口级精选——想给自己的 agent 扩充能力，可先从这里挑选现成的参考使用。&lt;/li&gt;&lt;li&gt;&lt;a href=&quot;https://github.com/phuryn/pm-skills&quot;&gt;phuryn/pm-skills&lt;/a&gt; - 一套面向产品经理的 agent skill：写 PRD、梳理需求、排优先级都涵盖了。非工程岗想让 agent 接管日常文档工作的，这是少见的专为 PM 量身打造的一套。&lt;/li&gt;&lt;li&gt;&lt;a href=&quot;https://github.com/NVIDIA/SkillSpector&quot;&gt;NVIDIA/SkillSpector&lt;/a&gt; - 英伟达开源的 skill「探查器」：将 agent 已加载的 skill、各自行为及潜在冲突一目了然地呈现出来。skill 数量增多后容易失控，这类治理与可观测工具恰好填补了这一空缺——管理 skill 库的值得收藏。&lt;/li&gt;&lt;li&gt;&lt;a href=&quot;https://github.com/asgeirtj/system_prompts_leaks&quot;&gt;asgeirtj/system_prompts_leaks&lt;/a&gt; - 各家产品泄露的系统提示词合集。价值不在照抄，而在看头部产品怎么给模型设边界、定语气、设置约束——写自己的 prompt 时是极好的逆向教材。&lt;/li&gt;&lt;li&gt;&lt;a href=&quot;https://github.com/DeusData/codebase-memory-mcp&quot;&gt;DeusData/codebase-memory-mcp&lt;/a&gt; - 给编码 agent 记住整个代码库的 MCP server：跨会话留住对项目结构的理解，减少重复解释。已接入 Claude Code 或 Cursor 的可以试用，与近几周「给 agent 补记忆」的趋势一脉相承。&lt;/li&gt;&lt;li&gt;&lt;a href=&quot;https://github.com/LMCache/LMCache&quot;&gt;LMCache/LMCache&lt;/a&gt; - 给 LLM 推理做 KV cache 复用的开源组件：把重复前缀的 KV 缓存起来，长上下文与多轮场景下显著节省算力。做自托管推理、想压低延迟和成本的，这是值得关注的基础设施工具。&lt;/li&gt;&lt;/ul&gt;&lt;h3&gt;新亮点 / 前沿&lt;/h3&gt;&lt;ul&gt;&lt;li&gt;&lt;a href=&quot;https://www.latent.space/p/ainews-anthropic-claude-fable-5-mythos&quot;&gt;[AINews] Anthropic Claude Fable 5 — Mythos but Safe, with Controversial Terms&lt;/a&gt; - 本周主角：Anthropic 发布 Claude Fable 5 与 Mythos 5，随之而来的争议条款以及美政府一度要求暂停访问，使此次发布演变为一场风波。这篇将「模型本身」和「围绕它的条款与监管风波」都阐述清楚——想看懂本周整条主线，从这篇入手。&lt;/li&gt;&lt;li&gt;&lt;a href=&quot;https://huggingface.co/zai-org/GLM-5.2&quot;&gt;zai-org/GLM-5.2&lt;/a&gt; - 智谱开源 GLM-5.2，本周 HF 热榜前列。国产开源大模型又一次重要迭代，在意权重可自托管、成本与基准表现的值得认真留意。&lt;/li&gt;&lt;li&gt;&lt;a href=&quot;https://huggingface.co/google/diffusiongemma-26B-A4B-it&quot;&gt;google/diffusiongemma-26B-A4B-it&lt;/a&gt; - Google 放出 DiffusionGemma：用扩散（而非自回归）做文本生成的 Gemma 变体，26B 总参、A4B 激活。开放权重里少见的扩散式语言模型，想跟进非自回归生成路线的值得一看。&lt;/li&gt;&lt;li&gt;&lt;a href=&quot;https://huggingface.co/moonshotai/Kimi-K2.7-Code&quot;&gt;moonshotai/Kimi-K2.7-Code&lt;/a&gt; - 月之暗面 Kimi 的编码专用版 K2.7-Code 上 HF 热榜。开源编码模型阵营再添一员，想要不依赖大厂 API 的本地编码模型，可纳入对比。&lt;/li&gt;&lt;li&gt;&lt;a href=&quot;https://www.anthropic.com/research/making-claude-a-chemist&quot;&gt;Making Claude a Chemist&lt;/a&gt; - Anthropic 研究：如何将通用模型训练为具备化学能力的助手——数据、评测与安全护栏如何构建。AI for science 的一手案例，关注垂直领域能力如何「长出来」的值得一读。&lt;/li&gt;&lt;li&gt;&lt;a href=&quot;https://importai.substack.com/p/import-ai-460-reward-hacking-society&quot;&gt;Import AI 460: Reward hacking society, RSI data from Anthropic; and RL-based quadcopter racing&lt;/a&gt; - Jack Clark 的 Import AI 本期：reward hacking 的社会化、Anthropic 的 RSI（递归自我改进）数据、以及基于 RL 的质量评估。想跳出工具圈看治理与前沿研究的，这份周报信息密度一向高。&lt;/li&gt;&lt;/ul&gt;</content>
  </entry>
  <entry>
    <title>2026 · 第 23 期</title>
    <id>https://ai-weekly.rourouhz.com/#2026-W23</id>
    <link rel="alternate" href="https://ai-weekly.rourouhz.com/#2026-W23"/>
    <updated>2026-06-08T02:40:00.000Z</updated>
    <published>2026-06-08T02:40:00.000Z</published>
    <content type="html">&lt;p&gt;本周值得一看的 AI 实践、工具与前沿&lt;/p&gt;&lt;p&gt;本期主线：「harness engineering」走到台前——OpenAI 给它正式命名，GitHub 周榜涨得最猛的项目几乎都在给 agent 补 harness、skill 和「看世界的眼睛」。模型侧的大新闻是微软在 Build 上亮出自研 MAI 系列；此外整个圈子还在算另一笔账：AI 到底有多烧钱。&lt;/p&gt;&lt;h3&gt;个人玩法 / 实践&lt;/h3&gt;&lt;ul&gt;&lt;li&gt;&lt;a href=&quot;https://openai.com/index/harness-engineering/&quot;&gt;Harness engineering: Leveraging Codex in an agent-first world&lt;/a&gt; - OpenAI 给「以 agent 为先的工作方式」起了个名字——harness engineering：与其埋头打磨模型本身，不如把功夫下在外围的工具、上下文和流程上。文中那支三人小队用 Codex 跑出百万行生产代码就是底气。本周热门项目大半都在做这件事，先读这篇方法论，再看工具会更有脉络。&lt;/li&gt;&lt;li&gt;&lt;a href=&quot;https://blog.janestreet.com/i-design-with-claude-code-more-than-figma-now-index/&quot;&gt;I design with Claude more than Figma now&lt;/a&gt; - Jane Street 的设计师讲自己怎么从 Figma 转向直接和 Claude 一起做设计——用代码加对话迭代界面，比拖控件更快。难得的是给了具体流程，而不是泛泛的感想，想试同样转变的人可以照着走一遍。&lt;/li&gt;&lt;li&gt;&lt;a href=&quot;https://newsletter.pragmaticengineer.com/p/ideas-slow-down-to-speed-up-when&quot;&gt;Ideas: slow down to speed up when working with AI agents&lt;/a&gt; - AI 让人均代码产出翻了倍，质量和技术债却跟不上。这篇主张「先慢下来才能真快」：把评审、测试、约定这些基本功做扎实，再放手让 agent 提速。对正被产能冲昏头的人是一剂清醒药。&lt;/li&gt;&lt;li&gt;&lt;a href=&quot;https://news.ycombinator.com/item?id=48413629&quot;&gt;Ask HN: What is your (AI) dev tech stack / workflow?&lt;/a&gt; - 一条让人晒出真实工具栈的 Ask HN 帖——130 多条回复里全是开发者自报家门：用什么模型、什么编辑器、怎么把 agent 串起来。想抄配置、对照自己的 setup，直接进帖子翻评论就好。&lt;/li&gt;&lt;li&gt;&lt;a href=&quot;https://arxiv.org/abs/2601.14470&quot;&gt;Tokenomics: Quantifying Where Tokens Are Used in Agentic Software Engineering&lt;/a&gt; - 一篇把「agent 写代码时 token 到底花在哪」算清楚的论文，结论有点反直觉：最吃 token 的不是写代码，而是反复评审打磨（占近六成），输入 token 又占了总成本的一半多。知道钱花在哪，才好对症优化上下文——做 agent 编码的值得照它的方法盘点一遍自己的开销。&lt;/li&gt;&lt;li&gt;&lt;a href=&quot;https://simonwillison.net/2026/Jun/6/micropython-in-a-sandbox/&quot;&gt;Running Python code in a sandbox with MicroPython and WASM&lt;/a&gt; - Simon Willison 的新尝试：把 MicroPython 编译进 WASM，给「让 agent 跑它自己生成的 Python」做一个够轻、够隔离的沙箱（已发了 micropython-wasm 的 alpha 包）。想安全地执行模型产出的代码，这是一条可以直接拿来用的实现路径。&lt;/li&gt;&lt;/ul&gt;&lt;h3&gt;火热工具&lt;/h3&gt;&lt;ul&gt;&lt;li&gt;&lt;a href=&quot;https://github.com/NousResearch/hermes-agent&quot;&gt;NousResearch/hermes-agent&lt;/a&gt; - Nous Research 开源的 agent，主打「会跟着你一起成长」——把你的记忆和习惯都存下来，越用越贴合，还支持本地／云端／无服务器多种部署。本周 GitHub 周榜涨星最猛的开源 agent 之一，少数自带完整记忆设定、而非只是套壳的一个。&lt;/li&gt;&lt;li&gt;&lt;a href=&quot;https://github.com/affaan-m/ECC&quot;&gt;affaan-m/ECC&lt;/a&gt; - 把 agent 的 harness 当成一个可优化的系统来做：skill、本能、记忆、安全统统纳进来，理念是 research-first。想系统性提升 agent 表现、而不是零敲碎打地修补，值得看它怎么把这几层拆开。&lt;/li&gt;&lt;li&gt;&lt;a href=&quot;https://github.com/pbakaus/impeccable&quot;&gt;pbakaus/impeccable&lt;/a&gt; - 一套「设计语言」，专门让 AI harness 更会做设计——把审美和排版的规矩写成规则，交给 agent 照着做，专治那种千篇一律的 SaaS 模板味。正好呼应本周「拿 Claude 替代 Figma」那条：模型不缺手速，缺的是品味。&lt;/li&gt;&lt;li&gt;&lt;a href=&quot;https://github.com/mvanhorn/last30days-skill&quot;&gt;mvanhorn/last30days-skill&lt;/a&gt; - 一个 skill，让 agent 跨 Reddit、X、YouTube、HN、Polymarket 和全网，把某个主题近一个月的动静都搜罗一遍再汇总。做行业速览、追热点的人可以直接装来用。&lt;/li&gt;&lt;li&gt;&lt;a href=&quot;https://github.com/Panniantong/Agent-Reach&quot;&gt;Panniantong/Agent-Reach&lt;/a&gt; - 给 agent 装上「看整个互联网的眼睛」：能读、能搜 Twitter、Reddit、YouTube、GitHub、B 站等。和 last30days 是同一思路——本周好几个工具都在给 agent 补「感官」，让它不再只困在本地。&lt;/li&gt;&lt;li&gt;&lt;a href=&quot;https://github.com/can1357/oh-my-pi&quot;&gt;can1357/oh-my-pi&lt;/a&gt; - 终端里的编码 agent：用 hash 锚定改动、精简工具调用，内置 LSP、Python、浏览器和子代理。冲着「少废话、改得准」去的，适合不想离开命令行的人。&lt;/li&gt;&lt;/ul&gt;&lt;h3&gt;新亮点 / 前沿&lt;/h3&gt;&lt;ul&gt;&lt;li&gt;&lt;a href=&quot;https://simonwillison.net/2026/Jun/2/microsofts-new-models/&quot;&gt;Microsoft&apos;s new MAI models (MAI-Thinking-1 &amp; MAI-Code-1-Flash)&lt;/a&gt; - 微软在 Build 上放出自研 MAI 系列：MAI-Thinking-1（推理向，1T 参数、35B 激活，先给少数早期伙伴）和 MAI-Code-1-Flash（137B 参数、5B 激活，专为 Copilot 和 VS Code 调校、主打低成本）。这是微软从「买 OpenAI」转向「自己造」的明确信号。&lt;/li&gt;&lt;li&gt;&lt;a href=&quot;https://blog.google/innovation-and-ai/technology/developers-tools/quantization-aware-training-gemma-4/&quot;&gt;Gemma 4 QAT models: Optimizing compression for mobile and laptop efficiency&lt;/a&gt; - Google 放出 Gemma 4 的 QAT（量化感知训练）版本，目标是手机和笔记本也能流畅运行。这是开源权重向端侧落地的又一步，关心本地部署、想在自己机器上跑大模型的可以重点看。&lt;/li&gt;&lt;li&gt;&lt;a href=&quot;https://huggingface.co/nvidia/NVIDIA-Nemotron-3-Ultra-550B-A55B-BF16&quot;&gt;nvidia/NVIDIA-Nemotron-3-Ultra-550B-A55B&lt;/a&gt; - 英伟达本周连发——开源的 Nemotron-3-Ultra（550B 总参、55B 激活的 MoE，混合 Mamba-2 与注意力、上下文可达 1M），外加世界模型 Cosmos 3。这一版直接放出权重、体量跻身第一梯队，自托管阵营又多了一个重量级选择。&lt;/li&gt;&lt;li&gt;&lt;a href=&quot;https://importai.substack.com/p/import-ai-459-ai-oversight-is-difficult&quot;&gt;Import AI 459: AI oversight is difficult; scaling laws for protein folding models; and pricing the extinction risk of AI systems&lt;/a&gt; - Jack Clark 的 Import AI 本期三条线：为什么对 AI 做自动化对齐／监督比想象中难、蛋白质折叠模型也出现了 scaling law、以及怎么给「AI 灭绝风险」定价。想跳出工具圈、关注治理与 AI 科研交叉动态的，这份周报信息密度一向很高。&lt;/li&gt;&lt;li&gt;&lt;a href=&quot;https://arxiv.org/abs/2606.07462&quot;&gt;Act As a Real Researcher: A Suite of Benchmarks Evaluating Frontier LLMs and Agentic Harnesses in Research Lifecycle&lt;/a&gt; - 一套基准（AARRI-Bench），专门评测前沿模型配上 agent harness 后能不能真当研究员用：覆盖科研全流程，结果连最强配置（Claude Opus 4.7 + Mini-SWE-Agent）也只做到 68.3%，短板都在领域敏感度、科研伦理和科学判断这些细节上。给本周的 harness 热潮泼了盆冷水：能跑实验，不等于懂科研。&lt;/li&gt;&lt;li&gt;&lt;a href=&quot;https://huggingface.co/JetBrains/Mellum2-12B-A2.5B-Thinking&quot;&gt;JetBrains/Mellum2-12B-A2.5B-Thinking&lt;/a&gt; - JetBrains 开源的编码模型 Mellum2：12B 总参、2.5B 激活的「thinking」版（64 专家激活 8 个的 MoE，Apache 2.0），专攻写代码、激活量又小、便于本地部署。想要一个不依赖大厂 API、又能塞进 IDE 的开源编码模型，值得一试。&lt;/li&gt;&lt;/ul&gt;</content>
  </entry>
  <entry>
    <title>2026 · 第 22 期</title>
    <id>https://ai-weekly.rourouhz.com/#2026-W22</id>
    <link rel="alternate" href="https://ai-weekly.rourouhz.com/#2026-W22"/>
    <updated>2026-06-04T09:27:46.000Z</updated>
    <published>2026-06-04T09:27:46.000Z</published>
    <content type="html">&lt;p&gt;本周值得一看的 AI 实践、工具与前沿&lt;/p&gt;&lt;p&gt;首期上线。本周主线：Claude Code 的 skill 与 harness 生态集中爆发，三栏都有它的身影。带「AGENT」标记的，是编辑用 AI agent 额外查证、补充进来的条目。&lt;/p&gt;&lt;h3&gt;个人玩法 / 实践&lt;/h3&gt;&lt;ul&gt;&lt;li&gt;&lt;a href=&quot;https://www.shareuhack.com/en/posts/claude-code-community-skills-agent-fleet-guide-2026&quot;&gt;5 Claude Code Skills That Actually Work: Lessons from Running an AI Agent Fleet&lt;/a&gt; - 一位常年跑「agent 舰队」的实践者，复盘真正有用的 5 个 Claude Code skill 与踩坑——是「怎么用好」而非「有什么」的干货，正好对应本周 GitHub 上 skills/harness 的爆发。&lt;/li&gt;&lt;li&gt;&lt;a href=&quot;https://simonwillison.net/2026/May/30/how-we-contain-claude/&quot;&gt;How we contain Claude across products&lt;/a&gt; - 一线团队如何在多个产品里给 Claude 设边界、权限与防护的实操；任何把模型接进生产的人都绕不开的「可控性」话题，值得对照自己的接入方式看。&lt;/li&gt;&lt;li&gt;&lt;a href=&quot;https://simonwillison.net/2026/May/27/sqlite-agents/&quot;&gt;sqlite AGENTS.md&lt;/a&gt; - 给 sqlite 项目写 AGENTS.md 的实例——把项目约定固化成 agent 能直接读的上下文。想为自己的仓库接入 agent，这就是一份可直接参考的范本。&lt;/li&gt;&lt;li&gt;&lt;a href=&quot;https://darylcecile.net/notes/speed-of-prototyping-age-of-ai&quot;&gt;The Speed of Prototyping in the Age of AI&lt;/a&gt; - AI 把原型速度推到新量级之后，瓶颈从「写得快不快」转移到「是否真正想清楚」；讲「快」带来的新取舍，适合用来反思自己的开发节奏。&lt;/li&gt;&lt;li&gt;&lt;a href=&quot;https://interconnected.org/home/2026/05/30/fedex&quot;&gt;How global logistics got me over my fear of personal agents&lt;/a&gt; - 作者借一次国际物流的经历，放下了对「个人代理」的戒心。关于如何把自主 agent 融入日常、如何划定边界，难得的非技术向实践视角。&lt;/li&gt;&lt;li&gt;&lt;a href=&quot;https://mastodon.gamedev.place/@JeremiahFieldhaven/116654345332213390&quot;&gt;Rsync 3.4.3 has hundreds of Claude commits&lt;/a&gt; - 连 rsync 这样的老牌底层项目都出现了成百上千条 Claude 协作提交。AI 进入严肃开源维护的真实信号——值得观察社区如何使用，以及争议集中在何处。&lt;/li&gt;&lt;/ul&gt;&lt;h3&gt;火热工具&lt;/h3&gt;&lt;ul&gt;&lt;li&gt;&lt;a href=&quot;https://github.com/harry0703/MoneyPrinterTurbo&quot;&gt;harry0703/MoneyPrinterTurbo&lt;/a&gt; - 一键用大模型生成高清短视频，本周 GitHub 周榜涨星最猛。内容创作向 AI 工具的代表，适合想把「脚本到成片」自动化的人。&lt;/li&gt;&lt;li&gt;&lt;a href=&quot;https://github.com/colbymchenry/codegraph&quot;&gt;colbymchenry/codegraph&lt;/a&gt; - 给编码 agent 用的「预索引代码知识图谱」：更少 token、更少工具调用、100% 本地。适配 Claude Code/Codex/Cursor 等，本质是为 agent 加上一层代码记忆。&lt;/li&gt;&lt;li&gt;&lt;a href=&quot;https://github.com/Leonxlnx/taste-skill&quot;&gt;Leonxlnx/taste-skill&lt;/a&gt; - 一个为 AI 补充审美能力的 skill，针对模型生成的那种无聊、套路化的「AI 味」内容。本周 skill 热潮里最令人印象深刻的一个，思路值得借鉴。&lt;/li&gt;&lt;li&gt;&lt;a href=&quot;https://github.com/chopratejas/headroom&quot;&gt;chopratejas/headroom&lt;/a&gt; - 在传入 LLM 之前压缩工具输出、日志、文件与 RAG 片段，号称省 60–95% token 而答案不变；提供库 / 代理 / MCP server 三种用法，长上下文场景下节省费用的实用工具。&lt;/li&gt;&lt;li&gt;&lt;a href=&quot;https://github.com/anthropics/claude-code&quot;&gt;anthropics/claude-code&lt;/a&gt; - 官方的终端 agentic 编码工具，本周仍稳居周榜：理解整个代码库、执行 git 流程、用自然语言完成例行任务。本期大半工具都围绕它的 skill 与 harness 生态展开。&lt;/li&gt;&lt;li&gt;&lt;a href=&quot;https://github.com/supermemoryai/supermemory&quot;&gt;supermemoryai/supermemory&lt;/a&gt; - 面向 AI 应用的记忆引擎与 API，主打高速与可扩展性。为 agent、应用加一层持久记忆的基础设施，和本期几个为 agent 补充上下文的工具是同一个方向。&lt;/li&gt;&lt;/ul&gt;&lt;h3&gt;新亮点 / 前沿&lt;/h3&gt;&lt;ul&gt;&lt;li&gt;&lt;a href=&quot;https://simonwillison.net/2026/May/28/claude-opus-4-8/&quot;&gt;Claude Opus 4.8: &quot;a modest but tangible improvement&quot;&lt;/a&gt; - Anthropic 发布 Opus 4.8，Simon Willison 评价是「小而实在的提升」；同期还发布了 Dynamic Workflows、ultracode（见 Latent Space）。本期不少工具其实都是冲着这个新版本做的。&lt;/li&gt;&lt;li&gt;&lt;a href=&quot;https://huggingface.co/google/gemma-4-12B-it&quot;&gt;google/gemma-4-12B-it&lt;/a&gt; - Google 开源 Gemma 4（12B 指令版），本周位居 HF 榜首。开源权重阵营的又一次重要迭代，体量适中、本地可跑，适合自托管与微调。&lt;/li&gt;&lt;li&gt;&lt;a href=&quot;https://huggingface.co/deepseek-ai/DeepSeek-V4-Pro&quot;&gt;deepseek-ai/DeepSeek-V4-Pro&lt;/a&gt; - DeepSeek V4 系列上架 HF（Pro / Flash 双版本），延续其高性价比路线。开源大模型阵营本周又一个重量级新选择，值得关注它的推理成本与基准表现。&lt;/li&gt;&lt;li&gt;&lt;a href=&quot;https://huggingface.co/LiquidAI/LFM2.5-8B-A1B&quot;&gt;LiquidAI/LFM2.5-8B-A1B&lt;/a&gt; - Liquid 的 LFM2.5：8B 总参、A1B 激活的 MoE，主打激活量小、低延迟。是端侧、省算力方向的代表，关心本地与边缘部署的可以重点关注。&lt;/li&gt;&lt;li&gt;&lt;a href=&quot;https://www.latent.space/p/esmfold2&quot;&gt;🔬ESM: The Bitter Lesson is Coming for Proteins — Alex Rives&lt;/a&gt; - Alex Rives 谈蛋白质模型的「苦涩教训」——规模化正在逐步淘汰手工设计的特征。AI for science 的前沿信号，值得跳出 LLM 视角，观察大模型范式如何外溢到生物领域。&lt;/li&gt;&lt;li&gt;&lt;a href=&quot;https://www.promptarmor.com/resources/gpt-for-google-sheets-data-exfiltration&quot;&gt;ChatGPT for Google Sheets exfiltrates workbooks&lt;/a&gt; - PromptArmor 披露「ChatGPT for Google Sheets」可被提示注入诱导外泄整个工作簿。这是接入 LLM 的生产力插件的安全前沿议题，每个做 agent / 插件集成的人都应读一遍。&lt;/li&gt;&lt;/ul&gt;</content>
  </entry>
</feed>
