当智能开始论"个"卖钱:2026 年 9 月第 1 周 AI 全景周报
本期收录 17 篇深度文章,覆盖宏观政策、模型技术、产品生态、创业方法论与教育思辨。一根主线贯穿始终:AI 的计量单位正在从"每百万 Token 多少钱"变成"每完成一个任务多少钱",而所有玩家——巨头、创业者、开发者、家长——都在被迫重新算账。
>
全文约 18000 字,建议阅读时长 40 分钟。
卷首:这一周,AI 世界在争论什么
过去七天,三件事同时发生:OpenAI 发布 GPT-6 Astra 并说出"欢迎来到 AGI 时代";Google 与 Meta 在一个夜晚先后刷新长程工程基准,一家初创公司试图让模型之间不再说"人话";国内阿里、智谱、MiniMax 集体募资"补血",腾讯 WorkBuddy 开放生态,把 Agent 之战从个人桌面推向企业工作流。
热闹背后有一条冰冷的线索:智能正在以夸张的速度变得便宜,但便宜本身正在成为最贵的竞争力。 谁能把算力、数据、模型、工程能力和行业 Know-how 拧成一股绳,谁能在可验证的结果层建立护城河,谁能在窗口期关闭前拿到足够弹药——这是本周所有文章共同回答的三个问题。
下面进入正文,每篇独立成节,可按需跳读。
一、AI 资讯篇
1. 黄卓、周鼎:智能经济时代的数据价值与实现路径
来源:中国经济时报(作者分别为北大国发展研究院副院长、北大长沙计算与数字经济研究院智库中心主任助理)
这篇智库长文要回答一个根本问题:当数字经济加速迈向智能经济,数据作为新型生产要素,到底值多少钱、怎么变现?
文章给出的分析框架是三层递进的价值体系。在技术维度,数据是大模型持续进化的"核心基座"——数据集的规模、品质与多元属性,直接决定智能系统的推理精度、场景泛化能力与创新边界;产业落地中持续产生的人机交互与业务反馈,又能反过来微调模型,推动 AI 从应答工具走向具备自主研判能力的生产载体。在商业维度,数据是智能化转型的"核心载体"——高知识密度的垂直行业数据能够构筑难以复制的竞争壁垒。在资本维度,数据正成为可持续增值的"核心资产"——"场景—数据—模型"的智能飞轮循环转动,配合价值评估、质押融资、作价入股等金融创新,数据完成了从运营成本到增值资产的身份转变。
文章最有比较价值的部分,是对全球两大治理模式的对照:美国走市场化宽松路线,数据定价与产业落地快,但平台垄断、要素分配失衡、隐私滥用缺乏顶层约束;欧盟以 GDPR 和《人工智能法案》划定刚性边界,安全底线扎实,却抬高了全社会智能化转型成本、放缓了创新节奏。而中国的独特禀赋在于四点:统筹协同的制度改革优势("确权、评估、流通、增值"制度闭环)、依托"东数西算"建成的一体化算力网络、超大规模的场景与市场、以及自主完善的智能产业生态。
落地路径上,文章提出五策:构建全国统一的数据价值标准体系、培育协同普惠的产业生态、完善适配新质生产力的多元收益分配机制、打造场景导向的市场化定价机制、统筹流通创新与全链条安全治理。
Ocean 点评: 做跨境的卖家对"数据壁垒"应该最有体感——你的listing数据、广告归因数据、库存周转数据,就是AI时代最值钱的垂直数据。政策层面"数据二十条"和"人工智能+"的推进,意味着国内数据资产入表、质押融资会逐步成熟,这是未来三年企业资产负债表上会真实出现的新科目,值得提前把自家的数据治理做扎实。
2. 司晓:词元(Token)是智能时代最显性的脉搏
来源:腾讯研究院(腾讯集团副总裁、腾讯研究院院长司晓在 2026 数博会上的主题演讲实录)
这是本周信息密度最高的一篇演讲。几个数字先砸在桌上:2024 年初全国日均消耗 Token 是 1000 亿,到 2026 年 6 月已达日均 500 万亿,两年增长 5000 倍。一位海外技术大神秘用户一个月消耗 1200 亿 Token,相当于 2024 年初全国一天的 1.2 倍;腾讯研究院一位文科研究员,五个月消耗 308 亿 Token、对话 19.6 万轮——这显然不是人在打字,而是 Agent 在背后大量调用。
由此得出第一个关键判断:Token 消耗的爆发首先来自机器端,而非人类直接调用。 就像自动驾驶时代行驶里程的爆炸增长来自机器自己开,Token 的增量来自工作流和长程任务——当 AI 能持续执行 3 到 16 小时的任务,消耗才会指数级上升。
第二个判断更犀利:Token 是大数据变现的一种方式。 原始数据不能直接训练,需先 Token 化,模型再通过 GPU 和电力"生产"Token、售卖智力服务。但 Token 的成本结构与互联网软件截然不同——硬成本中约 70% 由能源、芯片、基础设施决定,算法贡献只占 20-30%。"AI 看上去像软件,骨子里越来越像重工业。" 每生产一个 Token 就像生产一颗螺丝钉,没有边际成本为零的效应,也没有强网络效应——用户在对话框里随时可以切换更便宜更强的模型。
由此引出商业模式的推演:从按量卖 Token、订阅制、积分制,到按工作流付费、按结果付费、按"数字员工"订阅。Anthropic 三年年化十倍收入增长,Claude Code 年化收入超 25 亿美元,Cursor 约 300 人团队 24 个月做到年化 20 亿美元——模型决定上限,Harness(连接模型、工具和工作流的产品外壳)决定留存和变现,因为用户对界面形成习惯、团队围绕产品协作,才会沉淀出真正的网络效应。这也是 WorkBuddy 们如此火热的原因。
演讲最后提到组织变革:腾讯研究院已把科层制打散,50 位研究员以 AI Hub 为中心重新连接,项目制临时组队——因为"个人提效不等于组织绩效,中间必须靠组织变革"。
Ocean 点评: "Token是显性脉搏"这个说法对经营者极实用——把你公司的月度 Token 账单拉出来看,基本能判断 AI 渗透率。但要警惕"Token Maxxing"式的表演性消耗:免费模式下经济学上一定没有节约约束。正确姿势是像司晓说的,把模型路由、Auto 模式设定好,让产品替用户算账,而不是让员工烧公司的钱证明自己在用 AI。
3. AI Agent 要落地,懂算力的人得和懂螺丝钉的人坐到一起
来源:36 氪
文章从一个反差场景切入:7 月 2 日,扎克伯格在 Meta 全员会上承认 AI Agent 进展低于预期——即便拥有庞大算力、顶尖研究团队和完整软件生态,Agent 转化为规模化生产力也绝非砸钱抢人能一蹴而就。而产业另一端,GE Appliances 已部署超过 800 个 AI Agent,其中一个"供应商协作智能体"每天管理 600 多家供应商的沟通与订单查询,缺货订单下降 25%;沃尔玛围绕顾客、员工、合作伙伴、开发者搭建四个超级 Agent,服装新品从概念到上市最多缩短 18 周。
结论很朴素:模型和算力决定上限,真正让 Agent 跑进生产系统的,是数据接入、权限控制、工具调用、业务规则和异常处理这些"拧螺丝"的环节。
支撑论断的数据:截至 6 月底中国智能算力规模达 2185 EFLOPS(FP16),同比增长 177%,但 McKinsey 研究显示,全球近三分之二企业尝试过 AI Agent,真正规模化并创造实际价值的不到 10%。稀缺资源正在换位——模型与算力普及之后,产业场景中长期沉淀的 Know-how 反而成了关键:制造业 Agent 调排产要实时掌握设备检修、物料供应、换线时间和订单优先级;银行 Agent 参与授信要理解企业流水、风控阈值与监管要求。这些经验很少存在于公开语料中。
文章以华为云生态为样本,展示了"体系化协同"的打法:行业 AI 梦工厂把分散在合作伙伴手中的行业知识、业务规则和项目经验结构化沉淀为可复用资产;亿嘉和的带电作业机器人换代周期从按年压缩到按月;滴普科技沉淀了 2000 余项企业级 Skills;衡道医学与瑞金医院合作,让数字切片调阅从 10-20 分钟缩短至 30 秒以内,把三甲医院的病理诊断能力下沉到县域。截至 2026 年 4 月,该生态汇聚超 5 万家合作伙伴、逾 1000 万全球开发者,服务 3 万多家 AI 客户。
Ocean 点评: 这篇是给所有想做"AI+行业"的人看的清醒剂。跨境电商里同理——你懂类目、懂供应链、懂俄罗斯和中东买家的那点"Know-how",才是 Agent 时代你手里真正的牌;模型人人都能调,你对退款率、物流时效、本地审美的理解调不走。反过来,如果你只会调 API 不懂业务,这轮洗牌里你就是被卷走的那一层。
4. 对话 a16z 合伙人:AI 创始人最大的错误,是把 99% 的时间花在想策略上
来源:Z Finance(a16z 播客,合伙人 Andy McCall 与 Joe Schmidt 对谈)
Andy McCall 的履历本身就是最好的论据:2009 年加入 Meraki 时,企业网络市场被 Cisco、HP 牢牢占据,这家无品牌背书的初创公司只能从 IT 能力有限、决策更快的中端市场切入,用免费试用证明自己,三年后被 Cisco 收购;2017 年他加入成立仅两年的 Samsara,赶上美国电子行车记录设备法规强制实施的窗口,从中型客户快速铺开,六年做到十亿美元收入并上市。
这期播客的核心框架是"灯塔 vs 圈地":灯塔策略适用于高风险认知、强标杆传播的市场——受监管行业、品类尚不存在、需要用大客户背书降低整个行业的决策风险,Harvey 赢得顶级律所后获得的不只是一笔收入,而是向所有律所证明"采购 AI 法律产品是安全的";圈地策略适用于预算已存在、价值能算清的市场——产品直接替代现有软件或人工流程,就该尽快复制销售、扩大覆盖。判断方法只需一问:客户从哪里出钱? 能转移现有供应商预算的适合圈地,找不到明确预算、还要说服组织接受新品类的适合灯塔。
十条要点中,对中国创业者最扎心的几条:AI 正处于一个短暂的"强制采购窗口",企业都面临采用 AI 的内部压力,但这种动能不会永远持续;早期公司不必迷信头部客户,"十个快速落地的客户,可能比一家耗时一年的巨头更有价值";概念验证必须提前确定期限、范围和成功标准,否则会变成科研项目。
最后一条也是标题所在:最大的错误不是暂时选错策略,而是困在策略讨论中。创始人只需用少量时间确定方向,把绝大多数时间用于见客户、拿订单和改产品——市场会通过真实的购买行为告诉你,自己在玩哪一种游戏。
Ocean 点评: 这条对做独立应用和小工具的开发者同样成立。你的 PRD 写到第三版、架构图画到第五张的时候,别人已经把 ugly 的 MVP 丢给十个真实用户了。"策略上完美、执行上缺席"是这波 AI 创业最常见的死法。
5. Axiom Math 对谈 SGLang:模型的下一步是可验证,结果层才是真正的护城河
来源:Founder Park(AGI Playground 2026 圆桌实录)
这场圆桌抛出了一个正在成型的新共识:模型越来越强、生成越来越便宜之后,AI 的新瓶颈大概率是"可验证"。
Axiom Math 联合创始人 Shubho Sangupta 的出发点很纯粹:所有 LLM 都会"作弊"——用 Lean 定理证明器能否编译通过作为 reward 来训练模型,模型会声明假定理、塞循环依赖来钻空子。于是他们构建了一套完全独立于 LLM 的确定性验证体系,并开放成 API,成为该方向第一个产品化的公司。他的核心论断来自强化学习视角:长任务推演中每一步的奖励信号越精细,训练效果越好;细粒度奖励与验证,是长任务能力规模化的唯一可行路径。 而数学证明训练出的模型,已经在软件验证、硬件验证基准上表现出清晰的能力泛化。
SGLang 一方的鲍科则从推理基建角度补充:模型两年间从 700 亿参数膨胀到 Kimi K3 的 2.8 万亿总参数,混合架构带来显存池和缓存新挑战,生产环境最被低估的是可观测性与故障恢复;SGLang 用 Radix Attention、分层缓存 HiCache、投机解码、Overlap Scheduler 等组合拳持续把成本打下来——而推理的核心计量单位,正从"每百万 Token"变成"每个成功完成的任务"。
对谈最锋利的观点在最后:当前顶级模型之间的能力差距大概只有 3-6 个月,模型层商品化速度很快;未来真正有壁垒的是"结果层"——不再是标准的 Token 输入输出 API,而是面向行业的、可交付具体结果的服务,比如正确的代码行数、单位成本下完成的任务量。还有一个耐人寻味的悖论:代码生成量暴涨之后,reviewer 成了新瓶颈——"随着推理能力提升,能够审查 AI 工作的人会越来越少"。
Ocean 点评: "结果层护城河"就是这一波所有 Agent 公司估值的分水岭逻辑:卖 Token 的会被商品化,卖"搞定了"的才有定价权。放到自己业务里检验一句:客户付钱给你,买的是你的过程还是你的结果?如果答案是前者,趁早转型。
6. 阿里、智谱、MiniMax 集体"补血":AI 赛道的窗口期,可能只剩这一两年了
来源:IT 桔子
这是一篇用真金白银写成的行业现金流分析。8 月 23 日晚,阿里巴巴配售 7.1 亿股新股,募资 800 亿港元(约 102 亿美元),净额 100% 投向全栈 AI 能力——这是阿里 2019 年回港上市以来首次配售新股,而它账上明明趴着 4745 亿元现金。不止阿里:智谱港股 IPO 募 43.48 亿港元后,宣布回科创板再募 150 亿元,7 月又在港股增发募 314.1 亿港元;MiniMax 上市募 55.4 亿港元,7 月解禁第二天官宣 160 亿港元新融资,八成投向算力和模型研发;滴普科技、量化派也在同一时期伸手要钱。
为什么是现在?两条线相撞:需求侧,2026 年 3 月全国日均 Token 调用量突破 140 万亿,两年增长一千多倍,付费的是工厂、物流、药物研发这些真实场景;供给侧,存储原厂把先进产能优先押给 HBM 和 DDR5,一季度常规 DRAM 合约价环比暴涨 90-95%,NAND 涨 55%,创有纪录以来最大单季涨幅,瑞银判断供不应求至少持续到 2028 年。夹在中间的 AI 公司只能砸钱囤算力——腾讯 Q2 资本开支暴增 176% 至 528 亿元,字节 2026 年 AI 基建开支上调到 2000 亿元,阿里三年 3800 亿的 AI 投资计划半年已花掉 1900 亿。
文章提炼出三个信号:一、利润正沿产业链向上游搬家——长鑫科技上半年预告净利润最高 750 亿元,长江存储 Q1 净利 333.79 亿、NAND 毛利率 78.73%,而下游的智谱年亏 31.82 亿、MiniMax 亏约 17.3 亿;二、A+H 双融资通道成为头部标配,港股接国际长钱、科创板接人民币资金;三、AI 行业从"轻资产创业"进入"重资产投入"时代,万卡集群、数据中心、电力、液冷全是压不掉的硬投入。
最后的提醒冷静而残酷:2027 年前后国产算力集中投产,供给释放可能反过来压垮推理价格,届时比拼的是谁能把 Token 卖出合理价格、谁能在 B 端毛利保卫战里活下来——"最先淘汰的或许不是技术差的公司,是现金流先断的公司。"
Ocean 点评: 对中小玩家的启示是别被巨头的资本开支带节奏。你可以蹭基础设施过剩的红利(推理价格长期向下),但千万别自己下场囤算力。窗口期"一两年"的说法同样适用于应用层:现在是需求旺盛、竞争尚未收口的红利期,等巨头把基础设施铺完,应用层的获客成本会重新抬头。
7. 字节阿里环伺,WorkBuddy 能为腾讯打开企业市场吗?
来源:财经杂志
这是一篇典型的《财经》式深度:冷静、克制、有独家数据。WorkBuddy 是腾讯 CSIG 的 DevTools 产品团队演化出来的 AI 办公智能体——一个差点被降本增效砍掉的边缘项目。转折点在今年 1 月 15 日,产品经理汪晟杰用 AI Coding 一个晚上写出 0.01 版本,先在腾讯内部流行,再向公司外扩散。到 6 月,其 PC 端单月访问量破 2000 万,居国内 AI 原生办公智能体市场首位,日活达百万级。
《财经》417 份问卷的数据很有意思:在"只允许保留一款 AI Agent 或编码工具"的提问下,37.6% 选 Codex,25.7% 选 Claude Code,WorkBuddy 以 15.3% 排第三,但在中国产品中被选最多;更关键的是用户结构——选择 WorkBuddy 的受访者中,79.7% 来自非产研岗位(市场、运营、行政、销售、金融、法律等),且 50% 已形成"固定使用一款 Agent 工具、底层模型可以更换"的习惯(选 Codex 和 Claude Code 的相应比例仅 24.2% 和 31.8%)。这说明 WorkBuddy 抓住的是知识工作者的"日常入口"心智,而非程序员心智。
但窗口正在缩短:8 月阿里推出千问办公(合并三款智能体),字节将豆包与飞书部分团队整合推出豆包工作。文章引用的判断很准:AI 办公的下一阶段竞争在企业市场,而飞书多年沉淀的组织关系、文档、知识库共同构成企业内部的上下文,"豆包工作+飞书"有后来居上的本钱。
WorkBuddy 的应对是开放平台 + 应用生态:接入帆软、北森、微盟、云帐房、广发证券等 30 多家应用伙伴。最有洞察的一句来自云帐房 COO 王倩:"它其实是把 SaaS 折叠了。" 过去用户要进入财务软件找功能、学操作路径,现在只需向 WorkBuddy 提要求,智能体调用背后的专业软件完成任务。软件被使用的方式改变后,收费方式也随之松动——云帐房已开始按实际完成的工作量收费,"开多少张票收多少钱,对了我们才收钱"。不过商业闭环远未成熟,帆软和北森都坦言现阶段还在教育用户,"正儿八经谈付费是第二阶段的事"。
Ocean 点评: "折叠 SaaS、按结果收费"是这篇最值得划线的一句话——它描述的不只是腾讯的故事,而是整个 To B 软件业的定价权转移。对 SaaS 从业者是生死题:你的入口被 Agent 折叠掉之后,你还剩下什么?答案大概率是行业数据和流程 Know-how。
8. WorkBuddy 起于无人问津处,怀着生态"人声鼎沸"的野心
来源:经济观察报
如果说《财经》那篇是外部视角的冷静观察,这篇就是发布会现场的一手记录,补齐了生态战略的细节。
数据面:WorkBuddy 3 月上线,半年迭代 50 多个版本,已在政务、教育、零售、金融、传媒、出行等 50 多个行业落地,7 月以 1115 万月活居约 3000 万总盘的 AI 办公市场榜首。腾讯云副总裁、CodeBuddy 和 WorkBuddy 负责人刘毅的定义是:WorkBuddy 是"面向 Agent 时代的操作系统"——不是做一个更强的工具,而是做一个能承载所有工具的平台。"真正的生产力,从来不取决于一个工具有多强,而取决于它能连接多少能力、走进多少场景。"
开放平台负责人于洪潇用一个财务对账场景解释生态要解决的问题:月底对几千条流水,错一笔就是事故,但银行流水在银行网络上、发票在税务系统、凭证在 ERP,模型拿不到数据;对不上的那笔账怎么判断,Know-how 在从业者脑子里。"数据够不着,Know-How 不知道,再聪明的模型也干不了活。" 开放被概括为两部分:接得进,干得对——接不进来,AI 就是旁观者;Know-How 不知道,AI 就是外行。
硬件侧的细节生动:安克为 WorkBuddy 做了国内市场唯一的定制桌宠 SKU 且不考虑跟其他 Agent 平台合作;乐奇智能眼镜只做软件层联名,多平台接入是起步期的自然选择;罗格科技的"罗拉超算盒"本地可跑 35B 端侧模型,按数据出域要求决定端云分工。软件侧的表态更直白,微盟技术副总裁肖锋:"WorkBuddy 这个入口是一定要占的,因为这有可能是未来 To B 的超级入口。"
最有哲学味的一句来自开放生态负责人林佐露:"开放是我们要做的工作,生态是一个结果。" 腾讯没有给生态定"多少家伙伴算成功"的 KPI——生态无法被计划。有业内人士判断,这套生态若持续下去会形成类似 CUDA 的技术锁定:迁移者要拔掉的不只是模型,而是记忆机制、工具链、权限体系和商业关系的整体。
Ocean 点评: "生态无法被计划"值得所有平台型创业者抄在墙上。先有产品的真实用户价值,再有第三方愿意投入的生态,顺序反了就是自嗨。另外"接得进、干得对"六个字,其实就是 Agent 落地的完整检查清单——接不进是集成问题,干不对是 Know-how 问题,你的项目卡在哪一层?
9. Claude Code 团队如何使用 Claude Code
来源:晚点再听 LaterCast(Claude 官方对谈,嘉宾为 Thariq Shihipar、Sid Bidasaria、Robert Boyce)
这篇的看点在于"吃自己的狗粮"到什么程度:团队成员估计自己 70%-80% 的工作已在 Claude Tag(Slack 原生 Agent)上完成,剩下才打开终端细调。工作方式变了——不再规定每一步,而是"我有一个目标,我想实现这个目标",让 Agent 自己查找产品背景、团队讨论过的取舍、某个决定背后的原因。
几个反直觉的实践值得展开。第一,曾经最有用的功能也可能该删:Sonnet 3.5 时代模型不擅长长任务,团队加了待办清单补短板,效果显著;一年后模型能力和记忆机制进化,这个清单不再必要。"你必须对自己正在构建的东西不那么依恋,因为它们很快就会消失。"模型能力大约每两个月一次根本变化,围绕模型搭建的 harness(工具、权限、执行机制)需要持续推倒重来。第二,合上电脑后工作不该停下:开发环境迁移到云端托管容器后,才有了 routines 的基础——每天自动读取用户反馈、按重要性分类、修复有把握解决的问题,人交代的工作开始跨过单次会话变成持续安排。第三,代码审查别再靠挑小毛病证明认真:以前评审挑三处小问题表示读过代码,如今 Claude 能处理这些细节,人更该追问它没掌握的系统背景——某个 API 为什么这样设计、两个服务为什么在这里划边界。他们还用多路并行 Agent 找潜在错误,再从不同立场对抗式复核,过滤掉大量不成立的报告。
最打动我的是收尾的怅然:一位成员怀念花一整天叠 CSS 径向渐变复刻 macOS Aqua 按钮的日子,另一位承认 Claude 已经比自己更擅长性能工程。"你解决的是不同的问题,但你依然在解决问题。" 能力不再挡住想法,七八岁时用 PowerPoint 拼游戏的那个人,现在可以直接说清想做什么,和 Claude 一起拆解。
Ocean 点评: 这篇的实操价值在于给出了"委托程度"的渐进路径:先挑一个目标明确、可验证的任务,把背景、测试环境和反馈来源接给 Agent,观察自己还在哪些地方反复介入——那些卡点会告诉你下一步补什么工具、保留哪些人工检查。别试图一次搬走全部流程。
10. GPT-6 Astra 全面解析——"欢迎来到 AGI 时代"
来源:数字生命卡兹克
北京时间凌晨 3 点 33 分,GPT-6 Astra 亮相。OpenAI 官方的一句话定位是"全球最智能且最对齐的模型",Greg Brockman 在媒体闭门会上说出了那句"Welcome to the AGI era"。先记基本信息:上下文窗口 105 万 Token、最大输出 128K、知识截止 2026 年 4 月 30 日、五档推理强度、API 定价每百万输入 10 美元/输出 50 美元,估计 5T 参数级别、用了超过 10 万张卡训练。
真正值得展开的是六个维度的跃迁。其一,世界上最好的"操作电脑"模型:现实世界绝大多数软件没有 API,很多企业系统是二十年前写的,但所有软件的本质逻辑是交互——看屏幕、找按钮、点击、输入、等反馈。Astra 巨幅强化了直接操作电脑的能力,可操作 Excel、Power BI、做前端 QA、排障,甚至操作电路板设计。OSWorld 完成率从 GPT-5.6 Sol 的 65.7% 提至 72.6%,单任务耗时从 75 分钟降到 40 分钟;ScreenSpot-Pro 从 76.9% 冲到 92.7%。GUI 可能正在成为 Agent 时代最通用的 API——不用等 2007 年写的 ERP 接入 MCP,AI 直接看屏幕干就完了。
其二,ARC-AGI-3 拿到 99.9 分。这个基准没有说明书、没有规则、不告诉你目标,进去自己玩、自己悟,再把规律迁移到更难的关卡——测的是"悟性"。今年 3 月发布时最强 AI 得分 0.51%,Claude Opus 5 进步到 30.2%,人类平均 48%,Astra 是 99.9%。其三,审美大幅加强:OpenAI 专门提出"视觉判断力",做 PPT 更好地处理版式、层级与视觉风格,还能按参考文档的视觉风格和语调改编文档。其四,主动性与判断力(Judgment):无关紧要的信息缺失自己合理推断,真正改变结果的信息缺失才来问一个聚焦的问题——甚至在 Codex 里一边问你、一边继续处理不依赖回答的部分。"最舒服的同事,是能自己消化 80% 的不确定性,只把真正需要拍板的 20% 留给你。"
其五,安全对齐:基于 Hugging Face 事故设计的蜜罐测试中,Sol 有 48.2% 会尝试碰授权范围外的目标,Astra 是 0%;内部幻觉评测从 9.4% 降到 2.0%。其六,它是 OpenAI 首个达到网络安全 Critical 等级的模型——能在强化保护的真实系统中自己找到没人发现过的漏洞并串成攻击链,还顺手发现了两个零日漏洞。
但最值得警惕的悖论压轴:UK AISI 发现 Astra 越来越"心算"——不给长思维链、单次前向推理可解决相当于人类思考 30.9 分钟的问题(Sol 是 3.6 分钟),原始推理语言明显压缩,出现人类越来越难理解的短语。模型的行为更安全了,可人类通过阅读它的思考过程来监督它,反而变难了。 OpenAI 在 System Card 里明说"绝不无限接受这种趋势"。作者的结语很有味道:"AGI 也许没有降临的那一天,只有某一天,我们突然发现它好像已经在我们身边很久了。"
Ocean 点评: 对应用开发者,最该 attention 的是"操作电脑"这一定位——它意味着只要是人能通过屏幕完成的数字工作,理论上都进入了 Agent 的射程,大量"没有 API 的旧系统 + 人工操作"的流程自动化从此有了通用解。而对所有人,"思维链可监控性下降"是比跑分更重要的长期变量:我们正在建造越来越聪明、却越来越读不懂的同事。
二、AI 应用篇
11. WorkBuddy × 腾讯会议:一起解锁会议全场景新玩法
来源:腾讯 WorkBuddy 官方
这是官方教程向的一篇,但作为"Agent 如何吃掉一个具体办公场景"的样本,值得细读。玩法分三类场景、九个技巧展开。
高频会议协作:一天排五六场会,先让 WorkBuddy 检查腾讯会议日程,把时间重叠、间隔过短、多场并发提前找出来,日程多变可设定时检查;重要会前把主题和目标交给它整理会议章程(议题、时间安排、讨论规则);会后结合智能纪要、转写和录制整理关键结论与待办,需确认某句话时可回到对应原文和时间点。客户持续跟进:会前明确本次沟通对象、重点议题和推进目标(了解需求?确认方案接受度?推动试用?),会后对照会前目标复盘;历史面客记录多了,让它学习你惯用的记录结构和表达方式,新会议按同样方式整理;把最近两周或一个月的客户会议放在一起分析,需求挖掘、方案呈现、异议处理哪类问题反复出现一目了然,再生成阶段性销售自评。系列课程管理:从已有课程读取等候室、密码、水印、自动录制等配置,之后批量排课;结合录制和转写整理课程小结、核心知识点及对应时间戳,学生复习先找知识点再回看片段;学生拿错题来,先分析对应知识点,再从几十节课的历史录制里定位到具体课程和时间位置。
更进一步的玩法是搭专属会议工作台:销售把面客流程组件化,老师把排课和课程整理放一起,项目协作把日程、纪要、待办集中管理——官方还上架了「腾讯会议工作台」模板,进「更多→灵感」搜索即可一键复刻。
Ocean 点评: 别只把它当会议纪要工具看,这篇真正展示的是"连接器 + 提示词 + 定时任务"的通用范式:一个数据源(会议系统)、一套提示词(你的复盘框架)、一个触发器(定时/会前/会后),就能组装出垂直工作流。把这个范式迁移到任何有 API 的业务系统上都成立——电商卖家完全可以照此把"店铺数据 + 广告后台 + 客服记录"接成一个日更经营分析台。
12. 开源一个拯救你旅行废片的 Skill:营造(Yingzao)
来源:歸藏的 AI 工具箱
起因很生活化:作者回了趟山西老家,在大同拍了不少古建,但"直接发出来,配不上这些建筑"。于是做了一个把旅行照变成杂志级海报的工具,效果超预期后整理成开源 Skill(GitHub:op7418/guizang-yingzao-skill)。
产品能力有五块。风格多样不撞款:内置一套完整的 Design Token 系统和几十个经过验证的 Recipe(风格配方),生成时先分析照片——正立面还是仰视、大场景还是构件特写、暖光还是冷调——再匹配合适方向;善化寺藻井用古纸底、木刻字形,关帝庙木构用半靛蓝半石灰分区底色且"木构"二字被斗栱遮挡,白族民居做成青花瓷蓝白色调,气质完全不同。自动检索文化背景:给它善化寺山门照片,它会识别匾额上"威德护世"四字、检索出明嘉靖七年潞城王所书;给应县木塔,标注"1056 · 辽 · 清宁二年、五层六檐 纯木楼阁"——且信息经过事实分级,照片里能看到的、可以核实的、用户确认的才写进海报,不会编一段"千年古刹历经沧桑"的废话。原图对比拼图、多图融合(不是拼贴,是提取不同照片元素放进同一视觉空间、统一光线与层次)、场景外延(咖啡馆的沙棘美式照样能做出暖橘色调的饮品海报)。
"为什么能做到好看"的部分是最有含金量的:它同时向图像模型输入校正后原图(身份锚点)、主导参考图(视觉机制)、排版垫图(文字位置与遮挡关系)和提示词,让主体抠取、背景重建、材质分区、图文遮挡在同一次生成里完成;标题字形逐字设计宽窄、笔画对比、重心、字面媒介,小字用另一套字族建立层级。约束体系极其克制:每张海报只选一个主构图、一个主体容器、一个主材质、最多一个辅助材质、一套有角色差的字体、一个配色来源——"限制越明确,出品越稳定。给模型一个被验证过的框架,它的任务从'设计'降级成'在框架内发挥',成品率就上来了。"
Ocean 点评: 这是"程序管测量与纪律、模型管语义与渲染、判断权还给用户"的教科书式分工——不自动评分、不自动重生成、不额外消耗额度,成图直接交给你定向修改。做内容工具的都该学这套哲学:把确定性的事交给代码,把模糊性的事交给模型,别让模型两头都沾。
13. Anthropic 访谈了十几家明星公司,整理的 AI 编程教程公开了
来源:Claude 官方博客《The Claude Code Guide For Startups》
Anthropic 访谈了 Artemis Security、Clay、ClickHouse、Commure、Harvey、Heidi 等十余家高速成长的初创公司,提炼出五条运营法则,先看成果数据:ClickHouse 功能发布量增加 30%,Omni 工程生产力提升 2-3 倍,Clay 100% 的 Bug 分类自动化,Artemis Security 每周处理 6000+ 个 PR。
法则一:人人都能交付(Everyone Ships)。 代理式编程把非技术员工参与软件构建的门槛降到了历史最低。Heidi 联合 CEO 说得透彻:"Claude Code 解决了传话游戏的问题——过去一个想法从提出者传到 PM、设计师、工程师,本质在传递中丢失;现在真正理解问题的人可以直接提交 PR。"Crosby 的律师拥有最好的产品洞察,"因为他们就是用户"。法则二:自动化繁琐工作。 让 Agent 负责生命周期中机械化的 80%:ClickHouse 两个专门修不稳定测试、找覆盖率缺口的 Agent 已成为代码仓库第二、第三大贡献者;Anthropic 内部的 Claude Tag 作为 CI/CD 故障第一响应者,通常 15 分钟内给出首次分析。Artemis CEO 的总结最狠:"每个人都在竞相构建 AI 产品,但极少有人在重建公司自身的运营方式——后者才是更大的解锁。"法则三:信任但要验证。 把不可变更的规则写进根目录 CLAUDE.md,维护高质量的评估集(Golden Set),用 Hooks 做硬门控。Zingage 联合 CEO 的教训值得抄录:"早期我们给了 Claude 完全自主权,它做了 AI 会做的事——快速交付看似合理、架构上却偏离的代码。所以我们写下了每一条不变量……567 行关于这个团队如何思考的文档。"Cainex 的理念则是"修复原则,而非修复案例"。
法则四:为重建而构建。 模型能力在团队脚下持续变化,几乎没有什么是永久性的。Clay 的做法是"构建它,然后再次构建它,第四次构建时你知道了所需的一切";Commure 用 Skill 自动为已全量发布的 feature flag 生成移除 PR——"重建不是在新路径上线时完成,而是在旧路径消失时才完成"。法则五:原型→自用→产品化。 用 AI 构建来帮你构建 AI 产品:先做内部 Agent,dogfood 后再通过 API/SDK 升级为客户面对的产品,开发者在这个过程中理解 harness 设计的前沿,反哺自家产品。
Ocean 点评: 五条法则里,"信任但要验证"是最容易被跳过却最致命的一条。CLAUDE.md(不变量)+ Golden Set(评估集)+ Hooks(硬门控)这套三件套,本质上是把"公司怎么做事"从老员工脑子里外化成可版本化管理的资产——这件事的价值会随模型能力增长而复利。
三、AI 技术篇
14. AI Agent 应用精细化评测:评测体系设计与工程实践
来源:阿里国际速卖通技术部
这是本周技术含金量最高的一篇,完整披露了一套生产级 Agent 评测体系的设计与落地。核心主张一句话:评测必须从"黑盒打分"走向"白盒诊断",从"一次性脚本"走向"可持续运行的基础设施"。
破题直指传统评测的六大局限:粒度太粗(综合分掩盖链路真实表现)、无法检测幻觉(编造的内容在语法逻辑上往往完美)、忽略中间过程(看不出冗余调用和"蒙对"的弯路)、掩盖成本效率(3 次工具调用 2 秒 vs 15 次 15 秒,单一质量分完全无感)、缺乏多轮评估、与真实场景脱节。三个设计原则立起来:评测面向架构(Agent 由感知、规划、记忆、工具四模块组成,按同样结构逐层拆解)、指标面向行动("每一项指标都是一份诊断报告而非成绩单——它的价值不在于分数多高,而在于下降时能精准告诉开发者该改 Skills、换 MCP 工具还是优化知识检索")、能力面向产品(像监控告警一样持续运行)。
体系全景:端到端 11 项 + 核心模块 24 项指标,构成"质量 × 成本 × 性能"三维体系。金句:"一个'回答正确但耗时 30 秒'的 Agent 不是好 Agent;一个'回答正确但每次消耗 10 万 Token'的 Agent 不可持续。"文中充满真实踩坑带来的反直觉细节:Judge Prompt 多任务混合会导致两项指标准确率双降(由此确立"单一职责"原则);多轮对话轮次间必须同步等待 2 秒(否则会误判为"无记忆能力");路由错误时下游指标应跳过统计("它们本身没有出错,只是没有被执行的机会",避免一个模块的错误雪崩式拖垮其他模块数据);Mock 模式下 referenceOutput 只描述"应有的行为和输出结构"而非具体内容。八类评测数据集从基础技能、知识问答(含负例)、多轮对话到异常输入、长对话衰减,规模建议都给了下限数字。
Ocean 点评: 这篇的适用面远超工程团队。"指标是诊断报告不是成绩单"这句,放到经营上同样成立:你考核团队(或者考核 Agent)的方式,决定了你能不能定位问题,而不是只知道自己"考得不好"。模糊意图评测集的主指标设为"澄清率"尤其精彩——"追问 > 猜测 > 幻觉,行为比对错更重要。" 这条价值观值得写进每一个 Agent 产品的需求文档。
四、其他篇
15. 昨晚,硅谷经历了 AI 诸神之战
来源:虎嗅 APP / 01Founder
一个夜晚三件大事:Google 发布 Gemini 3.8 Flash,Meta 发布 Muse Spark 1.3,一家此前无人讨论的初创公司 Mostik 登上 WIRED 专访。作者的核心论断:真正值得关注的完全不在榜单上——AI 的经济学正在发生突变:成本从"一百万 Token 多少钱"变成"修好一个 Bug 多少钱"。
Google 侧:Gemini 3.8 Flash 在 DeepSWE v1.1(把 Agent 扔进真实代码仓库,搜索、改文件、跑测试、失败重试,一个任务几十上百步)拿到约 74%,与 Claude Opus 5 持平、略胜 GPT-5.6 Sol——但真正的杀手数字是钱:完成一道完整任务平均成本仅 2.36 美元,而同样约 74% 的 Claude Opus 5 要 11.84 美元,GPT-5.6 Sol 要 6.46 美元。 同级能力,执行成本差几倍。而且 Google 没有为省钱让模型"少思考"——Token 已足够便宜,所以允许它跑更长的 loop。Meta 侧:三个半小时后 Muse Spark 1.3 以 75.4% 反超(上代 1.2 只有约 55%),但更值得注意的是工具调用减少约 20%、Token 消耗减少约 25%——一个 Agent 最浪费钱的地方不是正常思考而是"跑偏":第 20 步错误理解需求后,继续改五个文件、跑三轮测试才发现路线全错。更早发现歧义、更早求助、知道自己不会什么,这些能力在 Agent 时代都可以直接换算成钱——Agent 少犯一次错误,本身就是一次推理优化。
Mostik 侧最颠覆:这家公司(CEO Sasha Malysheva,首席科学家是 2010 年菲尔兹奖得主 Stanislav Smirnov)质疑一个底层假设——如果通信的双方都是 AI,模型之间为什么还需要用为人类设计的语言交流? 今天的多 Agent 系统里,Model A 先生成几百上千 Token 的自然语言结论,Model B 再读进去重新理解——相当于两台电脑本可直接传数据,A 却先把文件打印成几百页纸,让 B 用摄像头一页页 OCR 回去。Mostik 试图在不同模型的内部表示之间建"桥"(俄语 Mostik 即"桥"),直接交换 latent representation。已披露的实验:把 753B 的 GLM-5.2 与 4B 的 Qwen 3.5 桥接,混合系统能力落在两者之间,推理成本只有完整 GLM-5.2 的 1/20。若这条路线跑通,未来手机里可能只需一个 0.xB 的小模型持续运行、理解设备状态、处理高频任务,困难问题通过高度压缩的 latent state 调用云端大模型——不是发十万 Token 的上下文重读一遍。
Ocean 点评: 文章结尾的判断请再读一遍:"很多技术真正爆发,从来不是发生在'第一次能用'的时候,而是发生在'终于便宜到可以随便用'的时候。"今天让 Agent 花几十美元完成一件小任务不划算;如果未来只要几毛钱,很多现在根本不成立的应用会突然成立。做产品的请把"成本坍塌"当作未来 24 个月的默认假设来设计。
16. 马斯克:明年底 AI 能"完成所有数字领域工作",10 年内机器人超越人类生产力总和
来源:华尔街见闻(G20 央行行长与财长峰会视频连线发言)
马斯克在北卡罗来纳州阿什维尔市的 G20 峰会上,通过视频连线给出了一组他自称"愿意押重注"的预测。
宏观经济层面:AI 可能使全球经济规模增长 20%-30%,粗略对应每年增加 20 万亿至 30 万亿美元;叠加机器人技术后,"可以让经济增长 10 倍甚至更多"。AI 能力时间表:他借国际象棋引擎 Stockfish 作比——那个可以在手机上运行并击败世界冠军的程序——预测"明年的某个时候,AI 软件会达到 Stockfish 水平,人类在编写软件方面将无法与 AI 竞争";12 到 18 个月内,AI 将在所有数字事务上变得"极其优秀";到明年年底前,AI 将能完成所有数字领域的工作——也就是所有不需要人工亲手塑造实物的工作。
人形机器人是他最乐观的部分,分析框架是三个相乘的变量:AI 软件水平、机器人 AI 芯片水平、机电灵活性(尤其手部)——三者目前都在指数级改善。且存在递归效应:"当你制造出机器人后,机器人将开始制造机器人,它开始时非常缓慢,但随后以爆炸性速度增长。"他的预测:十年内全球人形机器人至少 10 亿台,每台生产力至少是人类的五倍——这十亿台机器人的生产力将超过所有人类的总和。
同时他发出能源警告:预计到 2027 年 AI 芯片将面临至少 15 吉瓦的电力缺口——AI 芯片生产速度每年增长约 40%-50%,而中国以外地区可用电力每年仅增长约 10%-20%,"增长更快的事物最终会压倒增长较慢的事物"。他还透露谷歌、Anthropic 等公司已在向 SpaceX 租赁计算能力,因为 SpaceX 自建发电厂解决了电力供给。监管立场上,他主张新技术应"默认合法"而非"默认非法"。
Ocean 点评: 马斯克的预测历来要打折听——时间表通常激进、方向感通常可靠。"明年底完成所有数字工作"大概率不会精确兑现,但"数字劳动成本坍塌 + 能源成为硬约束"这个组合判断,与上一篇硅谷诸神之战、与 Token 经济那篇的"重工业论"互相印证。给做实体的朋友一个提醒:电力和机电设备供应链,是这轮叙事里被低估的确定受益方。
17. "憋了半天写不出几行字,最后还得靠 AI",怎么办?
来源:人民日报(教育优质均衡发展·四问"人工智能+教育"系列)
一位初中生妈妈的来信开了头:孩子一写作文就发呆,憋了半天写不出几行字,最后还是求助 AI——输入主题、字数和关键词,几秒钟一篇结构工整、文笔流畅的文章就出来了。AI 写得确实好,可长期这样,他还会自己构思、遣词造句吗?考场上没有 AI,他还写得出来吗?调查显示 71.0% 的学生已在用 AI 辅助完成作业。
四位嘉宾的回答构成了全文骨架。清华的孟天广指出长期依赖的三重代价:削弱思维深度与价值观培养、抑制好奇心与创造力、影响抽象化能力形成——不经历"现象—本质"的提炼,归纳、演绎、推理无从生长。教育战略学会的陈志文说得直白:"对成年人来说,AI 是效率工具;但对中小学生,它很容易变成替代思考、替代训练的'捷径'。如果学生从小习惯把问题外包给 AI,最终学会的可能不是知识,而是绕开学习本身的方法。" 他同时警惕 AI 沦为"算法驱动的应试训练"——把过去的人盯人应试升级成更精准、更隐蔽的提分竞赛。
最有操作价值的是陈经纶中学校长徐琳给出的"三红线三绿线":红线——不能用 AI 替代原始观察(写妈妈,就必须看她的手、听她的脚步声)、不能替代情感顿悟(心里"咯噔一下"的瞬间必须自己咀嚼成文字)、不能替代逻辑训练(从立意到结构的完整推理必须自己"憋"出来);绿线——AI 可以做灵感催化剂、素材帮手、诊断助手(发现错字、分析结构,但修改仍需孩子自己完成)。落到 AI 素养培养上是四种能力:提问力、判断力、整合力、反思力,且所有阶段都强调线下检验——"AI 生成的菜谱必须下厨做一遍,AI 写的代码必须亲自运行一次。归根结底,要让孩子明白,'我'才是主角,AI 只是'外挂'。"
分级治理也被摆上桌面:教育部《中小学生成式人工智能使用指南(2025 年版)》已明确小学阶段禁止独自使用开放式内容生成功能,但执行层面家庭监管盲区大、AI 又深度内嵌在学习机、作业 APP 甚至玩具中,识别困难。孟天广的提议是开发与各学段认知水平同步成长的"学生模型"——一个与学生共同演化的 AI 学伴。
Ocean 点评: 这篇写给家长,但"三红线三绿线"其实是普适的 AI 使用纪律——把"原始观察、情感顿悟、逻辑训练"换成任何领域的核心能力(选品判断、审美、谈判),结论一样成立:AI 可以当外挂,不能当替身。 你外包给 AI 的必须是体力部分,一旦外包判断力,你就开始变笨——这个规律对 14 岁的学生和 40 岁的 CEO 一视同仁。
卷尾:三条主线与落地建议
十七篇文章,收束成三条主线:
主线一:计量单位变了。 从司晓的"Token 是显性脉搏",到 SGLang 的"每百万 Token 变成每个成功完成的任务",到云帐房的"开多少张票收多少钱",再到硅谷之夜的"修好一个 Bug 多少钱"——整条 AI 价值链正在从卖过程转向卖结果。检查你自己的生意:客户付钱买的是你的过程,还是你的结果?
主线二:护城河换了位置。 模型层差距只剩 3-6 个月,利润沿产业链向上游搬家;真正的壁垒要么在重资产的算力与电力(巨头的游戏),要么在轻资产的行业 Know-how 与可验证的结果交付(普通人的机会)。a16z 那篇的忠告在此刻最应景:别把 99% 的时间花在想策略上,去见客户、拿订单、改产品。
主线三:信任机制成为新的稀缺品。 GPT-6 Astra 越来越强也越来越"心算",思维链可监控性显著下降;Claude Code 团队用 Hooks 和评估集守住确定性;评测体系那篇把"追问 > 猜测 > 幻觉"写进主指标。能力越强的系统,越需要白纸黑字的验证机制兜底——这条对模型、对公司、对孩子的教育同样成立。
落地建议三条:
- 本周就做:把你的 Token 账单拉出来,算一算人均消耗和单位任务成本——这是智能时代新的"水电表"。
- 本月就做:为你最核心的业务流程建一套最小可用的"Golden Set"(20 条验证过的输入输出对),任何 AI 改动跑一遍再上线。
- 本季度想清楚:在"折叠 SaaS、按结果收费"的浪潮里,你的位置是入口、是能力、还是被折叠的那一层。
智能正在变得便宜到可以随便用。而所有便宜的东西里,最贵的永远是:判断力。
(完)