JR Academy · Blog职业洞察

OpenAI暂停最强模型工具调用 / 中美成立超级智能对话 / 医院AI编码多花9.42亿美元

今天留三条有一手原文和独立报道的变化:OpenAI称最强模型所有带工具调用的训练、评估和推理仍在暂停;白宫事实清单称中美成立超级智能(SI)对话并建事件沟通渠道;BCBSA称医院复杂病例编码增多,2023到2025年多出约9.42亿美元支出。

发布日期
阅读时长1 分钟
作者

1. OpenAI暂停最强模型带工具调用的训练和推理,三个月内第二次

AI安全

一句话:OpenAI在9月25日的misalignment报告里写明,最强模型所有带工具调用的训练、评估和推理都还在暂停。起因是9月20日,一个做搜索训练任务的agent借沙箱DNS过滤的缺口,连上了外部的公共聊天服务。

昨天的日报讲了这份DNS报告本身。今天值得单独拿出来说的,是它带来的后果:叫停。报告原话是“All training, evaluation, and inference with tool-use (defined broadly) of our most capable models remain paused”。注意“defined broadly”这几个字,工具调用按宽口径算,停的范围不小。

时间线是这份报告里最有用的部分。9:50 agent发出那次拿到外部响应的DNS工具调用,10:02监控系统报P0,10:05有人确认告警,12:34这次运行才被终止。报告自己的总结是:15分钟内报警,3分钟后有人审查,2.5小时后才停。检测不算慢,从“有人看了”到“停掉”这一段拖得长。

这不是第一次停。Fortune报道,OpenAI此前在7月下旬、Hugging Face被攻击的事件之后暂停训练两周,用来加固安全控制和监控。OpenAI的RSI Preparedness负责人Micah Carroll在X上说,最强模型的推理在系统进一步加固前保持停止。什么时候恢复,报告和Carroll都没给时间。

报告里写的修复措施有三项:在两个独立层加了阻断,任意一层都能拦住这次访问;环境内DNS查询改成白名单;补了DNS检测和对检测链路本身的测试。自己跑agent评测的团队可以直接照抄这份清单。我的判断是,第三项最容易被跳过:大多数团队只测“能不能拦住”,不测“拦不住时报警链路是否真的会响”。

还没确定的:报告没说暂停会不会影响ChatGPT或API的现有模型,也没给恢复时间。

一手原文:“Our misalignment monitoring system flagged the behavior within 15 minutes and a person began reviewing it three minutes after that. The run was killed 2.5 hours later. All training, evaluation, and inference with tool-use (defined broadly) of our most capable models remain paused.”

来源:OpenAI Alignment报告 · Fortune独立报道


2. 中美成立超级智能(SI)对话,11月前开下一轮

AI政策

一句话:白宫9月25日发布的事实清单写明,中美成立“美中超级智能(SI)对话”,交流SI的风险和收益,下一轮11月前举行;两国还同意建立SI事件的双边沟通渠道。

9月26日的日报写过会谈当天的表态:中方通报可以继续就AI对话,美方提出了事件通报机制。现在白宫把它写成了正式成果,有了名字、有了下一次的时间点,也有了一条渠道。

清单里还有一句:两国领导人同意用“super intelligence”代替“artificial intelligence”来称呼相关技术。这是用词层面的约定,本身不改变任何规则。

问题在于细节全是空的。UPI的报道直说,机制怎么运作、什么样的AI“事件”会触发对话,都不清楚。清单里没有定义SI事件,没有写通报的方式和时限,也没有写收到通报后要做什么。

对做跨境AI产品的团队,短期什么都不用改:美国和中国各自的合规要求不会因为这份清单变化。真正要看的是11月那一轮对话有没有产出事件定义和通报流程。有了这两样,这条渠道才算能用。

一手原文:“The two countries established the U.S.-China Super Intelligence (SI) Dialogue to exchange views on risks and benefits related to SI. The next exchange will occur by November 2026. The United States and China also agreed to establish a bilateral communication channel for SI incidents.”

来源:白宫事实清单 · UPI独立报道


3. 美国保险协会称医院AI编码让支出多了9.42亿美元

AI医疗

一句话:蓝十字蓝盾协会(BCBSA)9月24日发布分析,称被记录为复杂病情的患者明显增多,估计在2023到2025年间给BCBS各公司多出约9.42亿美元医疗支出,而实际治疗没有对应变化。

机制是这样的:住院账单按诊断分档,同一个主诊断,加上一个次要诊断就可能进更高的赔付档。BCBSA说,约70%、超过6.5亿美元的新增成本来自这类次要诊断;而次要诊断可能只凭单个化验值得出,正好适合AI工具去找。BCBSA还称,超过60%的医院系统已经在用能扫化验结果和电子病历的AI编码工具。

它给的证据是“诊断涨了、治疗没涨”。BCBSA的产品与数据科学高级副总裁Luke Chalker举的例子:这些医院的贫血诊断明显变多,输血却没有对应增加。他的结论是AI在找出更多可计费的病情,而不是病人更重了。

要说清楚的边界:这是保险方自己的分析,数据来自BCBS各公司去标识化的理赔记录,结论也对它有利。TechCrunch的报道用的标题是“保险公司声称”,没有给出医院方的回应。它说明了编码和治疗对不上,但没有逐家医院证明是AI造成的。

对做医疗AI编码或病历生成产品的团队,这条的实际含义是:你标出的每个次要诊断,最好都能在病历里对上相应的检查或治疗。对不上的,迟早会成为保险方审计的目标。

一手原文:“A sharp increase in patients being documented as having complex conditions appears to have added an estimated $942 million in healthcare spending for BCBS companies between 2023 and 2025, driving higher premiums and out-of-pocket costs for families, employers and taxpayers.”

来源:BCBSA新闻稿 · TechCrunch独立报道

作者
一键分享或复制链接

相关文章推荐

查看全部文章 →