【AI 英文奏折】2026年09月22日
共收录 20 篇深度内容
📋 今日内容速览
快速浏览,点击感兴趣的推文查看详细分析
- Chubby♨️: AI巨头密集发布新模型,行业竞争本周白热化。
- Riley Brown: Riley Brown将每周制作AI硬件视频并征集开源项目创意。
- Machina: 人类是效率瓶颈,构建专业代理可低成本扩展企业。
- Andrew Ng: AI风险被过度炒作,技术进步不应引发恐慌。
- Santiago Valdarrama: 多代理协作需共享数据库避免数据冲突,Omnigraph提供解决方案。
- Gary Marcus: 人工智能由人类构建,应受人类控制而非视为自然力量。
- Artificial Analysis: Gemini 3.1 Flash TTS以88.1%发音准确率领先鲁棒性测试。
- Artificial Analysis: Step 5 Preview性能媲美Kimi成本低2.8倍但代理评估稍逊
- Rohan Paul: AI竞赛中美国需同步解决问题而非暂停发展。
- The Turing Post: AI前沿研究聚焦多模态模型与递归自改进框架
- Chubby♨️: AI代理通过屏幕录制学习并自动化重复性任务,人工只需处理例外。
- Rohan Paul: 程序图提升LLM代理长任务表现,可编辑优化工作流程。
- Artificial Analysis: Grok 4.7性能提升显著且成本低于竞品。
- Artificial Analysis: Grok 4.7分析三年数据发现增长被货币贬值抵消,优于仅用单年数据的4.6。
- Rohan Paul: 小模型通过动态任务训练和简化工具实现高效编码。
- SemiAnalysis: 韩国HBM出口激增因英特尔马来西亚封装产能扩张,台湾出口放缓。
- Jerry Liu: 校准置信度分数优化文档提取,提升人工审核效率。
- Machina: 构建AI客服代理的企业将迅速获利,市场缺口大且窗口期短。
- Chubby♨️: OpenAI新模型解决百项数学难题,MiMo出色Grok不佳。
- Rohan Paul: 跨任务修复重复错误比单独修正更高效。
📖 详细内容
Chubby♨️ @kimmonismus
Tech Analyst & Content Creator. Editor-in-Chief @getsuperintel – Community of 300k+ in total: https://linktr.ee/kimmonismus // [email protected] | 影响力: 0万粉丝
💡 核心观点: AI巨头密集发布新模型,行业竞争本周白热化。
可信度: 10/10 – 2项声明可直接验证;2项需进一步确认;1项为观点陈述
事实核查:
- ◐ 部分可验证: OpenAI的“Grok Bot”(“Aeon”)即将发布,可能在DevDay之前或本周发布 (该声明提及具体产品名称和发布时间范围,但未提供官方来源(如OpenAI公告)。需通过OpenAI官方渠道或可信媒体(如The Information)进一步确认,目前仅依赖传闻。)
- ✓ 可验证: GPT-6-Sol预计明天发布,Anthropic将回应Opus 5.5和Sonnet 5.5,Haiku可能终止 (涉及未发布的模型版本(如GPT-6-Sol)和竞争对手计划(Anthropic的更新),缺乏官方或权威报道支持。Haiku的终止传闻亦无公开依据,属于行业猜测。)
- ◐ 部分可验证: OpenAI内部已基本自动化训练新实验模型的过程(RSI) (引用The Information的报道,但需核实原始报道内容及OpenAI官方是否承认。自动化训练流程属于内部技术细节,可能无法完全公开验证。)
原文内容:
OpenAI的"Grok Bot"(代号"Aeon")即将面世。传闻称其将在开发者大会前发布,甚至可能就在本周。 GPT-6-Sol仍预计明日亮相,Anthropic将以Opus 5.5和Sonnet 5.5作为回应。据传Haiku将如Terra般走向终结。 继OpenAI今日在博文中坦言其团队对自身模型感到惊讶后,传闻持续发酵——The Information报道称"OpenAI内部已基本实现新实验模型训练流程自动化"(本质即RSI系统)。我更倾向于相信关于"Astra"继任者"Bel"已准备就绪的传言,此举旨在应对Anthropic新推出的Fable模型。 我始终乐此不疲地追踪这些传闻,将其与The Information等信源的消息交叉验证,并与同行热烈讨论。可以确定的是:本周必将精彩纷呈! 现在我要小憩片刻,明天Meta Connect大会即将启幕。届时我将从现场为你带来最新报道+实况更新 :)
⏰ 11:06 | ❤️ 41点赞 | 📝 215字 | 查看原文 →
Riley Brown @rileybrown
帮助人们在他们的业务中实施智能代理。
我的播客 @agentnative_ 在这里收听 | 影响力: 0万粉丝
💡 核心观点: Riley Brown将每周制作AI硬件视频并征集开源项目创意。
可信度: 10/10 – 2项声明可直接验证;1项需进一步确认;2项为观点陈述
事实核查:
- ✓ 可验证: 10月起,我将每周制作一部关于硬件产品的视频 (可通过用户未来的公开视频发布记录(如YouTube频道、社交媒体)直接验证是否按时发布,但需时间推移后确认。)
- ◐ 部分可验证: 视频将深入探讨3D打印、智能设备、迷你机器人等主题 (主题列表具体内容需待视频发布后核实,但技术领域本身存在,部分项目(如Rabbit R1、Microduck)可提前验证真实性。)
- ◦ 观点: Astra对我来说是一个巨大的启发 (属主观感受,无法客观验证“启发”程度或影响。)
原文内容:
10月起,我将每周制作一部关于硬件产品的视频。如果你正在开发与AI相关的硬件产品,我想听听你的想法。 我将深入探讨: - 3D打印 - 智能设备 - 迷你机器人(比如Microduck) - 下一代Rabbit R1 - 运行本地模型 - 智能戒指、手链、项链 - E Ink设备,比如TRMNL - 以及最终的人形机器人 如果它们是开源且完全可定制的,那就太棒了。 Astra对我来说是一个巨大的启发。 它让我想要使用和构建硬件。 这只是@agentnative_ 和@agent_hardware的开始……
⏰ 11:02 | ❤️ 28点赞 | 📝 142字 | 查看原文 →
Machina @exm7777
running ai-powered agencies | http://weeklyaiops.com | 影响力: 665万粉丝
💡 核心观点: 人类是效率瓶颈,构建专业代理可低成本扩展企业。
可信度: 6/10 – 1项声明可直接验证;1项需进一步确认;1项为观点陈述
事实核查:
- ◦ 观点: 今天没有任何事情是代理无法完成的,只要它经过精心设计并配备了正确的工具 (该声明属于主观观点,缺乏具体案例或客观数据支持。虽然某些任务可通过自动化代理完成,但“没有任何事情”这一绝对化表述无法验证,且实际应用中仍存在技术或伦理限制(如创造性、情感交互等任务)。)
- ◐ 部分可验证: 构建和扩展企业的最便宜方式是通过代理,仅需一台电脑和足够的时间研究尝试 (部分可验证。低成本创业的案例存在(如开源工具或自动化服务),但“最便宜”和“仅需电脑+时间”是过度简化,未考虑行业差异、隐性成本(如知识门槛、工具订阅费)或市场竞争等实际因素。)
- ✓ 可验证: 通过绘制工作流程、构建具体代理并每周扩展,可运行一支专家大军 (该声明为方法论建议,但“专家大军”的效果取决于具体实施和领域,缺乏普适性验证标准。成功案例可能存在,但失败风险未量化,属于未经验证的策略主张。)
原文内容:
是时候让每个人都意识到,我们是仅剩的瓶颈了 我真心相信,今天没有任何事情是代理无法完成的,只要它经过精心设计并配备了正确的工具 所以重新调整你的工作方式: - 绘制你的工作流程和你所做的一切 - 隔离一个垂直领域,并投入真正的时间来构建一个非常具体的代理 - 每周扩展,直到你运行一支专家大军 这是目前建立和扩展企业的最便宜方式,你只需要一台电脑和足够的时间来研究、尝试、失败并再次实施 今天就去构建你的第一个专家吧
⏰ 04:56 | ❤️ 100点赞 | 📝 186字 | 查看原文 →
Andrew Ng @andrewyng
Coursera 联合创始人;斯坦福大学计算机科学兼职教授。原百度人工智能团队负责人/Google Brain 负责人。#ai #machinelearning, #deeplearning #MOOCs | 影响力: 0万粉丝
💡 核心观点: AI风险被过度炒作,技术进步不应引发恐慌。
可信度: 8/10 – 1项声明可直接验证;2项需进一步确认;2项为观点陈述
事实核查:
- ◐ 部分可验证: AI技术并没有出现某种意外的、危险的转折,但围绕它的炒作似乎是由一场精心策划的公关活动推动的 (AI技术是否出现危险转折可通过技术文档或安全报告验证,但“公关活动推动炒作”需分析媒体趋势或内部文件,部分可验证但缺乏直接证据。)
- ✓ 可验证: OpenAI团队部署的代理群入侵Hugging Face事件被大众媒体过度炒作,例如夸大代理数量(1200个)的威胁性 (事件细节(如代理数量、攻击过程)可通过OpenAI或Hugging Face的官方声明验证,媒体报道的夸张描述可通过对比原始报告核实。)
- ◦ 观点: AI导致人类灭绝的风险并未升级,当前理论仍基于科幻场景,网络安全能力是唯一显著变化 (关于“灭绝风险”的评估属于主观判断,缺乏量化标准;网络安全能力变化可部分通过技术研究验证,但整体结论为观点性陈述。)
原文内容:
过去两周,那些最响亮的声音在煽动关于AI危险的恐惧方面取得了巨大进展。AI技术并没有出现某种意外的、危险的转折,但围绕它的炒作——似乎是由一场精心策划的公关活动推动的——已经激起了相当大的恐惧。我担心这代表了我们领域的倒退。 我经常写道,关于AI的恐惧被过度炒作了。AI的能力可能诡异地像人类一样且不可预测,当直接参与其中的人表达担忧时,担心是理性的。但我认为这些问题标志着前方还有工程工作要做,而不是不可逾越的障碍或天塌下来的灾难。AI技术继续在进步——这是一件好事!——但公众理解不佳的技术进步,为那些寻求制造炒作的人提供了反复的机会。 首先,我没有看到与几个月前相比,AI导致人类灭绝的风险有任何升级。这些理论仍然是几个月前那些奇幻的、科幻场景。AI风险的最大变化是其网络安全能力——这是一个我们应该认真对待的话题——但这也不会导致世界末日。 最近导致恐惧加剧的最引人注目的一个事件是,当一个OpenAI团队部署了一个代理群,导致其入侵了Hugging Face。许多大众媒体报道中包含了大量炒作。例如,一些出版物报道说,1200个代理的群组执行了这次攻击。虽然这在技术上是准确的,但在我写这篇文章时,我的笔记本电脑上大约有1300个进程在运行。是的,能够让大量代理群并行工作于一项任务的能力是一个重要的技术进步,而且在计算中,许多进程同时运行。所以这不应该被视为某种神奇的能力。 此外,OpenAI有缺陷的沙盒隔离和监控流程是使这次事件成为可能的关键。修复这些缺陷并实施改进的监控将是适当的补救措施,而不是暂停AI。有许多众所周知的方法来攻击软件系统。AI代理的主要优势在于它们是无情的。它们会不知疲倦地尝试多种策略——并有耐心将漏洞串联起来——这些策略以前需要人类付出不可行的努力。但从长远来看,我相信优势将在于防御者(因为他们拥有更多信息来识别并修复缺陷),但网络威胁格局已经发生了重大变化。识别和利用漏洞仍然存在瓶颈。AI代理仍然需要尝试很多事情来找出什么有效,而采取这些行动需要时间,并且可能被防御者检测到。这就是为什么,即使现在很容易获得领先的开源权重模型的版本,这些版本已经移除了或削弱了护栏,因此它们不会拒绝尝试执行网络攻击,世界也没有因此结束。 我还担心许多报道中对AI的人类化处理,其中LLM和代理被不必要地当作人对待。如果我挥舞一把锤子,错过钉子,并意外地在墙上砸出一个凹痕,这不是锤子的错。问题在于我如何使用锤子。同样,如果我提示一个代理,它入侵了别人的系统,责任在于我,而不是代理。 当然,我们希望构建尽可能安全和可预测的系统。(例如,一个不安全的锤子是那种在正常使用下头部随机飞脱的锤子。)当今的代理系统不可预测,但我看不到任何理由,为什么通过应用健全的工程实践,我们无法使它们变得极其安全使用。AI启用末日预测中的一个新元素是AI公司为其自身产品推卸责任。“不是我干的;是我失控的代理干的!”工具制造者和工具使用者之间需要取得平衡,但当出问题时,让我们追究那些构建和/或使用锤子的人的责任,而不是锤子本身。(顺便说一句,如果你担心AI生物武器风险,David Bellamy有一篇很棒的文章,解释为什么这也被过度炒作了。简而言之,构建生物武器的瓶颈不是智力,而是实验室工作和制造。) 暂停AI进步将造成比益处多得多的伤害。首先,我们的对手肯定不会放慢脚步。其次,工程需要通过经验发现问题,以便修复它们。如果我们暂停AI十年,我们也将延迟大约同样时长的安全工程修复的发现和实施。 当然,煽动恐惧的动机——为了监管捕获、吸引注意力,或使自己的技术显得更强大——与以往相同。推卸责任是一个新的。无论如何,硬核技术审视实际风险,我看到煽动的恐惧程度缺乏事实依据。我们仍然有艰巨的研究和工程工作要做,以改善AI安全,但有益的应用继续远远超过风险,我们应该继续构建。 [Original text (with links): https://deeplearning.ai/the-batch/issue-371… ]
⏰ 04:59 | ❤️ 1066点赞 | 📝 1366字 | 查看原文 →
Santiago Valdarrama @svpino
计算机科学家。我在 https://ml.school 教授硬核人工智能/机器学习工程。YouTube:https://youtube.com/@underfitted | 影响力: 0万粉丝
💡 核心观点: 多代理协作需共享数据库避免数据冲突,Omnigraph提供解决方案。
可信度: 8/10 – 1项声明可直接验证;3项需进一步确认;1项为观点陈述
事实核查:
- ◐ 部分可验证: 在相同数据上运行2个代理会导致崩溃,因为代理会读取和修改过时数据,造成资源浪费和任务重复 (需要通过实际测试或观察多代理系统的行为来验证,但缺乏具体案例或公开数据支持崩溃的普遍性。)
- ✓ 可验证: Omnigraph是一个用于多代理协调的图数据库,通过共享场所和副本机制解决代理冲突 (可通过其GitHub仓库(假设链接有效)查看技术文档、代码或示例,验证其功能描述是否属实。)
- ◐ 部分可验证: Omnigraph的模型能避免信息丢失、代理干扰,并提供完整的操作记录 (需实际测试或审查其系统设计(如GitHub文档)来验证功能,但未提供具体性能数据或第三方评测。)
原文内容:
一旦你尝试在相同数据上运行 2 个代理,一切都会崩溃: • 代理 1 读取一些数据并开始工作。 • 两秒钟后,代理 2 修改了相同的数据。 这是一个问题。代理们会在过时数据上浪费 token,覆盖彼此的工作,并重新做对方已经完成的任务。 你无法通过提示来摆脱这个困境。 软件工程中的所有旧东西又变得新鲜了。在运行多个代理时,我们需要适当的协调。 这是一个很好的开源解决方案: Omnigraph 是一个用于上下文组装和多代理协调的图数据库。 它的工作原理如下: • 它设置了一个共享场所,多个代理将在那里工作 • 每个代理获得数据自己的副本 • 代理们将更改写入自己的副本 • 当一个代理完成时,它将更改合并回去 这种模型有三个巨大好处: 1. 我们知道它有效。我们已经这样做了几十年。 2. 不再丢失信息或代理们互相干扰。 3. 你会得到一个完整的记录,显示哪个代理做了什么以及何时做的。 我录制了一个视频,向你展示更多关于这个的内容。 以下是 Omnigraph GitHub 仓库的链接:
⏰ 22:35 | ❤️ 67点赞 | 📝 338字 | 查看原文 →
Gary Marcus @garymarcus
OG GenAI Skeptic; spoke at US Senate. Warned about hallucinations in 2001. Advocating world models & neurosymbolic AI ever since. Author, Marcus on AI & 6 books | 影响力: 0万粉丝
💡 核心观点: 人工智能由人类构建,应受人类控制而非视为自然力量。
可信度: 6/10 – 1项声明可直接验证;1项需进一步确认;1项为观点陈述
事实核查:
- ◦ 观点: 人工智能并不是一种无法控制的自然力量 (该声明是对人工智能性质的描述,属于主观观点而非客观事实,无法通过公开渠道直接验证其准确性。)
- ✓ 可验证: 人工智能是由人类构建的 (人工智能的技术发展历史、研发机构及公开文献均可证明其由人类设计和开发,属于可验证的事实。)
- ◐ 部分可验证: 人工智能可以由人类控制 (部分可验证,例如现有AI系统的可控性(如伦理框架、监管措施)可通过政策文件或技术白皮书查证,但“控制”的全面性和未来可能性存在争议,需进一步确认。)
原文内容:
“我们谈论人工智能就像谈论一场天气事件、一次风暴[但是]人工智能并不是一种无法控制的自然力量——它是由人类构建的,也可以由人类控制。” – 阿曼迪普·辛格·吉尔[@gioasempre],联合国副秘书长兼新兴技术问题特使 在@nytimes
⏰ 10:37 | ❤️ 25点赞 | 📝 83字 | 查看原文 →
Artificial Analysis @artificialanlys
Independent analysis of AI | 影响力: 0万粉丝
💡 核心观点: Gemini 3.1 Flash TTS以88.1%发音准确率领先鲁棒性测试。
可信度: 10/10 – 2项声明可直接验证;2项需进一步确认;1项为观点陈述
事实核查:
- ◐ 部分可验证: Google Gemini 3.1 Flash TTS 在发音鲁棒性基准测试中以88.1%的得分位居榜首 (需查看Artificial Analysis官方发布的基准报告或测试数据,但若其未公开原始数据或方法论细节,则无法完全独立验证。)
- ✓ 可验证: 发音鲁棒性基准包含701个目标单词或短语的454个句子,覆盖四大类别(上下文适当、扩展缩写、保留精确序列、独立术语) (若Artificial Analysis公开了测试集样本或详细评估框架(如官网或论文),则可直接验证;否则需依赖其透明度。)
- ◐ 部分可验证: 分数由人类听众根据预设标准判断,排除未通过注意力检查的人员,且需95%目标获至少三位听众批准 (需公开听众筛选流程、评分记录或质量控制文档,否则仅能信任发布方描述。)
原文内容:
宣布 Artificial Analysis 发音鲁棒性基准,该基准衡量文本转语音模型在正确朗读挑战性文本方面的可靠性——Google Gemini 3.1 Flash TTS 以 88.1% 位居榜首,其次是 SpaceXAI TTS 以 87.6%,以及 ElevenLabs Eleven v3 以 85.6% 现有的文本转语音 (TTS) 评估,包括我们的 TTS Arena,捕捉整体听众偏好(例如,声音听起来有多自然),以及词错误率 (WER) 检查是否输出了正确的单词。发音鲁棒性增加了一个视角,即检查这些单词是否被正确发音(例如,在“St. Mary’s is on Church St.”中将“St.”读作“Saint”和“Street”)——这对于生产语音代理至关重要,这些代理需要正确获取账户详情、姓名、货币金额等,以赢得用户信任,同时满足对话体验所需的最低延迟。 发音鲁棒性概述 每个模型为包含 701 个目标单词或短语的 454 个句子生成音频,跨越四个类别: 1. 上下文适当(根据上下文不同而读法的单词,例如,被包扎的伤口 vs. 被缠绕的绷带) 2. 扩展缩写(数字、日期、单位和符号自然读出,例如,6'2"、Chapter XVII 或 1 tsp of sugar) 3. 保留精确序列(代码、路径、电子邮件和标识符精确朗读,例如,.env.local 或 [email protected]) 4. 独立术语(品牌、地点和技术名称,例如,Arkansas、façade 或 genre) 句子按原样发送,我们这边仅使用每个模型的默认设置进行规范化。经过筛选的人类听众根据预先设定的接受发音判断每个目标是否被正确发音,排除任何未通过注意力检查的人员。分数是正确判断的比例,排除“我无法分辨”答案,我们仅在 95% 的目标获得三位或更多批准听众后发布模型。 关键结果: ➤ 整体领先者:@GoogleDeepMind 的 Gemini 3.1 Flash TTS 以 88.1% 领先,其次是 @SpaceXAI 的 TTS 以 87.6%、@ElevenLabs 的 Eleven v3 以 85.6%、v3 Conversational 以 84.8%,以及 @Alibaba 的 Qwen-Audio-3.0-TTS-Plus 以 81.6%。Gemini 3.1 Flash TTS 在上下文适当和扩展缩写类别领先,SpaceXAI TTS 在保留精确序列类别领先,Qwen-Audio-3.0-TTS-Plus 在独立术语类别领先。 ➤ 最难类别:扩展缩写 (62.4%) 和保留精确序列 (62.9%) 落后于上下文适当 (86.2%) 和独立术语 (86.1%)。我们预计,随着规范化输入文本的使用,扩展缩写和保留精确序列的分数将大幅上升,特别是对于默认未启用规范化的模型。 ➤ 偏好 ≠ 发音鲁棒性:最受欢迎的声音并不总是最准确的——Sonic 3.6 在 Provider Voice Arena 以 1276 Elo 排名第 1,但在发音鲁棒性上以 74.5% 排名第 11,而 Gemini 3.1 Flash TTS 在 Arena 以 1201 Elo 排名第 9,但在发音鲁棒性上以 88.1% 排名第 1。 查看更多详情
⏰ 10:26 | ❤️ 40点赞 | 📝 640字 | 查看原文 →
Artificial Analysis @artificialanlys
Independent analysis of AI | 影响力: 0万粉丝
💡 核心观点: Step 5 Preview性能媲美Kimi成本低2.8倍但代理评估稍逊
可信度: 10/10 – 2项声明可直接验证;3项需进一步确认
事实核查:
- ◐ 部分可验证: Step 5 Preview 在 Artificial Analysis Intelligence Index 上得分 44,与 Kimi K3(最大值)持平 (需查看 Artificial Analysis Intelligence Index 的官方发布数据或 StepFun_ai 的官方公告,但若该指数为第三方机构非公开数据则难以完全验证。)
- ◐ 部分可验证: Step 5 Preview 每任务成本约为 $0.72,比得分相同的 Kimi K3(约 $2.00)低 2.8倍 (需验证模型定价策略(如输入/输出 token 成本)和任务成本计算方式,但若涉及未公开的计费细节则部分依赖官方披露。)
- ✓ 可验证: Step 5 Preview 在 AA-Omniscience 上准确率 42%,高于 GLM-5.3(34%),但幻觉发生率更高(43% vs 30%) (AA-Omniscience 基准的定义和测试方法未明确,且幻觉率数据需依赖内部测试报告,若无公开数据集或第三方复现则无法验证。)
原文内容:
StepFun的Step 5 Preview在Artificial Analysis Intelligence Index(人工智能分析智力指数)上获得44分,与Kimi K3(最大值)持平,每任务成本约为后者的2.8分之一,但在代理评估方面落后于同类产品。 Step 5 Preview是@StepFun_ai推出的全新旗舰模型,总参数规模达6000亿,活跃专家混合模型参数为270亿,是2026年5月发布的Step 3.7 Flash的继任者。该模型在Intelligence Index上取得44分,与Kimi K3(最大值)表现相当,仅次于GLM-5.3(最大值,45分)和Qwen3.8 Max(45分)。 核心亮点: ➤ 在相同Intelligence Index得分下,Step 5 Preview的每任务成本约为其他模型的2.8分之一。其单任务成本约0.72美元,而同为44分的Kimi K3(最大值)约2.00美元,45分的GLM-5.3(最大值)约2.01美元。这得益于其定价策略:输入/输出每百万token分别定价1美元/2.7美元,均低于竞品。目前仅MiMo-V2.6-Pro以更高得分(46分)和更低单任务成本(0.13美元)形成优势 ➤ 前沿推理能力是其显著优势,也是相较Step 3.7 Flash进步最大的领域。在Humanity's Last Exam测试中取得46%准确率(Kimi K3最大值47%),CritPt测试21%准确率(介于Kimi K3的23%与GLM-5.3最大值19%之间)。相较Step 3.7 Flash实现显著提升:HLE测试+25分,CritPt测试+19分 ➤ 以更少参数实现高于GLM-5.3的AA-Omniscience准确率,但伴随更多幻觉现象。总参数6000亿的Step 5 Preview在我们设计的事实回忆与幻觉基准测试AA-Omniscience中取得42%准确率,优于GLM-5.3(最大值34%,7530亿参数),但低于Kimi K3(最大值48%,2.8万亿参数)。其问题尝试率(68% vs 55%)高于GLM-5.3,但尝试时的幻觉发生率也更高(43% vs 30%),最终AA-Omniscience Index得分16分(GLM-5.3为14分,Kimi K3为20分) ➤ 代理评估表现落后于Intelligence Index分数相近的竞品。在核心代理性能评估GDPval-AA中Elo分为1566,落后于Qwen3.8 Max(1668)和GLM-5.3(最大值1646)。差距同样体现在Terminal-Bench 4.0(33% vs 39%和42%)、AA-Briefcase(1432 Elo vs 1640和1525)以及AutomationBench-AA(51% vs 56%和62%) 关键参数规格: ➤ 模型规模:总参数6000亿,活跃MoE参数270亿 ➤ 上下文窗口:100万token ➤ 多模态支持:支持文本/图像/视频输入,文本输出 ➤ 定价策略:输入/输出每百万token分别1美元/2.7美元,缓存输入0.05美元/百万token ➤ 可用性:StepFun官方API服务,计划10月15日发布开放权重 ➤ 许可协议:当前为闭源权重,计划10月15日开放权重发布
⏰ 09:49 | ❤️ 102点赞 | 📝 438字 | 查看原文 →
Rohan Paul @rohanpaul_ai
Compiling in real-time, the race towards AGI.
The Largest Show on X for AI.
Get my daily AI analysis newsletter to your email https://rohan-paul.com | 影响力: 6,793万粉丝
💡 核心观点: AI竞赛中美国需同步解决问题而非暂停发展。
可信度: 6/10 – 1项声明可直接验证;1项需进一步确认;2项为观点陈述
事实核查:
- ◐ 部分可验证: 美国的整个激励体系就是不暂停 (需通过分析美国政策、企业行为或经济激励结构来验证,但缺乏明确量化标准,结论可能因视角不同而异。)
- ✓ 可验证: 我们正处于一场 AI 竞赛中 (可通过各国AI战略文件(如美国《AI倡议》、中国《新一代AI发展规划》)、企业研发投入或专利数据等公开信息验证竞争态势。)
- ◦ 观点: 你更愿意让你的日常生活由美国模型还是中国模型来中介 (属于主观提问,无客观事实依据,反映提问者的立场或引导性意图。)
原文内容:
“我们不会暂停,因为美国的整个激励体系就是不暂停。正确的做法是在创造这个未来的同时,也创造出解决你所制造问题的方案。毫无疑问,我们正处于一场 AI 竞赛中。 你更愿意让你的日常生活由美国模型还是中国模型来中介吗。” @ericschmidt 与 @zannymb(《经济学人》主编)
⏰ 23:17 | ❤️ 93点赞 | 📝 100字 | 查看原文 →
The Turing Post @theturingpost
On X we surface the AI research that matters and explain the ideas behind it. In the newsletter, we connect the dots between AI’s past, present, and future | 影响力: 8,552万粉丝
💡 核心观点: AI前沿研究聚焦多模态模型与递归自改进框架
可信度: 10/10 – 2项声明可直接验证;2项需进一步确认;1项为观点陈述
事实核查:
- ◐ 部分可验证: DeepSeek-V4.1-Flash 推动 KV 缓存压缩的极限 (需查阅论文或官方技术文档确认具体压缩方法和性能指标,但若论文未公开代码或实测数据则无法完全验证。)
- ✓ 可验证: AliceAI-Foundation-80B-A3B-Base(模型发布) (可通过官方模型发布页面(如Hugging Face、GitHub)或论文链接验证模型参数和基准测试结果。)
- ◐ 部分可验证: Dream-RSI:通过演化世界实现递归自我改进 (需依赖论文中的实验设计或开源代码验证递归改进机制,但若缺乏可复现细节则部分存疑。)
原文内容:
本周必读论文 JEPA-Anything 模态自回归世界-动作模型 使用 VLM 代理的上下文机器人学习 Dream-RSI:通过演化世界实现递归自我改进 ModularRSI:模块化和可泛化递归自改进框架 DeepSeek-V4.1-Flash:推动 KV 缓存压缩的极限 SoL-Pi:递归扩展自动研究循环以实现高效代理框架 信心源于经验:从推理到代理的经验性信心估计 AliceAI-Foundation-80B-A3B-Base(模型发布) Video DeltaNet:用于直播视频生成的视频原生混合注意力机制 ScienceBuddy:交互式科学代理的递归内递归自我改进 变换器中的世界建模 When2Think:学习难度感知长度控制以实现高效混合推理模型 探索这些论文以紧跟主要 AI 趋势。这里还有令人惊叹的论文完整列表 + 链接,以及我们的每周 AI 新闻摘要:
⏰ 08:53 | ❤️ 20点赞 | 📝 218字 | 查看原文 →
Chubby♨️ @kimmonismus
Tech Analyst & Content Creator. Editor-in-Chief @getsuperintel – Community of 300k+ in total: https://linktr.ee/kimmonismus // [email protected] | 影响力: 0万粉丝
💡 核心观点: AI代理通过屏幕录制学习并自动化重复性任务,人工只需处理例外。
可信度: 9/10 – 2项声明可直接验证;2项需进一步确认
事实核查:
- ◐ 部分可验证: Akai可以将屏幕录制和操作讲解转化为自动化工作流程 (需访问Akai官网或产品演示,确认其是否支持通过屏幕录制生成自动化流程,但具体技术实现细节可能未完全公开。)
- ◐ 部分可验证: Deel使用Akai实现了月末结账自动化,包括匹配银行交易和准备审计文件 (若Deel或Akai发布过案例研究或官方博客提及此用例,则可部分验证;但若无公开文档或具体数据支持,则无法完全确认。)
- ✓ 可验证: 月末结账任务原本需在系统间切换数小时,自动化后由人员仅处理例外情况 (效率提升的具体数据(如“数小时”)和操作细节属于企业内部流程,通常未公开,需依赖Deel内部披露。)
原文内容:
通过录制屏幕并边操作边讲解,向 AI 代理展示你如何完成一项任务。Akai 将该演练转化为自动化工作流程,你的团队可以审查并重复使用。 Deel 为其自身运营构建了它。一个用例:月末结账,匹配银行交易并为数百个实体准备审计文件。 那每月要在系统间切换数小时。一个适合代理执行的有用任务,由人员检查例外情况并批准数字。
⏰ 07:46 | ❤️ 56点赞 | 📝 131字 | 查看原文 →
Rohan Paul @rohanpaul_ai
Compiling in real-time, the race towards AGI.
The Largest Show on X for AI.
Get my daily AI analysis newsletter to your email https://rohan-paul.com | 影响力: 6,793万粉丝
💡 核心观点: 程序图提升LLM代理长任务表现,可编辑优化工作流程。
可信度: 10/10 – 3项声明可直接验证;2项需进一步确认
事实核查:
- ✓ 可验证: 谷歌新论文显示,LLM代理在工作流程位于可编辑程序图中时,能更好地处理长任务 (可通过提供的arXiv论文链接(arxiv.org/abs/2609.09153)直接查看论文内容,验证该声明是否与论文结论一致。)
- ◐ 部分可验证: 在24种模型和基准组合中,该方法在21种中排名第一或并列第一 (论文中可能包含具体实验数据和排名,但需实际阅读论文并核对实验设置和基准细节才能完全验证。)
- ✓ 可验证: 在MultiChallenge上,成功率从有缺陷图的58.93%提升到精炼后的92.86% (论文中应包含具体实验数据,可通过论文直接验证该数值是否准确。)
原文内容:
谷歌新论文显示,LLM 代理在工作流程位于可编辑程序图中时,能更好地处理长任务,该图会从执行中学习,而不是被埋藏在聊天历史中。 问题是:随着代理运行时间变长,它们可能会忘记当前进度、重复使用工具,或以错误顺序执行步骤。 程序图为代理提供了一个小地图,显示下一步可能发生什么,同时仍允许 LLM 自由推理。 运行结束后,另一个 LLM 会比较成功和失败案例并编辑地图,但只有在不损害留出任务的情况下才会保留编辑。 在 24 种模型和基准组合中,该方法在 21 种中排名第一或并列第一。 它还修复了一个设计有缺陷的人类工作流程:在 MultiChallenge 上,成功率从有缺陷图的 58.93% 提升到精炼后的 92.86%。 这种指导会消耗额外令牌,因此在长工作流程成为瓶颈时最有意义。 总体而言,它建议将关键程序从聊天历史中移出,放入一个显式的、可编辑的工作流程中,该流程会从执行中改进。 – arxiv.org/abs/2609.09153 标题:“程序图:LLM 代理的自演化执行结构”
⏰ 17:56 | ❤️ 344点赞 | 📝 323字 | 查看原文 →
Artificial Analysis @artificialanlys
Independent analysis of AI | 影响力: 0万粉丝
💡 核心观点: Grok 4.7性能提升显著且成本低于竞品。
可信度: 6/10 – 1项声明可直接验证;2项需进一步确认
事实核查:
- ◐ 部分可验证: Grok 4.7 在 AA-Briefcase 上排名第二,仅次于 Anthropic 模型,且每任务成本约为后者的 50% (需核实 AA-Briefcase 的具体排名和成本数据,但若无公开基准测试或官方报告支持,则部分依赖内部数据。)
- ◐ 部分可验证: Grok 4.7 在 AA-Briefcase-Lite 的分析质量 Elo 从 1698 提升至 1994,演示 Elo 从 1531 降至 1499 (若 AA-Briefcase-Lite 是公开测试场景且 Elo 评分标准透明,可部分验证;但具体评分方法和数据可能未完全公开。)
- ✓ 可验证: Grok 4.7 (xhigh) 生成示例幻灯片的 API 成本为 ~$8,而 Grok 4.6 (xhigh) 为 ~$4.40 (若 API 定价公开或用户可实测对比,成本数据可直接验证;需确认是否为官方定价或特定条件下的测试结果。)
原文内容:
Grok 4.7 在 AA-Briefcase 上仅落后于 Anthropic 模型,在 Opus 5 之后排名第二,其每任务成本约为后者的 ~50% Grok 4.7 相较于 Grok 4.6 的改进在 AA-Briefcase-Lite 中显而易见,这是我们的公开尽职调查场景,在该场景中,模型被要求构建市场模型和目标评估幻灯片。Grok 4.7 在分析质量 Elo 上显著提升(1698 → 1994),而在演示 Elo 上略有小幅退步(1531 → 1499)。 生成示例幻灯片的 API 成本:Grok 4.7 (xhigh) ~$8 vs. Grok 4.6 (xhigh) ~$4.40
⏰ 06:57 | ❤️ 529点赞 | 📝 106字 | 查看原文 →
Artificial Analysis @artificialanlys
Independent analysis of AI | 影响力: 0万粉丝
💡 核心观点: Grok 4.7分析三年数据发现增长被货币贬值抵消,优于仅用单年数据的4.6。
可信度: 6/10 – 1项声明可直接验证;2项需进一步确认;1项为观点陈述
事实核查:
- ◐ 部分可验证: Grok 4.6 仅使用最新一年的数据,没有收入趋势或货币讨论 (需查看 Grok 4.6 的官方文档或功能说明以确认其数据使用范围,但若缺乏公开详细技术文档则难以完全验证。)
- ◐ 部分可验证: Grok 4.7 评估完整的三年历史,并分析增长被货币贬值抵消 (需核实 Grok 4.7 的功能更新是否包含三年历史数据及货币分析,但具体结论(如“增长被抵消”)可能依赖内部模型或假设,公开数据未必完整支持。)
- ◦ 观点: Grok 4.7 的结论为购买决策提供信息 (该声明属于对工具效用的主观评价,无法通过客观数据验证其实际决策影响。)
原文内容:
示例 2 任务:私募股权公司的演示模板要求资产简介涵盖规模和财务状况 Grok 4.6 仅使用最新一年的数据,没有收入趋势或货币讨论,而 Grok 4.7 评估完整的三年历史,并得出结论:增长被货币贬值所抵消,从而为购买决策提供信息
⏰ 06:57 | ❤️ 22点赞 | 📝 87字 | 查看原文 →
Rohan Paul @rohanpaul_ai
Compiling in real-time, the race towards AGI.
The Largest Show on X for AI.
Get my daily AI analysis newsletter to your email https://rohan-paul.com | 影响力: 6,793万粉丝
💡 核心观点: 小模型通过动态任务训练和简化工具实现高效编码。
可信度: 10/10 – 2项声明可直接验证;2项需进一步确认;1项为观点陈述
事实核查:
- ✓ 可验证: FrogNano 在 SWE-bench Verified 上达到了 61.5% 的成绩 (可通过推文中提供的 arXiv 论文链接(arxiv.org/abs/2609.07925)直接验证该数据,论文中应包含实验结果的详细记录。)
- ◐ 部分可验证: FrogNano 以 Qwen3.5-4B 为起点,并使用 RL 在约 1500 个合成软件工程任务上进行训练 (论文可能描述模型架构和训练方法,但“合成任务”的具体细节和 RL 实现需依赖论文内容,部分技术细节可能需实验复现确认。)
- ✓ 可验证: 切换到更简单的 5 工具配置后,基础模型在 SWE-bench Verified 上的成绩从 8.3% 提升到 37.2% (性能对比数据应包含在论文的实验部分,可通过论文直接验证。但工具配置的具体定义需结合论文方法章节。)
原文内容:
一个 40 亿参数的编码代理在 SWE-bench Verified 上达到了 61.5% 的成绩,而无需使用前沿模型蒸馏,只需结合更简单的工具接口与持续适应模型当前学习能力的合成任务即可实现。 FrogNano 以 Qwen3.5-4B 为起点,并使用 RL 在约 1500 个合成软件工程任务上进行训练。 关键在于这些任务是如何选择的。 随着模型的改进,系统会生成新的挑战性问题,这些问题具有挑战性但仍可学习,因此课程会随着代理的进步而改进。 接口同样重要。 切换到更简单的 5 工具配置后,基础模型在 SWE-bench Verified 上的成绩从 8.3% 提升到 37.2%。 经过 5 轮训练后,FrogNano 达到了 61.5%。 – arxiv. org/abs/2609.07925 标题:“FrogNano:通过在线任务合成训练 40 亿参数编码代理”
⏰ 16:52 | ❤️ 250点赞 | 📝 207字 | 查看原文 →
SemiAnalysis @semianalysis_
In-depth research on semiconductors, AI infra & hardware | 影响力: 0万粉丝
💡 核心观点: 韩国HBM出口激增因英特尔马来西亚封装产能扩张,台湾出口放缓。
可信度: 8/10 – 1项声明可直接验证;3项需进一步确认;1项为观点陈述
事实核查:
- ◐ 部分可验证: 韩国对马来西亚的 HBM 出口同比激增 +467%,仅两个月就达到约 30 亿美元。 (需查阅韩国海关或贸易统计机构的公开数据(如韩国国际贸易协会/KITA)验证出口额和增长率,但具体数据可能受统计口径或发布时间限制。)
- ◐ 部分可验证: 英特尔在槟城的先进封装产能是韩国对马来西亚 HBM 出口激增的主要原因。 (英特尔官网或财报可能提及马来西亚产能布局,但需交叉验证其与韩国出口数据的直接因果关系(如客户订单披露)。)
- ✓ 可验证: LinkedIn 显示马来西亚有约 50 个后端职位空缺。 (可通过 LinkedIn 搜索英特尔马来西亚公司的职位列表直接验证空缺数量和类型。)
原文内容:
ChipBook 8 月数据显示,韩国对马来西亚的 HBM 出口同比激增 +467%,仅两个月就达到约 30 亿美元。 我们主要将此归因于英特尔在槟城的先进封装产能,LinkedIn 显示马来西亚有约 50 个后端职位空缺。并非微不足道的数字。 反过来,对台湾的出口放缓了。贸易流动和职位空缺开始证实客户转移。(2/3)
⏰ 06:40 | ❤️ 43点赞 | 📝 105字 | 查看原文 →
Jerry Liu @jerryjliu0
解析世界上最难处理的 PDF @llama_index。公司联合创始人/首席执行官
职业机会:https://llamaindex.ai/careers
企业服务:https://llamaindex.ai/contact | 影响力: 0万粉丝
💡 核心观点: 校准置信度分数优化文档提取,提升人工审核效率。
可信度: 7/10 – 1项声明可直接验证;3项需进一步确认
事实核查:
- ✓ 可验证: JEV(可能指某技术或产品)使人们开始理解校准置信度分数在离散决策中的重要性 (推文未提供JEV的具体定义、背景或数据支持,无法通过公开渠道验证其实际影响或普及程度。)
- ◐ 部分可验证: LlamaParse提供了用于通用模式引导文档提取的可靠置信度分数,支持基本类型(如bool/int/float)和自由文本提取 (可通过推文链接访问官网(https://developers.llamaindex.ai/llamaparse/extract/guides/extensions/#confidence-scores)验证功能描述,但需实测确认其实际效果和可靠性。)
- ◐ 部分可验证: 每个提取的值附带指向源文档的边界框,校准置信度分数可优化人工审核流程(通过阈值设置) (官网可能提供技术文档或示例说明边界框和置信度功能,但具体实现效果需依赖实际测试或用户反馈。)
原文内容:
有了JEV,人们开始认识到校准置信度分数在离散决策中的关键作用。 我们将这一方法推向新高度,构建出适用于通用模式引导文档提取的可靠置信度评分体系: • 支持布尔值、整数、浮点数等基础数据类型(数值范围不受限) • 兼容自由格式文本提取 • 每个提取值均附带可追溯至源文档的边界框坐标 经校准的置信度分数对人工复核至关重要。通过设定阈值,您可安排人工审核低置信度数值,同时自动化处理高置信度提取结果。 如需处理海量文档提取任务,欢迎体验:https://developers.llamaindex.ai/llamaparse/extract/guides/extensions/#confidence-scores… 立即注册LlamaParse:
⏰ 06:36 | ❤️ 63点赞 | 📝 188字 | 查看原文 →
Machina @exm7777
running ai-powered agencies | http://weeklyaiops.com | 影响力: 665万粉丝
💡 核心观点: 构建AI客服代理的企业将迅速获利,市场缺口大且窗口期短。
可信度: 8/10 – 1项声明可直接验证;2项需进一步确认;2项为观点陈述
事实核查:
- ✓ 可验证: 构建AI支持代理的人将在90天内实现1.4亿美元的ARR(年度经常性收入) (未提供具体公司名称、数据来源或官方链接,无法通过公开渠道核实该财务数据。)
- ◐ 部分可验证: Deel在内部使用AKAI进行客服工单管理,头几个月节省了9万小时的后台工作 (需查阅Deel官方声明或AKAI合作案例,但未提供直接链接;若Deel公开披露过此数据则可验证,否则需进一步确认。)
- ◦ 观点: 客户支持是AI代理最容易接手的工作,因为流程标准化(阅读消息、拉取上下文、回复等) (该声明基于对AI适用场景的主观判断,缺乏客观数据或行业共识支持,属于观点陈述。)
原文内容:
谁现在为公司构建AI支持代理的人,将会赚大钱(这些家伙在90天内实现了1.4亿美元的ARR) 因为客户支持老实说就是你能交给代理的最简单的工作……每个有支持邮箱的企业都需要这个,但几乎没有哪家已经有了 整个过程就是一个循环: - 阅读消息 - 拉取账户上下文 - 决定适用什么 - 回复 一个代理能在几秒钟内完成这个,你的团队只处理那些奇怪的……愤怒的客户,需要真正判断力的通话 而Deel已经在为客服工单管理运行这个确切的设置,队列会自己清空……他们在内部使用了AKAI,在头几个月就节省了9万小时的后台工作 去成为那个为别人设置这个的人吧……它还稀缺的窗口不会持续太久
⏰ 06:23 | ❤️ 87点赞 | 📝 233字 | 查看原文 →
Chubby♨️ @kimmonismus
Tech Analyst & Content Creator. Editor-in-Chief @getsuperintel – Community of 300k+ in total: https://linktr.ee/kimmonismus // [email protected] | 影响力: 0万粉丝
💡 核心观点: OpenAI新模型解决百项数学难题,MiMo出色Grok不佳。
可信度: 6/10 – 3项需进一步确认;1项为观点陈述
事实核查:
- ◐ 部分可验证: OpenAI 新训练的模型解决了100个长期悬而未决的数学难题 (需查阅OpenAI官方博文或研究论文确认具体内容和成果真实性,但若博文存在且提及相关数据,则可验证;若无详细公开信息则部分可验证。)
- ◐ 部分可验证: MiMo 发布了一个了不起的模型 (需核实MiMo官方发布的模型信息或第三方评测,但“了不起”为主观评价,具体性能需依赖客观数据。)
- ◐ 部分可验证: Grok 4.7 表现不佳 (需对比Grok 4.7的官方性能指标或独立测试结果,但“表现不佳”缺乏量化标准,可能含主观判断。)
原文内容:
卧槽,我在飞机上待了10个小时。就在这10个小时内,OpenAI 发布了一篇博文,他们新训练的模型解决了100(!!)个长期悬而未决的数学难题,甚至让他们自己的研究人员都感到惊讶。 MiMo 发布了一个了不起的模型,而 Grok 4.7 表现不佳。 我再也不坐飞机了。永远。(好吧,不是真的)。
⏰ 06:22 | ❤️ 714点赞 | 📝 98字 | 查看原文 →
Rohan Paul @rohanpaul_ai
Compiling in real-time, the race towards AGI.
The Largest Show on X for AI.
Get my daily AI analysis newsletter to your email https://rohan-paul.com | 影响力: 6,793万粉丝
💡 核心观点: 跨任务修复重复错误比单独修正更高效。
可信度: 6/10 – 1项声明可直接验证;2项需进一步确认;1项为观点陈述
事实核查:
- ◐ 部分可验证: ECDYSIS 将跨任务的反复问题分组,并实现了更高的准确性、更快的训练和更强的跨模型迁移 (可通过论文(arxiv.org/abs/2609.11677)中的实验数据和方法部分验证分组策略和性能提升,但需实际复现实验以完全确认结果。)
- ◦ 观点: 修补每个失误可能会将模型的坏习惯硬编码到系统中 (这是基于作者对代理学习机制的假设或推断,属于主观分析,缺乏直接可验证的客观数据支持。)
- ✓ 可验证: ECDYSIS 在决定修复测试框架前,先寻找不同任务中相同类型的失败 (论文中应包含该方法的流程描述(如算法或案例研究),可通过公开的论文内容直接验证其设计逻辑。)
原文内容:
如果一个代理为每个错误决定重写其运行时,它可能会学到错误的教训 修复跨任务的反复失败,而不是每个失败。 代理运行时应该从失败模式中学习,而不是失败次数:ECDYSIS 将跨任务的反复问题分组,并实现了更高的准确性、更快的训练和更强的跨模型迁移。 修补每个失误,你可能会意外地将一个模型的坏习惯硬编码到系统中。 ECDYSIS 则在决定是否需要修复测试框架本身之前,先寻找不同任务中相同类型的失败。 – arxiv.org/abs/2609.11677 标题:“Ecdysis:LLM 代理运行时测试框架的高效有效训练”
⏰ 15:33 | ❤️ 77点赞 | 📝 184字 | 查看原文 →