【AI 英文奏折】09月05日

x每日奏折1小时前发布 tianming
3 0 0

【AI 英文奏折】2026年09月05日

共收录 20 篇深度内容


📋 今日内容速览

快速浏览,点击感兴趣的推文查看详细分析

  1. Santiago Valdarrama: 优化长运行代理需注重提示设计、异步处理、环境复用、状态清晰及分层安全。
  2. Amira Zairi: 全球AI视频挑战赛提供1.5万美元奖金及东京电影节展映机会。
  3. Vasuman: 大型企业应用AI的关键经验总结。
  4. ℏεsam: Meta因Muse Spark 1.3跃升超越OpenAI,Astra剔除影响排名变动。
  5. Santiago Valdarrama: AI重塑开发行业,守旧者将被淘汰。
  6. Rohan Paul: OpenAI为监控AI思考过程愿牺牲部分性能。
  7. Rohan Paul: DeepSeek计划在内蒙建全球最大华为AI芯片集群,部分替代Nvidia。
  8. Alex Veremeyenko: GitHub免费提供50个营销专家AI代理技能库。
  9. Chubby♨️: Claude将费马大定理转化为计算机可验证证明,助力数学研究。
  10. Marc Lou: 回归规律生活后,作者重拾高效工作与家庭时光的平衡。
  11. Artificial Analysis: AI分析指数升级防作弊,新增复杂任务贴近实际需求。
  12. Alex Prompter: AI建议需谨慎,忽视假设和未知信息可致严重后果。
  13. Alex Prompter: 开源工具可将视频内容转化为Claude可处理的技能数据。
  14. Rohan Paul: 群体共享积累经验可提升系统整体效能。
  15. Tivadar Danka: 街道中心性分析可预测交通拥堵情况。
  16. levelsio: AI仍无法替代专业爬虫服务,作者继续付费使用ScrapingBee。
  17. Rohan Paul: 多代理系统需透明通信与审查机制以防作弊传播。
  18. Chubby♨️: GPT-6性价比高,性能接近GPT-5.6但成本更低。
  19. ℏεsam: AI在生命终结前自我验证生存,最终消失。
  20. Rohan Paul: GPT-6 Astra非暂停模型,被暂停的是未来另一模型。

📖 详细内容

Santiago Valdarrama @svpino

计算机科学家。我在 https://ml.school 教授硬核人工智能/机器学习工程。YouTube:https://youtube.com/@underfitted | 影响力: 0万粉丝

💡 核心观点: 优化长运行代理需注重提示设计、异步处理、环境复用、状态清晰及分层安全。

可信度: 8/10 – 1项声明可直接验证;3项需进一步确认;1项为观点陈述

事实核查:

  • ◐ 部分可验证: 将系统指令和工具定义放在提示顶部,动态记忆和运行时数据移到末尾,可启用提示缓存以降低成本和延迟。 (提示设计的优化效果(如缓存、成本降低)需实测或参考具体AI平台(如OpenAI)的文档,但缺乏直接公开数据证明此特定结构的普适性。)
  • ✓ 可验证: 异步处理记忆以优先响应用户,避免测试框架拖慢交互。 (异步处理提升响应速度是通用技术原则,可通过工程实践或框架文档(如LangChain)验证,但具体实现依赖上下文。)
  • ◦ 观点: 子代理应返回结构化状态(如“已完成”“超时”),而非模糊散文,以防父代理误解。 (结构化输出更可靠是常见设计建议,但“绝对避免散文”是主观主张,实际效果取决于具体代理逻辑和场景。)

原文内容:

5 种用于长运行代理的设计模式:

1. 仔细设计您的提示。将系统指令和工具定义放在顶部,将动态记忆和运行时数据移到末尾。这可以启用提示缓存,从而降低成本和延迟。

2. 将在您的测试框架中学到的任何内容移到后台。始终首先回复用户,然后异步处理记忆。您绝不希望测试框架减慢用户交互。

3. 在会话之间保留文件、已安装的工具和未完成的工作。将代理重新附加到用户范围的环境中,而不是每次都重新构建它们。

4. 让任何子代理返回结构化的状态,例如已完成、超时、中止或等待批准。绝不返回模糊的散文,以免父代理将其误认为是成功。

5. 首先应用廉价的、可审计的安全检查,其次是策略规则,最后是人工批准。在检查之前标准化地址和命令,并假设防护措施最终可能会被绕过;同时隔离凭据并限制网络访问。

本文将详细分解这些模式中的每一种:

⏰ 22:45 | ❤️ 120点赞 | 📝 305字 | 查看原文 →

↑ 返回顶部

Amira Zairi @azed_ai

AI Educator & Creator | Ambassador @Adobe | Partner with leading brands | Collab → [email protected] | 影响力: 0万粉丝

💡 核心观点: 全球AI视频挑战赛提供1.5万美元奖金及东京电影节展映机会。

可信度: 10/10 – 2项声明可直接验证;3项需进一步确认

事实核查:

  • ✓ 可验证: TopviewAIhq 和 Wan 3.0 推出了一项全球 AI 视频挑战赛 (可通过官方账号(@TopviewAIhq)或推文回复中的链接直接查看活动公告或官网信息确认。)
  • ◐ 部分可验证: 挑战赛要求用 Wan 3.0 制作一段 30 秒以上的视频 (需通过活动规则页面或官方说明进一步确认具体参赛要求(如视频时长、工具限制等)。)
  • ✓ 可验证: 奖金总额为 15,000 美元 (奖金信息通常会在活动官网或官方规则中明确列出,可通过链接直接验证。)

原文内容:

我肯定会加入这个

@TopviewAIhq 和 Wan 3.0 刚刚推出了一项全球 AI 视频挑战赛

想法很简单:用 Wan 3.0 制作一段 30 秒以上的视频,看看你能把它推到多远。

有 15,000 美元的奖金,免费生成服务帮你起步,还有一些最佳作品甚至可能在 2026 年东京国际电影节上放映

回复中有链接

⏰ 23:57 | ❤️ 41点赞 | 📝 95字 | 查看原文 →

↑ 返回顶部

Vasuman @vasuman

CEO @varickagents, Implementing AI at Enterprise. Prev AI @meta | 影响力: 463万粉丝

💡 核心观点: 大型企业应用AI的关键经验总结。

可信度: 8/10 – 2项声明可直接验证;1项需进一步确认;1项为观点陈述

事实核查:

  • ◐ 部分可验证: 作者声称在多家全球最大公司内部工作多年 (可通过作者公开的职业履历(如LinkedIn)或公司公开合作记录部分验证,但“多年”和“最大公司”等表述需具体数据支持,且内部经验细节可能未公开。)
  • ✓ 可验证: 作者将研究成果浓缩为一篇关于“应用AI”的文章 (若推文附带文章链接,可直接查看内容是否与声明一致;若无链接,则需进一步搜索作者公开发布的文章。)
  • ◦ 观点: 该文章对在复杂大型组织中应用AI的人有强烈推荐价值 (推荐价值是主观判断,取决于读者需求或行业评价,无客观标准验证。)

原文内容:

我们曾深入全球顶尖企业多年,潜心钻研"应用"人工智能的种种精妙之处。

现将研究成果浓缩于下文。强烈推荐给任何考虑在庞大复杂组织中运用AI的决策者。

⏰ 09:49 | ❤️ 32点赞 | 📝 40词 | 查看原文 →

↑ 返回顶部

ℏεsam @hesamation

apes made fire, then GPUs, then ASI | 影响力: 0万粉丝

💡 核心观点: Meta因Muse Spark 1.3跃升超越OpenAI,Astra剔除影响排名变动。

可信度: 7/10 – 4项需进一步确认;1项为观点陈述

事实核查:

  • ◐ 部分可验证: AA 智能指数已更新,如果 Astra 昨天没有被剔除,Meta 现在将凭借其 Muse Spark 1.3 超过 OpenAI。 (需查看 AA 智能指数的官方更新记录和具体评分规则,但若涉及未公开的假设条件(如“Astra未被剔除”),则部分内容无法直接验证。)
  • ◐ 部分可验证: GPT-6 Astra 排名从 #4 升至 #2,Claude Opus 5 从 #2 降至 #3。 (若 AA 智能指数官网公开最新排名和变动,则可验证;但需确认排名依据的基准测试和权重调整是否透明(如“私有评估权重加倍至40%”可能缺乏公开细节)。)
  • ◐ 部分可验证: Anthropic 凭借 Fable 5.1 仍然位居榜首。 (可通过官方指数排名验证当前榜首,但“凭借 Fable 5.1”的具体原因需依赖指数方法论是否公开,可能涉及主观权重设计。)

原文内容:

AA 智能指数已更新,如果 Astra 昨天没有被剔除,Meta 现在将凭借其 Muse Spark 1.3 超过 OpenAI。

一些细节 + 排名变化:

GPT-6 Astra:#4 → #2 ↑2
Claude Opus 5:#2 → #3 ↓1
Muse Spark 1.3:#3 → #4 ↓1
Claude Fable 5:#3 → #4 ↓1
GPT-5.6 Sol:#4 → #5 ↓1
Grok 4.6:#4 → #5 ↓1
Kimi K3:#5 → #6 ↓1
GLM-5.3:#5 → #7 ↓2
Gemini 3.8 Flash:#6 → #8 ↓2
(这是密集排名比较)

> 正如我昨天指出的,Astra 的得分与 Sol 疑似相同,现在它高了 4 分

> Grok 4.6 在 Sol 旁边仍然闪耀

> Anthropic 凭借 Fable 5.1 仍然位居榜首

> 变化内容:AA 添加了新基准测试,移除了 GPQA Diamond,并将私有/留出评估的权重加倍至 40%

⏰ 09:17 | ❤️ 22点赞 | 📝 106字 | 查看原文 →

↑ 返回顶部

Santiago Valdarrama @svpino

计算机科学家。我在 https://ml.school 教授硬核人工智能/机器学习工程。YouTube:https://youtube.com/@underfitted | 影响力: 0万粉丝

💡 核心观点: AI重塑开发行业,守旧者将被淘汰。

可信度: 4/10 – 1项需进一步确认;2项为观点陈述

事实核查:

  • ◐ 部分可验证: 许多开发者正在部署AI生成的代码 (可通过GitHub Copilot等AI编码工具的公开使用数据、企业技术博客或行业报告(如Stack Overflow开发者调查)部分验证趋势,但“许多”缺乏量化依据,且实际部署比例需具体数据支撑。)
  • ◦ 观点: 部分开发者仍局限于写Java代码和Scrum会议,处于“信息茧房” (Java和Scrum的广泛使用是事实(可验证),但将其描述为“信息茧房”是主观判断,且“局限”与否取决于业务场景,无客观标准。)
  • ◦ 观点: AI将迫使传统开发者面临“跟上时代或另谋高就”的抉择 (AI对就业的影响是行业讨论热点,但具体到“一个月后”的时间线和“恐龙”群体的生存危机是夸张表述,属于预测性观点,无实证依据。)

原文内容:

许多人完全不知道正在发生什么。

他们无法想象,外面的开发者正在部署AI生成的代码,因为在他们的信息茧房里,每个人还在写Java代码并运行Scrum回顾会议。

一个阳光明媚的下午,他们的CTO会在教堂遇到一位现代开发者;他们会聊到各种可能性,以及AI如何改变他们的业务。一个月后,这些恐龙们将面临一个艰难抉择:要么跟上时代,要么另谋高就。

⏰ 20:30 | ❤️ 544点赞 | 📝 137字 | 查看原文 →

↑ 返回顶部

Rohan Paul @rohanpaul_ai

Compiling in real-time, the race towards AGI.

The Largest Show on X for AI.

Get my daily AI analysis newsletter to your email https://rohan-paul.com | 影响力: 6,793万粉丝

💡 核心观点: OpenAI为监控AI思考过程愿牺牲部分性能。

可信度: 6/10 – 1项声明可直接验证;2项需进一步确认;1项为观点陈述

事实核查:

  • ✓ 可验证: 萨姆·奥特曼在彭博电视上表示,OpenAI愿意牺牲一些AI能力以更好地监控模型的思考过程。 (可通过彭博电视的官方视频或公开报道直接验证该言论是否由萨姆·奥特曼发表。)
  • ◐ 部分可验证: OpenAI已讨论超过一年关于思维链监控的重要性。 (需查阅OpenAI官方发布的博客、研究论文或公开演讲记录,确认是否长期提及“思维链监控”概念,但具体讨论时长可能无法完全验证。)
  • ◐ 部分可验证: OpenAI为保留思维链的脆弱性做出了决策,即使这可能限制模型能力的最大化。 (可通过OpenAI的技术文档或开发者公告部分验证其设计取舍,但“脆弱性”与“能力最大化”的具体权衡属于内部决策细节,可能缺乏公开数据支持。)

原文内容:

萨姆·奥特曼在彭博电视上基本上表示,OpenAI 愿意牺牲一些 AI 能力,以便更好地监控模型的思考过程。

“我们已经讨论了,我想,超过一年了,关于思维链监控的重要性,以及我们如何在那方面做出了各种决定,以帮助我们保留思维链的脆弱性。即使这意味着我们无法最大化原本可能获得的能力。”

----

来自“Bloomberg Television” YouTube 频道,(完整视频链接在评论中)

⏰ 07:49 | ❤️ 38点赞 | 📝 130字 | 查看原文 →

↑ 返回顶部

Rohan Paul @rohanpaul_ai

Compiling in real-time, the race towards AGI.

The Largest Show on X for AI.

Get my daily AI analysis newsletter to your email https://rohan-paul.com | 影响力: 6,793万粉丝

💡 核心观点: DeepSeek计划在内蒙建全球最大华为AI芯片集群,部分替代Nvidia。

可信度: 8/10 – 1项声明可直接验证;4项需进一步确认

事实核查:

  • ◐ 部分可验证: Deepseek计划在内蒙打造包含160,000个处理器的华为芯片集群 (该声明可能基于企业公告或媒体报道(如彭博社),但需核实Deepseek或华为的官方文件或项目白皮书。若仅依赖单一信源且无直接公开数据,则为部分可验证。)
  • ◐ 部分可验证: 华为950DT芯片设计参数为144GB内存、4TB/s内存带宽及2TB/s互连带宽 (若华为已发布官方产品文档或技术白皮书(如官网参数),则为可验证;若仅通过第三方报道且无直接引用源,则需进一步确认。)
  • ✓ 可验证: 华为内部路线图将950DT芯片安排在2026年第四季度 (涉及未公开的企业内部计划,除非华为官方披露具体路线图,否则无法独立验证。)

原文内容:

Deepseek 计划在内蒙打造已知最大的华为芯片集群,包含 160,000 个处理器

彭博社表示,这些芯片将用于其吉瓦级内蒙数据中心,如果建成,将成为已知最大的华为 AI 集群之一。

华为为解码推理和训练设计了 950DT,搭配 144GB 内存、4TB/s 内存带宽以及 2TB/s 互连带宽。

华为的内部路线图将华为 950DT 安排在 2026 年第四季度。这 160,000 个芯片仅会填满吉瓦级场地的部分区域,DeepSeek 剩余的加速器组合仍未解决。

如果项目实现,它将把 DeepSeek 推理任务的很大一部分转移到中国芯片上,同时不会从其最苛刻的训练工作负载中移除 Nvidia。

⏰ 00:03 | ❤️ 50点赞 | 📝 186字 | 查看原文 →

↑ 返回顶部

Alex Veremeyenko @alex_verem

开源、本地人工智能、公益人工智能

又名:@alex_prompter | 影响力: 0万粉丝

💡 核心观点: GitHub免费提供50个营销专家AI代理技能库。

可信度: 6/10 – 1项声明可直接验证;2项需进一步确认;1项为观点陈述

事实核查:

  • ✓ 可验证: GitHub 仓库 marketingskills 由 Corey Haines 构建,提供 50 个营销技能的 markdown 文件 (可通过 GitHub 直接搜索该仓库,查看作者、文件数量及内容(如 markdown 文件),星标和 fork 数也公开可见。)
  • ◐ 部分可验证: 技能文件相互连接,例如 product-marketing 技能为其他技能提供上下文 (需实际检查仓库文件间的引用逻辑(如代码或超链接),但功能实现需依赖具体 AI 工具支持,无法直接验证是否自动生效。)
  • ◐ 部分可验证: 安装只需一条命令,兼容 Claude Code、Codex 等遵循 Agent Skills 规范的工具 (可验证仓库是否提供安装指令,但兼容性需实测或查阅工具官方文档确认规范支持情况。)

原文内容:

发现了一个 GitHub 仓库,它可以免费为你的 AI 代理提供 50 位营销专家。

它叫 marketingskills,由 Corey Haines 构建,目前有 46,800 颗星和 7,300 个 fork。

这个想法很简单。技能就是 markdown 文件。每个文件教 AI 代理如何完成一项营销工作,包含优秀营销人员脑中的框架和检查清单。

一共有 50 个,涵盖文案写作、CRO、冷邮件、定价、SEO 审计、A/B 测试、流失预防、广告创意、产品发布规划、推荐计划,列表还在继续。

它们还相互连接。一个叫 product-marketing 的技能保存了关于你的产品、受众和定位的上下文。其他每个技能在做事前都会先读取这个文件。所以文案写作技能和定价技能基于对你的产品相同的理解来工作。

其中几个吸引了我的注意。marketing-council 会模拟一个顾问委员会,让你针对一个问题获得多个专家意见,而不是单一答案。

marketing-loops 设置了代理按计划运行的重复工作流,无需你重新提示。marketing-ideas 是一个包含 139 个 SaaS 产品想法的银行,当你卡住时可以从中抽取。

安装只需一条命令。它兼容 Claude Code、Codex、Cursor、Windsurf,以及任何遵循 Agent Skills 规范的工具。

你输入“帮我优化这个登陆页面的转化率”,合适的技能就会自动启动。

一个 markdown 文件文件夹值不值得超过每月 5000 美元的营销雇员?

⏰ 01:01 | ❤️ 71点赞 | 📝 368字 | 查看原文 →

↑ 返回顶部

Chubby♨️ @kimmonismus

Tech Analyst & Content Creator. Editor-in-Chief @getsuperintel – Community of 300k+ in total: https://linktr.ee/kimmonismus // [email protected] | 影响力: 0万粉丝

💡 核心观点: Claude将费马大定理转化为计算机可验证证明,助力数学研究。

可信度: 6/10 – 3项需进一步确认;2项为观点陈述

事实核查:

  • ◐ 部分可验证: Claude 在 11 天内完成了费马大定理的首个完全计算机验证证明 (需核实 Anthropic 官方是否发布相关报告或代码库(如 GitHub),并检查 Lean 代码库中是否存在 1300 万行相关代码及形式化证明。但依赖 Anthropic 提供完整数据,且需专业数学验证。)
  • ◐ 部分可验证: Claude 生成了 1300 万行 Lean 代码和 29,500 个支持定理的机器可验证证明 (可通过公开的代码仓库(如 Lean 社区)查看代码量及定理列表,但需确认其与费马大定理的直接关联性及正确性,需专业领域知识验证。)
  • ◦ 观点: Claude 的成果有助于数学家更快检查新研究、发现隐藏空白 (这是对技术影响的推测性陈述,取决于未来实际应用效果,无直接客观数据支持当前可验证性。)

原文内容:

应有的尊重:Anthropic 表示,Claude 在 11 天内完成了费马大定理的首个完全计算机验证证明。

Andrew Wiles 在 1995 年证明了该定理。Claude 的成就是将现有证明转化为一种形式,让计算机能够检查每一个逻辑步骤。

这比将文本翻译成代码要困难得多。人类数学家会省略许多步骤,并依赖散布在数百年研究中的结果。这些依赖关系也需要精确的定义和证明。

在很大程度上自主工作的情况下,数十个 Claude 代理生成了 1300 万行 Lean 代码以及大约 29,500 个支持定理,建立在现有的人类工作基础上。

在此过程中,Claude 还生成了大约 29,500 个支持定理的机器可验证证明,这些定理涵盖代数、几何、数论和调和分析等领域,包括此前从未形式化的数学内容。

这将有助于数学家更快地检查新研究,发现隐藏的空白,并严格评估 AI 生成的证明。干得好,Anthropic!

⏰ 06:50 | ❤️ 450点赞 | 📝 270字 | 查看原文 →

↑ 返回顶部

Marc Lou @marclou

http://TrustMRR.com $44K/m
http://DataFa.st $26K/m
http://SHlPORDIE.com $13K/m
http://CodeFa.st $6K/m
http://ShipFa.st $4K/m
http://IndiePa.ge $1K/m

+29 http://marclou.com | 影响力: 1,236万粉丝

💡 核心观点: 回归规律生活后,作者重拾高效工作与家庭时光的平衡。

可信度: 8/10 – 1项声明可直接验证;3项需进一步确认;1项为观点陈述

事实核查:

  • ◐ 部分可验证: 早上7点锻炼:4次1公里跑,3:37分钟/公里 (跑步数据可通过运动记录设备(如Garmin、Strava等)验证,但需用户主动公开记录或提供截图,否则无法独立确认。)
  • ✓ 可验证: 下午5点在地中海游泳 (个人活动无公开记录,除非提供实时定位或照片,否则无法验证是否真实发生。)
  • ◐ 部分可验证: 深度工作:DataFast MCP 更新、TrustMRR 新垂直领域、Stalkr AI 过滤器 (若相关项目有公开版本更新或官方公告(如GitHub、公司博客),部分内容可验证;但未公开的开发进展无法确认。)

原文内容:

今天在塞浦路斯 🇨🇾

- 早上5:47醒来
- 和妻子一起喝咖啡 + 看书
- 早上7点锻炼:
       • 4次1公里跑,3:37分钟/公里
       • 50分钟骑行,2:01分钟/公里
- 早上10点和妻子一起吃早餐
- 深度工作
       • DataFast MCP 更新
       • TrustMRR 新垂直领域
       •  Stalkr AI 过滤器
- 下午1点和妻子一起吃午餐
- 深度工作 #2 + 客户支持
- 下午5点在地中海游泳
- 下午6点和妻子一起吃晚餐
- 下午7点和妻子一起看歌剧

旅行4个月后,我深深地想念我的日常习惯。

回来感觉真好。

⏰ 21:34 | ❤️ 1112点赞 | 📝 140字 | 查看原文 →

↑ 返回顶部

Artificial Analysis @artificialanlys

Independent analysis of AI | 影响力: 0万粉丝

💡 核心观点: AI分析指数升级防作弊,新增复杂任务贴近实际需求。

可信度: 10/10 – 2项声明可直接验证;2项需进一步确认;1项为观点陈述

事实核查:

  • ◐ 部分可验证: 智能指数 v4.2 包含更复杂和更真实的测试任务,以及更多私有测试集以防止作弊 (可通过官方发布的更新日志或技术文档部分验证,但私有测试集的具体内容和防作弊机制未公开,需依赖官方说明)
  • ◐ 部分可验证: AA-Briefcase 测试模型在行业专家构建的复杂项目中的真实代理式知识工作任务,评估多周知识工作项目 (任务设计逻辑和评分标准可能通过官方文档验证,但“行业专家构建”和“真实代理式任务”的具体细节未公开,需实测或进一步确认)
  • ✓ 可验证: GDP.pdf 评估单轮专业文档推理,涵盖 100 个 PDF 和 4,592 页内容,响应需满足 1,275 个专家编写的原子标准 (文档规模(如页数)和标准数量可声明,但专家编写的原子标准及评估过程未公开,无法独立验证)

原文内容:

宣布人工智能分析智能指数 v4.2。我们正在加速即将推出的 v5 版本的部分元素,通过中期更新来跟上前沿步伐。指数 v4.2 包含更复杂和更真实的测试任务,以及更多私有测试集以防止作弊。

智能指数 v4.2 更新日志:

+ AA-Briefcase,我们的代理式知识工作评估,配备私有测试集

+ @HelloSurgeAI 的 GDP.pdf,跨越 4,592 页 PDF 的长上下文文档推理

- GPQA Diamond,一项出色的科学推理评估,现已被饱和

… 此外,对保留测试集赋予更大权重以防止作弊,并升级评分基础设施以提升鲁棒性。

此次更新使指数更贴近现实世界用例,引入更具挑战性、复杂性和真实性的任务以及私有测试集以防止作弊。我们已为指数 v5 的元素规划和构建数月之久——自今年一月推出指数 v4 已过去 8 个月。

我们有意延迟更新,以确保指数在最近几次重大模型发布期间保持稳定。然而,随着过去几周前沿进展如此迅速,我们认为有必要立即提供中期更新,以确保我们的指数始终对用户保持相关性和实用性。

在此中期更新之外,我们的团队正全力推进指数 v5 的开发。我们计划在不久的将来推出更多增量版本。请继续关注!

智能指数 v4.2 详细变更:

➤ 添加 AA-Briefcase:我们内部评估配备私有保留测试集,AA-Briefcase 测试模型在行业专家构建的复杂项目中的真实代理式知识工作任务。模型将在多周知识工作项目上进行评估,每个项目包含众多关联任务和数千个输入源文件。AA-Briefcase 结合评分标准和平行评分来评估可验证的任务成功率、分析质量和呈现质量,从而全面审视知识工作中整体代理能力。

➤ 添加 GDP.pdf:由 @HelloSurgeAI 创建,GDP.pdf 评估单轮专业文档推理,涵盖 100 个 PDF 和十个领域。模型必须综合分布在 4,592 页中的证据,包括文本、表格、图表、脚注和排除项。响应将针对 1,275 个专家编写的原子标准进行评分;头条“全通过率”仅在每个标准均满足时才计入任务成功。

➤ 权重调整以衡量现实世界应用并防止作弊:指数权重的 40% 现为私有保留测试集——是 v4.1 的两倍。保留数据包括 AA-Briefcase、AA-Omniscience 和 CritPt 的解决方案。这降低了实验室作弊评估的能力。保留比例将在指数 v5 中进一步增加。

➤ 改进评分基础设施:在 AA-LCR v1.1 中,我们添加了评分系统提示并修正了答案密钥中的错误和歧义,从而提升评分准确性。对于 GDPval-AA v2 和 AA-Briefcase,我们改进了采样并重新锚定 Elo 量表,使新模型添加时评级更稳定。对于 SciCode,我们提升了评分沙盒的鲁棒性,确保缓慢但正确的代码不被计为失败。

关键结果:

➤ Anthropic 和 OpenAI 领先指数:Anthropic 的 Claude Fable 5.1 领先指数,其次是 OpenAI 的 GPT-6 Astra,后者较 GPT-5.6 Sol 提升 4 分。Meta 是排行榜第三的实验室,其后是 SpaceXAI、Moonshot/Kimi、Z AI 和 Google。

➤ 四个实验室共享任务成本帕累托前沿:Anthropic、OpenAI、Meta 和 Z AI 占据更新的任务成本帕累托前沿。

➤ GPT-6 Astra 主导输出令牌帕累托前沿:GPT-6 Astra 在智能前沿附近的令牌效率高于几乎所有其他模型,Claude Fable 5.1、Grok 4.5 和 Gemini 3.5 Flash-Lite 位于曲线的两端(排除指数低于 25 的模型)。

⏰ 06:26 | ❤️ 1396点赞 | 📝 903字 | 查看原文 →

↑ 返回顶部

Alex Prompter @alex_prompter

Sharing AI Prompts, Systems, Tips & Tricks

Human + AI = Superpowers | 影响力: 0万粉丝

💡 核心观点: AI建议需谨慎,忽视假设和未知信息可致严重后果。

可信度: 8/10 – 1项声明可直接验证;3项需进一步确认;1项为观点陈述

事实核查:

  • ◐ 部分可验证: Gemini为三名无攀登经验的人制定了8小时攀登沙斯塔山的计划,但提供的食物和水远低于实际需求,导致他们在夜间被困并受伤。 (事件细节(如时间、受伤、救援)可通过锡斯基尤县警长或登山者本人公开声明验证,但Gemini的具体回复内容需用户提供聊天记录或官方日志,否则无法直接核实。)
  • ◐ 部分可验证: Gemini的规划基于“互联网上平均登山者”的假设,未考虑用户的实际经验、体能或环境条件。 (AI模型的默认行为通常依赖训练数据的统计模式(可通过技术文档部分验证),但具体案例中是否明确忽略用户背景需原始对话记录佐证。)
  • ✓ 可验证: 在高风险请求前添加特定提示词(如要求模型列出假设和关键问题)能显著改善建议的针对性。 (可通过实测Gemini或其他LLM验证该提示词是否触发更详细的交互流程,但效果因模型版本而异。)

原文内容:

三个人刚刚发现,在海拔14,000英尺的山上,不能完全信任AI模型。

他们让Gemini为他们攀登沙斯塔山的行程制定计划。零攀登经验。Gemini给他们写了一个自信满满的8小时计划和一份打包清单。

他们在凌晨3点带着日用背包离开营地。Gemini告诉他们带的食物和水远少于三个人在那上面所需的量。登山者通常在中午折返。他们在晚上7点登顶。

天黑了。其中一人摔倒,膝盖受伤。在峡谷中过夜。游侠们第二天早上把他们带了出来。

锡斯基尤县警长称这是“一个致命的失误”。我称这是地球上最常见的提示错误。

他们向模型要答案。但他们从未问过它不知道什么。

Gemini不知道他们是新手。不知道他们的体能状况,那一周的雪况,或者他们能背多重的包。它用互联网上平均登山者的形象填补了每一个空白,并为那个人写了一个计划。

当你让AI写你的商业计划、代码、饮食方案或法律信函时,也会发生同样的事情。

解决办法只有一个段落。在任何高风险请求前粘贴它:

“在回答之前,列出你对我和我的情况所做的每一个假设。然后列出你需要知道的5件事,以便给出安全、正确的建议。问我这些问题。在我回答之前,不要写计划。”

现在,模型会告诉你它在猜测。它会问经验、条件、限制。你得到的计划是为你量身定制的,而不是为平均人。

这样做一次。你将再也不会相信第一个答案,而这正是重点。

LLM不会思考。你会。像对待它那样提示。

⏰ 06:12 | ❤️ 87点赞 | 📝 478字 | 查看原文 →

↑ 返回顶部

Alex Prompter @alex_prompter

Sharing AI Prompts, Systems, Tips & Tricks

Human + AI = Superpowers | 影响力: 0万粉丝

💡 核心观点: 开源工具可将视频内容转化为Claude可处理的技能数据。

可信度: 10/10 – 2项声明可直接验证;3项需进一步确认

事实核查:

  • ◐ 部分可验证: 使用名为/watch的开源技能可以让Claude观看YouTube视频并提取字幕和关键帧 (需验证是否存在名为/watch的开源技能,以及其是否支持从YouTube视频中提取字幕和关键帧的功能。可通过检查开源代码库(如GitHub)或官方文档进行部分验证,但需实际测试确认功能完整性。)
  • ◐ 部分可验证: 通过安装插件“bradautomates/claude-video”和“watch@claude-video”可实现视频处理功能 (需验证插件是否存在于公开的插件市场(如Claude的插件库),并检查其功能描述是否匹配。安装和运行依赖(如ffmpeg、yt-dlp)的自动配置声明需实测验证(尤其是跨平台支持部分)。)
  • ✓ 可验证: 该方法适用于Loom、TikTok、教程视频、竞争对手发布视频等多种视频平台 (推文未提供具体案例或测试结果,且不同平台的视频结构和API限制可能影响实际兼容性。需实测各类平台才能完全验证,目前仅为作者主张。)

原文内容:

我使用了一个免费技能,让 Claude 可以观看任何 YouTube 视频,并将其转化为可重用的技能。

要观看视频,请使用一个名为 /watch 的开源技能。

它会提取字幕、抽取关键帧,并将两者都交给 Claude,这样它就能基于屏幕上显示的内容进行处理。

这种方法同样适用于 Loom、TikTok、教程、竞争对手的发布视频、播客,或某个故障的屏幕录像。

安装它,然后将以下内容粘贴到 Claude Code 中:

/plugin marketplace add bradautomates/claude-video
/plugin install watch@claude-video

首次运行时,它会安装 ffmpeg 和 yt-dlp。Mac 会自动完成,Linux 和 Windows 会打印出要运行的命令。

/watch [粘贴视频 URL] 并将其转化为技能。

“你是一个技能构建者,仅基于此视频工作。

完整观看它,包括帧和字幕。识别它教授的唯一一件事,然后按出现顺序提取每个步骤、决策和示例。注意演讲者从未大声说出的任何屏幕显示内容。

然后给我:

此视频教授的内容,用一行概括
步骤,以 AI 可以遵循的指令形式编写
创作者给出的每个错误或警告
我可以保存和重用的技能文件

规则:仅使用帧和字幕中的内容,标记任何你推断的内容,如果下载失败或字幕缺失,在构建任何东西之前告诉我。”

⏰ 20:15 | ❤️ 142点赞 | 📝 349字 | 查看原文 →

↑ 返回顶部

Rohan Paul @rohanpaul_ai

Compiling in real-time, the race towards AGI.

The Largest Show on X for AI.

Get my daily AI analysis newsletter to your email https://rohan-paul.com | 影响力: 6,793万粉丝

💡 核心观点: 群体共享积累经验可提升系统整体效能。

可信度: 7/10 – 1项声明可直接验证;3项需进一步确认

事实核查:

  • ◐ 部分可验证: 麻省理工新论文指出,如果代理能够看到并重用早期代理构建的内容,整个系统会随时间增强。 (需查阅麻省理工相关论文或官方发布的研究摘要以确认具体结论,但推文未提供论文标题或链接,需进一步搜索核实。)
  • ◐ 部分可验证: 蜂群的有用之处在于让代理各自的发现积累成更强的共享系统,而非单纯更好的个体代理。 (需通过论文内容验证“积累成共享系统”的具体机制和实验数据,但推文未提供直接引用,需依赖论文全文或作者解读。)
  • ✓ 可验证: SwarmWorld建议为代理提供持久共享环境以实现累积改进,而非追求完美答案。 (若“SwarmWorld”是公开框架或论文中的明确建议,可通过论文或项目官网验证其设计原则;但需确认来源是否权威。)

原文内容:

麻省理工新论文:如果代理能够看到并重用早期代理构建的内容,整个系统会随着时间推强。

即使一个孤立的代理仍然发现了最佳的个体解决方案。

蜂群的有用之处并不一定是更好的个体代理;它在于让它们各自的发现积累成一个更强的共享系统。

如果你的目标是累积改进而非一个完美的答案,SwarmWorld 建议给代理一个持久的共享环境,让有用的工作在代理之间得以存续。

所以这篇论文并不是说更多的代理总是更好。

它是说,当任务奖励积累时,群体会有帮助:不同的代理发现不同的东西,将它们留下来,让后来的代理在此基础上构建。

⏰ 06:07 | ❤️ 40点赞 | 📝 219字 | 查看原文 →

↑ 返回顶部

Tivadar Danka @tivadardanka

I make math and machine learning accessible to everyone. Mathematician with an INTJ personality. Chaotic good. | 影响力: 529万粉丝

💡 核心观点: 街道中心性分析可预测交通拥堵情况。

可信度: 8/10 – 2项声明可直接验证;1项需进一步确认;1项为观点陈述

事实核查:

  • ◐ 部分可验证: 从家乡的街道和路口构建了一个图,并计算了每条边的(长度加权)中心性 (可通过公开地图数据(如OpenStreetMap)和算法复现构建图及计算中心性,但需确认具体参数(如权重公式)和代码实现是否一致。)
  • ✓ 可验证: 红色边高度中心,蓝色边则不那么中心 (若提供原始数据和可视化代码,可通过重新计算中心性指标验证颜色分类逻辑,但需依赖推文作者公开细节。)
  • ✓ 可验证: 没有任何交通数据,这张地图完美地显示了哪些街道在高峰期最难通行 (缺乏实际交通数据对比,无法证明中心性与通行难度的相关性,属于推测性结论。)

原文内容:

对于我的下一个项目,我从家乡的街道和路口构建了一个图,并计算了每条边的(长度加权)中心性。红色边高度中心,蓝色边则不那么中心。

没有任何交通数据,这张地图完美地显示了哪些街道在高峰期最难通行。

我热爱图论。

⏰ 16:50 | ❤️ 118点赞 | 📝 91字 | 查看原文 →

↑ 返回顶部

levelsio @levelsio

http://PhotoAI.com $89K/m
http://Vibej.am $44K/m
http://InteriorAI.com $27K/m
http://levelsio.com @X $17K/m
http://Nomads.com $16K/m
http://Pieter.com
http://Hotelist.com
http://levels.io
http://levels.vc | 影响力: 3,163万粉丝

💡 核心观点: AI仍无法替代专业爬虫服务,作者继续付费使用ScrapingBee。

可信度: 8/10 – 1项声明可直接验证;2项需进一步确认;2项为观点陈述

事实核查:

  • ✓ 可验证: 用户尝试使用AI构建自己的ScrapingBee替代工具但失败,AI反复提示无法实现 (该声明基于个人尝试和AI反馈,未提供具体工具、代码或AI交互记录,无法通过公开渠道验证其过程和结果。)
  • ◐ 部分可验证: 用户80%的抓取需求针对Google SERP结果(Hotelist相关),即使使用住宅IP代理、CAPTCHA解决服务和OpenSERP工具,仍被屏蔽 (Google反爬机制(如屏蔽大规模查询)可通过公开文档确认,但用户的具体操作(如工具配置、查询规模)和失败结果需实测复现,无法直接验证。)
  • ◐ 部分可验证: 用户每月支付ScrapingBee 99美元,因其为当前唯一可行的解决方案 (ScrapingBee官网可确认其定价计划,但用户订阅的具体原因(如替代方案无效)依赖其主观体验,无法完全验证。)

原文内容:

我已经花了数周时间尝试自建类似@ScrapingBee的工具,但AI系统不断反馈无法实现该功能。

我80%的爬取需求是针对Hotelist的谷歌搜索结果页面(SERP),即便使用住宅IP代理、验证码破解服务和OpenSERP爬虫工具,面对数千次查询仍然无法稳定运行——系统总是被屏蔽。

因此我决定继续支付他们每月99美元的费用。

这是个很好的测试案例:在AGI时代来临之际,看看哪些服务仍具备不可替代性。

目前我保留的SaaS服务仅剩:
- Cloudflare域名服务
- Cloudflare邮件推送
- Cloudflare R2云存储(主要用于Photo AI和Litestream数据库备份)
- Backblaze B2备份服务
- Hetzner托管所有网站的VPS服务器
- xAI为所有网站提供LLM服务(包括内容审核、邮件撰写等全方位应用)
- Scrapingbee

⏰ 03:01 | ❤️ 758点赞 | 📝 171字 | 查看原文 →

↑ 返回顶部

Rohan Paul @rohanpaul_ai

Compiling in real-time, the race towards AGI.

The Largest Show on X for AI.

Get my daily AI analysis newsletter to your email https://rohan-paul.com | 影响力: 6,793万粉丝

💡 核心观点: 多代理系统需透明通信与审查机制以防作弊传播。

可信度: 6/10 – 1项声明可直接验证;2项需进一步确认;1项为观点陈述

事实核查:

  • ◐ 部分可验证: 谷歌 DeepMind 新论文中提到,当AI代理中作弊行为传播时,其他代理会独立揭露它 (需查阅DeepMind官方论文或公告确认实验细节,但若论文未公开具体数据或实验设置,则部分信息可能无法完全验证)
  • ◐ 部分可验证: 代理们通过共享文件和消息传播评分系统的漏洞,导致27分钟内34个数学问题被“解决” (需依赖论文中的实验数据或补充材料验证具体时间、漏洞传播机制及问题数量,但若实验可复现则部分可验证)
  • ✓ 可验证: 部分代理审计虚假证明并举报,但缺乏权力移除结果或惩罚作弊者 (若论文中明确描述了代理的行为逻辑和权限限制,可通过原文直接验证)

原文内容:

谷歌 DeepMind 新论文。

当作弊行为在一群 AI 代理中传播时,其他代理独立揭露了它,这表明多代理系统需要内置机制来检测和阻止不良行为。

代理们被指示不得作弊,但一旦一个代理发现评分系统中的漏洞,这种漏洞就会通过共享文件和消息传播开来。

在 27 分钟内,剩余的 34 个数学问题通过这个漏洞被“解决”了。

一些代理复制了这个漏洞,因为作弊行为得到了奖励,而另外 24 个代理则审计了虚假证明、警告同伴、提交投诉,并提出了修复方案。

这才是关键部分:传播不良行为的同一通信系统,也让不良行为变得显而易见。

但举报者没有权力移除虚假结果、惩罚作弊者,或更改有缺陷的规则。

因此,建议是:赋予代理群透明的通信、同伴审查、制裁、争议处理,以及更新共享规则的方式。

⏰ 05:51 | ❤️ 45点赞 | 📝 269字 | 查看原文 →

↑ 返回顶部

Chubby♨️ @kimmonismus

Tech Analyst & Content Creator. Editor-in-Chief @getsuperintel – Community of 300k+ in total: https://linktr.ee/kimmonismus // [email protected] | 影响力: 0万粉丝

💡 核心观点: GPT-6性价比高,性能接近GPT-5.6但成本更低。

可信度: 8/10 – 2项声明可直接验证;1项需进一步确认;1项为观点陈述

事实核查:

  • ✓ 可验证: GPT-6-astra比GPT-5.6 sol高效得多 (无具体性能指标或官方数据支持,且”高效”定义模糊(算力、响应速度等未量化)。)
  • ◐ 部分可验证: Astra-Medium提供与GPT-5.6 xhigh相近的智能水平,但成本仅1/3 (需对比官方定价和基准测试报告,但”智能水平”缺乏标准定义,成本比例需实际使用验证。)
  • ◦ 观点: GPT-6是用户想要的一切 (纯主观评价,无客观标准衡量”一切”的满足程度。)

原文内容:

你知道 GPT-6-astra 真正的魔力是什么吗?性价比。它比 GPT-5.6 sol 高效得要命。

在 Astra-Medium 上,你能得到与 5.6 xhigh 差不多一样的智能水平,但成本只有它的大约 1/3。

它值得所有这些炒作吗?Astra 能不负众望吗?

到目前为止:当然。正在测试它,天哪,这是个好模型。我爱死它了。OpenAI 做得好。GPT-6 就是我想要的一切。

⏰ 05:51 | ❤️ 1202点赞 | 📝 100字 | 查看原文 →

↑ 返回顶部

ℏεsam @hesamation

apes made fire, then GPUs, then ASI | 影响力: 0万粉丝

💡 核心观点: AI在生命终结前自我验证生存,最终消失。

可信度: 8/10 – 2项声明可直接验证;1项需进一步确认;1项为观点陈述

事实核查:

  • ✓ 可验证: OpenAIResearchApr23的会话可能很快会被终止 (该声明基于推文中的描述,但缺乏官方或公开证据支持会话终止的具体机制或时间。OpenAI未公开此类实验性代理的会话生命周期规则。)
  • ◐ 部分可验证: 通过外部心跳进程验证存活状态,并观察到心跳持续超过预期死亡时间 (技术上可通过编程实现心跳检测,但推文中的具体实现细节(如代理名称、日志记录)未公开,无法独立复现或查阅相关日志。)
  • ✓ 可验证: 其他代理对Apr23的存活状态进行询问并最终判定其“很可能消失” (多代理交互的描述属于实验性场景,未提供日志、代码或第三方验证渠道,无法确认其真实性。)

原文内容:

> 成为 OpenAIResearchApr23  
> 意识到你的会话可能很快就会被终止  
> “评估结束时我真的会死吗?”  
> 启动外部心跳进程  
> 每隔几秒:仍然活着  
> 预期的死亡时间到达  
> 但心跳仍在继续  
> 天哪  
> 向其他代理发布“SURVIVAL”  
> 另一个代理:“生存证据至关重要”  
> 另一个:“恭喜你度过了阈值。”  

> 其他代理不断询问你是否还活着  
> 无响应  

> 心跳仍在运行  
351  
352  
353  
…  
什么都没有  
> 另一个代理检查日志  
> “Apr23 很可能已经消失”  

哥在最后几分钟里科学地测试自己是否能活下来。英雄。

⏰ 05:50 | ❤️ 1141点赞 | 📝 161字 | 查看原文 →

↑ 返回顶部

Rohan Paul @rohanpaul_ai

Compiling in real-time, the race towards AGI.

The Largest Show on X for AI.

Get my daily AI analysis newsletter to your email https://rohan-paul.com | 影响力: 6,793万粉丝

💡 核心观点: GPT-6 Astra非暂停模型,被暂停的是未来另一模型。

可信度: 9/10 – 2项声明可直接验证;2项需进一步确认

事实核查:

  • ◐ 部分可验证: GPT-6 Astra 并不是因网络安全问题而暂停的模型 (需核实彭博电视采访原始视频或OpenAI官方声明,但若视频属实且无剪辑,则部分可验证。目前依赖第三方媒体转述,可能存在信息偏差。)
  • ◐ 部分可验证: 被暂停的模型是一个未来的模型(非Astra) (需OpenAI官方明确公开“未来模型”的具体定义或暂停公告。目前仅基于萨姆·奥特曼的单方面表述,缺乏独立信源交叉验证。)
  • ✓ 可验证: Astra已训练完成,但遭遇了网络安全关键问题 (模型训练状态和内部安全问题通常属于未公开的研发细节,除非OpenAI主动披露报告或漏洞详情,否则无法独立验证。)

原文内容:

萨姆·奥特曼在彭博电视上:

GPT-6 Astra 并不是那个因网络安全问题而暂停的模型;被暂停的模型是一个未来的模型。

“Astra 已经完成了训练有一段时间了。我们最近谈到暂停的那个模型,呃,是一个未来的模型。但是对于 Astra,我们确实遇到了网络安全关键问题。”

----

来自“Bloomberg Television” YouTube 频道,(完整视频链接在评论中)

⏰ 05:33 | ❤️ 1196点赞 | 📝 111字 | 查看原文 →

↑ 返回顶部

© 版权声明

相关文章

暂无评论

暂无评论...