【AI 英文奏折】09月24日

x每日奏折18小时前发布 tianming
13 0 0

【AI 英文奏折】2026年09月24日

共收录 20 篇深度内容


📋 今日内容速览

快速浏览,点击感兴趣的推文查看详细分析

  1. jack friks: 犯错多也能创业成功,关键在持续迭代和探索。
  2. Marc Lou: 探索土耳其非旅游区,感受当地人热情与真实生活。
  3. Rohan Paul: AI成本快速下降,性能提升速度远超其他技术。
  4. Santiago Valdarrama: 开发速度提升后,产品决策成为新瓶颈。
  5. AshutoshShrivastava: Meta推出多款智能硬件及AI代理,包括可穿戴设备和助听器。
  6. Rohan Paul: AI需解决持久记忆压缩以提升个性化交互体验。
  7. Artificial Analysis: Claude Opus 5.5性能提升但成本增加
  8. Santiago Valdarrama: 融合数据库可统一处理多类型数据,解决分散存储难题。
  9. Rohan Paul: 中国拟限制国有数据中心使用博通交换机以确保硬件自主。
  10. Machina: Meta前员工推出全自动AI广告代理,可独立制作优化广告活动。
  11. Jerry Liu: LlamaExtract提供全球领先的复杂文档精准提取服务
  12. Artificial Analysis: 蚂蚁开源模型Ming-Image-0.1-Design登顶UI/UX设计领域榜首
  13. Rohan Paul: 数学领域AI使用率半年内激增,应用分布不均。
  14. Rohan Paul: Anthropic拟租1GW算力设施以摆脱云商控制,自管芯片与成本。
  15. Rohan Paul: 医疗代理需测试新能力并设置改进护栏以提升准确性。
  16. Venture Twins: 技术扩展艺术创作空间而非削弱技艺。
  17. Boris Cherny: Claude对关键代码建模找反例并修复疑似bug。
  18. SemiAnalysis: 巨额GPU云投资下,仅少数服务商能实现百倍扩容。
  19. Suchen Zang: 高AI标准突显突破价值,但需兼顾生物领域新人培养。
  20. Charly Wargnier: 免费课程教你构建自适应AI智能体的三大核心层。

📖 详细内容

jack friks @jackfriks

curious guy creating things @ http://jackfriks.com – up and coming wife guy | 影响力: 0万粉丝

💡 核心观点: 犯错多也能创业成功,关键在持续迭代和探索。

可信度: 6/10 – 1项声明可直接验证;1项需进一步确认;1项为观点陈述

事实核查:

  • ◦ 观点: 你可以做很多事情出错,甚至可能是大多数……但仍然能在建立企业的游戏中获胜 (该声明属于主观观点,表达了对创业过程中容错率的个人看法,缺乏具体数据或案例支撑,无法通过客观事实直接验证。)
  • ◐ 部分可验证: 日常迭代和在尝试中愿意发现新事物的态度,是推动事物向上向右发展的关键 (部分可验证,因“迭代”和“探索态度”对发展的影响可通过企业案例或管理学理论间接佐证(如精益创业模式),但“关键”一词属于主观判断,且缺乏具体背景或数据,无法完全验证。)
  • ✓ 可验证: 这是我随着时间推移学到的东西 (个人经验总结,属于非公开的认知过程,无法通过外部信息验证其真实性或普适性。)

原文内容:

你可以做很多事情出错,甚至可能是大多数……但仍然能在建立企业的游戏中获胜

这是我随着时间推移学到的东西。日常迭代和在尝试中愿意发现新事物的态度,是推动事物向上向右发展的关键

⏰ 03:23 | ❤️ 101点赞 | 📝 80字 | 查看原文 →

↑ 返回顶部

Marc Lou @marclou

http://TrustMRR.com $44K/m
http://DataFa.st $26K/m
http://SHlPORDIE.com $13K/m
http://CodeFa.st $6K/m
http://ShipFa.st $4K/m
http://IndiePa.ge $1K/m

+29 http://marclou.com | 影响力: 1,236万粉丝

💡 核心观点: 探索土耳其非旅游区,感受当地人热情与真实生活。

可信度: 6/10 – 1项声明可直接验证;1项需进一步确认;1项为观点陈述

事实核查:

  • ◐ 部分可验证: 在塞浦路斯的家里了,在土耳其待了10天后回来了 (可通过用户社交媒体历史(如定位、照片时间戳)或出入境记录间接验证,但需用户主动公开或第三方数据支持,普通公众无法直接核实。)
  • ✓ 可验证: 探索了远离繁忙伊斯坦布尔的原始土耳其,当地人请喝土耳其茶并赠送无花果 (描述的是个人旅行经历和互动细节,缺乏客观记录(如照片、第三方见证),属于主观体验,无法独立验证。)
  • ◦ 观点: 巴克拉瓦太好吃了,我每天都吃了好几个 (纯属个人口味偏好和饮食选择,无客观事实依据,属于主观感受表达。)

原文内容:

我在塞浦路斯的家里了,在土耳其待了10天后回来了

我们在非旅游区迷路了,探索了远离繁忙伊斯坦布尔的原始土耳其。

土耳其人真是太善良、太热情了!人们会主动和我们聊天,问我们从哪里来,还请我们喝土耳其茶。有人甚至把从树上摘的无花果送给了我们

我们没做什么特别的事。只是漫步在当地社区。那是我最喜欢的旅行方式,因为你能真正看到人们的生活。

我通常不会破坏我的饮食计划,但巴克拉瓦太好吃了,我每天都吃了好几个

Teşekkürler Türkiye!

⏰ 10:39 | ❤️ 100点赞 | 📝 180字 | 查看原文 →

↑ 返回顶部

Rohan Paul @rohanpaul_ai

Compiling in real-time, the race towards AGI.

The Largest Show on X for AI.

Get my daily AI analysis newsletter to your email https://rohan-paul.com | 影响力: 6,793万粉丝

💡 核心观点: AI成本快速下降,性能提升速度远超其他技术。

可信度: 7/10 – 1项声明可直接验证;3项需进一步确认

事实核查:

  • ◐ 部分可验证: OpenAI的o3模型在GPQA Diamond基准上每题成本为0.30美元(75%得分),而GPT-5.6 Luna在18个月后以0.0004美元达到相同水平,成本降低725倍 (需查阅Epoch的原始报告或OpenAI官方发布的模型性能与成本数据,但具体模型(如o3、GPT-5.6 Luna)的命名和测试细节可能非公开,且基准测试方法(如GPQA Diamond)需第三方确认。)
  • ◐ 部分可验证: 自2023年以来,达到固定基准分数的成本每季度下降约47%,相当于年度成本降低13倍 (依赖Epoch的研究方法和数据公开程度,需核查其发布的报告或基准测试原始数据,但“固定基准分数”定义和计算方式可能缺乏标准化。)
  • ✓ 可验证: AI成本下降速度比电力快54倍,比电池快18倍,比计算快6倍,比DNA测序快4倍 (比较涉及多领域历史数据(如电力、电池技术发展速率),需跨学科权威研究支持,且“快X倍”的量化标准未明确,难以直接验证。)

原文内容:

AI 成本确实在急剧下降。

在 GPQA Diamond 上,Epoch 估计 OpenAI 的 o3 模型需要大约 0.30 美元每题才能达到 75% 的得分。

不到 18 个月后,GPT-5.6 Luna 以 0.0004 美元的价格达到了相同水平,成本降低了 725 倍。

总体而言,Epoch 估计自 2023 年以来,达到固定基准分数每季度变得便宜约 47%。

这相当于其五个主要基准测试的年度成本降低了约 13 倍。

与早期的 token 价格研究不同,Epoch 衡量的是随着时间推移达到相同基准准确度所需的美元。

它通过在更严格的 token 预算下重放基准记录来估计每个模型的成本-性能曲线,使用了从 CAISI 改编的方法。

AI 的下降速度比电力快 54 倍,比电池快 18 倍,比计算快 6 倍,比 DNA 测序快 4 倍。

⏰ 14:13 | ❤️ 109点赞 | 📝 203字 | 查看原文 →

↑ 返回顶部

Santiago Valdarrama @svpino

计算机科学家。我在 https://ml.school 教授硬核人工智能/机器学习工程。YouTube:https://youtube.com/@underfitted | 影响力: 0万粉丝

💡 核心观点: 开发速度提升后,产品决策成为新瓶颈。

可信度: 8/10 – 2项声明可直接验证;1项需进一步确认;1项为观点陈述

事实核查:

  • ◐ 部分可验证: 编码不再是许多团队的瓶颈 (需结合具体团队的技术能力、工具使用和项目背景验证,缺乏普适性数据支持,但可通过行业报告或案例部分验证。)
  • ◦ 观点: 产品经理成为更大的瓶颈,因为快速开发时需要更高效的产品决策 (基于演讲者主观观察,无直接数据或公开研究支持,属于对行业趋势的观点陈述。)
  • ✓ 可验证: 《产品决策的新成本》是 Atlassian 首席产品与 AI 官和 Lovable 增长主管在 AI SDLC 数字峰会的讨论主题 (可通过提供的链接(https://fandf.co/4rs2XLc)或峰会公开议程直接验证演讲者身份及内容。)

原文内容:

对许多团队而言,编码已不再是瓶颈,但如何决策构建内容仍需借助代理机制。

当执行速度被压缩至机器级时,新浮现的瓶颈在于能否以同等速度做出正确决策。

Atlassian首席产品与AI官@TYehoshua与Lovable增长主管@ElenaVerna在AI SDLC数字峰会的对话《产品决策的新成本》精准阐释了这一现象:"产品经理正成为更显著的瓶颈——当开发速度如此迅猛时,你必须精准选择开发内容并确保决策的正确性。"

强烈推荐观看该环节完整内容:
https://fandf.co/4rs2XLc

除Tamar和Elena的对话外,峰会还包含Atlassian、Vercel、Honeycomb、Dropbox、1Password、Lovable及DX等企业高管的分享环节。

感谢@Atlassian团队与我共同完成本文撰写。

⏰ 22:20 | ❤️ 31点赞 | 📝 218字 | 查看原文 →

↑ 返回顶部

AshutoshShrivastava @ai_for_success

Post about latest AI news, tools, tutorials and memes. | 影响力: 0万粉丝

💡 核心观点: Meta推出多款智能硬件及AI代理,包括可穿戴设备和助听器。

可信度: 10/10 – 3项声明可直接验证;2项需进一步确认

事实核查:

  • ✓ 可验证: Meta在Meta Connect上宣布了Muse Charm、VR眼镜、无摄像头音频眼镜框、FDA认证助听器以及新Muse代理 (可通过Meta Connect官方活动回放、新闻稿或Meta官网公告直接验证产品发布信息)
  • ◐ 部分可验证: Muse Charm是一款专为移动中使用Muse代理设计的掌上型5G硬件设备,可挂在钥匙链上,支持语音连接 (产品功能描述需依赖官方规格说明或实测验证,但设计用途和基本特性可通过官网或宣传材料部分确认)
  • ✓ 可验证: Muse Charm将于本月十二月发货,正好赶上节日 (发货时间属于公开承诺,可通过官方预售页面、公告或后续用户收货反馈验证)

原文内容:

META 强势回归了……他们刚刚在 Meta Connect 上宣布了 Muse Charm、VR 眼镜、无摄像头音频眼镜框、FDA 认证助听器,以及他们的新 Muse 代理。

以下是你需要了解的一切:

1/ Muse Charm:一款专为移动中使用 Muse 代理而设计的掌上型 5G 硬件设备。 可直接挂在您的钥匙链上,让您无需掏出手机即可与代理进行语音连接。本月十二月发货,正好赶上节日。

⏰ 10:14 | ❤️ 45点赞 | 📝 114字 | 查看原文 →

↑ 返回顶部

Rohan Paul @rohanpaul_ai

Compiling in real-time, the race towards AGI.

The Largest Show on X for AI.

Get my daily AI analysis newsletter to your email https://rohan-paul.com | 影响力: 6,793万粉丝

💡 核心观点: AI需解决持久记忆压缩以提升个性化交互体验。

可信度: 4/10 – 2项需进一步确认;1项为观点陈述

事实核查:

  • ◐ 部分可验证: 持久代理记忆是企业中一个主要的未解决难题 (该声明涉及技术领域的现状,可通过查阅AI或企业级代理系统的研究论文、行业报告(如Gartner等)部分验证其普遍性,但“主要难题”的定性可能因领域或企业需求差异而存在主观判断。)
  • ◐ 部分可验证: 模型目前无法有效压缩长期对话记忆以保持连贯性和个性化 (可通过测试现有大模型(如GPT-4)的长期记忆能力或分析其技术文档(如上下文窗口限制)验证部分内容,但“真正改变产品本质”属于推测性主张,需依赖未来技术发展验证。)
  • ◦ 观点: 理想的代理应能通过记忆压缩让用户感觉像与真实的人互动 (该声明是主观愿景,涉及用户体验目标(“感觉像真实的人”),无客观标准,属于对AI交互发展的期望而非可验证事实。)

原文内容:

持久代理记忆是企业中一个主要的未解决难题。

- 加布·斯滕格尔,Rogo(华尔街AI联合创始人)

@patrick_oshag: “模型目前无法做到的某件事,如果它们能做到,会真正改变产品的本质是什么?”

@GabeStengel: “压缩。如果你与单个代理进行了100次对话,它如何确保它真正记住正确的事情,并将其记忆压缩到每次都能使用的令牌数量,同时保持足够的连贯性和上下文,了解你是谁以及你关心什么,从而让你感觉它是一个真正的人,一个与你交谈并越来越了解你的人?”

----
(完整播客链接在下面的引用推文中)

⏰ 13:44 | ❤️ 46点赞 | 📝 186字 | 查看原文 →

↑ 返回顶部

Artificial Analysis @artificialanlys

Independent analysis of AI | 影响力: 0万粉丝

💡 核心观点: Claude Opus 5.5性能提升但成本增加

可信度: 10/10 – 2项声明可直接验证;3项需进一步确认

事实核查:

  • ◐ 部分可验证: Claude Opus 5.5 在 Artificial Analysis Coding Agent Index 中成为新的 #1,在所有三个评估中均有提升 (需查看 Artificial Analysis 的官方报告或基准测试结果以确认排名和具体得分提升,但若无公开数据来源则无法完全验证。)
  • ✓ 可验证: Opus 5.5 的每任务成本为 $13.04,比 Opus 5 的 $10.79 高出 21% (可通过 Anthropic 官方定价文档或 API 计费明细验证定价变化,但需实际任务测试确认具体令牌消耗差异。)
  • ◐ 部分可验证: Opus 5.5 在 Terminal-Bench 4.0 上的表现从 54.5% 提升至 63.1%(+8.6 个百分点) (需依赖 Terminal-Bench 的官方评估数据或第三方复现结果,若测试细节未公开则无法独立验证。)

原文内容:

Claude Opus 5.5 在 Artificial Analysis Coding Agent Index 中成为新的 #1,在所有三个评估中均有提升,尽管每任务成本更高

在 Claude Code 的最大努力模式下,Opus 5.5 在 Coding Agent Index 中的得分达到 66,这是我们测得的最高分。它比 Opus 5(60 分)提高了 6 分,比 Claude Fable 5.1(62 分)提高了 4 分。

Anthropic 已将 Opus 定价降至每百万输入/输出令牌 $4/$20,而 Opus 5 为 $5/$25,缓存读取降至 $0.20,而非 $0.50。尽管有这些降幅,Opus 5.5 的每任务成本仍为 $13.04,高于 Opus 5 的 $10.79,因为它使用了大幅更多的令牌。

关键要点:

➤ 在所有三个 Coding Agent Index 评估中均有改进:Terminal-Bench 4.0 从 Opus 5 的 54.5% 上升至 63.1%,DeepSWE v1.1 从 62.5% 上升至 68.4%,SWE-Atlas-QnA 从 62.1% 上升至 66.4%。最大的提升出现在 Terminal-Bench 上,达 +8.6 个百分点。

➤ 最高分伴随着最高的每任务成本:Opus 5.5 的每任务成本为 $13.04,比 Opus 5 的 $10.79 高出 21%。它每任务使用约 1560 万令牌,而 Opus 5 为 1140 万令牌,包括输出令牌约多 2.4 倍。

➤ 扩展了 Coding Agent Index 与每任务成本的帕累托前沿:我们比较中没有更低成本的模型能匹配 Opus 5.5 的得分。它将前沿在高成本端向上推动。

其他模型细节:

➤ 定价:每百万输入/输出令牌 $4/$20,比 Opus 5 下降 20%。缓存读取每百万 $0.20,比 $0.50 下降 60%。

➤ 评估设置:Claude Code 在最大努力模式下,在 DeepSWE v1.1、Terminal-Bench 4.0 和 SWE-Atlas-QnA 上进行测量。Coding Agent Index 对每个评估给予等权重。

⏰ 09:24 | ❤️ 284点赞 | 📝 321字 | 查看原文 →

↑ 返回顶部

Santiago Valdarrama @svpino

计算机科学家。我在 https://ml.school 教授硬核人工智能/机器学习工程。YouTube:https://youtube.com/@underfitted | 影响力: 0万粉丝

💡 核心观点: 融合数据库可统一处理多类型数据,解决分散存储难题。

可信度: 10/10 – 2项声明可直接验证;2项需进一步确认;1项为观点陈述

事实核查:

  • ◐ 部分可验证: 现代应用程序需要存储结构化数据、JSON 文档、关系、向量嵌入、空间数据和文本。 (该声明部分可验证,因为现代应用程序确实常需处理多种数据类型,但具体需求因场景而异,需结合实际案例或行业报告验证普遍性。)
  • ◐ 部分可验证: “融合数据库”可以统一处理关系数据、JSON 文档和向量,支持单个事务、组合查询和同步更新。 (部分可验证,需通过技术文档(如链接文章)或实测确认具体功能实现,但“融合数据库”是否为行业通用术语或成熟方案尚需考证。)
  • ◦ 观点: 使用分散系统(如RDBMS、向量数据库、NoSQL)会导致同步和故障协调的噩梦。 (主观观点,反映了作者对多系统架构的负面评价,但实际体验因团队能力和工具链而异,无普适性数据支持。)

原文内容:

我们不太够谈论这个,但我们一直熟知的数据库已经死了。

现代应用程序需要存储结构化数据、JSON 文档、关系、向量嵌入、空间数据和文本。

到目前为止,大多数人使用的解决方案是将数据分散到不同的系统中:

• 关系数据放入 RDBMS
• 嵌入放入向量数据库
• JSON 文档放入 NoSQL 数据库

相信我,这是一场噩梦。

你不想在所有这些系统中同步更新并协调故障。

解决方案:“融合数据库”。

以下是融合数据库的工作原理:

1. 你可以将相关更改保存在单个事务中。每项更改要么全部成功,要么全部失败。

2. 你的查询可以组合关系数据、JSON 文档和向量。

3. 你的数据中的所有更改始终保持同步。你不需要等待它们赶上。

4. 无论你如何搜索数据以及检索哪些字段,你的权限都会生效。

5. 你可以处理同一数据的不同视图。例如,你可以将客户数据返回为 JSON 文档或关系数据。

想象一下,你正在构建一个代理来管理和支持工单。对于任何给定的操作,这个代理需要相似性搜索、当前工单状态、客户信息和权限检查。

有了融合数据库,你的代理可以将所有这些要求组合成单个查询。

这意味着更快的查询、更少的同步管道,以及代码中更少的协调。

这里有一篇关于融合数据库的非常好的文章:
https://fandf.co/4rj8d3F

感谢 Oracle 团队与我合作撰写这篇文章。

⏰ 21:10 | ❤️ 73点赞 | 📝 432字 | 查看原文 →

↑ 返回顶部

Rohan Paul @rohanpaul_ai

Compiling in real-time, the race towards AGI.

The Largest Show on X for AI.

Get my daily AI analysis newsletter to your email https://rohan-paul.com | 影响力: 6,793万粉丝

💡 核心观点: 中国拟限制国有数据中心使用博通交换机以确保硬件自主。

可信度: 9/10 – 2项声明可直接验证;2项需进一步确认

事实核查:

  • ◐ 部分可验证: 中国正在权衡对博通交换机的限制,这些交换机可能占国有数据中心部署的90% (该声明涉及政策动向和市场份额数据,需通过中国国资委或官方文件验证政策意图,但“90%”这一数据可能来自行业报告或内部统计,公开渠道难以直接确认。)
  • ◐ 部分可验证: 中国国务院国有资产监督管理委员会最近几周一直在调查国有数据中心对博通的使用情况 (国资委是否开展此类调查需通过官方公告或权威媒体报道确认,但若未公开细节则难以完全验证。)
  • ✓ 可验证: 审查针对AI基础设施的关键一层:高速交换机,这些交换机在训练和推理过程中在加速器之间传输数据 (高速交换机在AI基础设施中的作用是公开的技术事实,可通过行业技术文档或专家分析验证。)

原文内容:

FT:中国对硬件自主性的关注如此之多。现在,它正在权衡对博通交换机的限制,这些交换机可能占国有数据中心部署的90%。

中国国务院国有资产监督管理委员会最近几周一直在调查国有数据中心对博通的使用情况。

这项审查针对AI基础设施的关键一层:高速交换机,这些交换机在训练和推理过程中在加速器之间传输数据。

⏰ 13:26 | ❤️ 73点赞 | 📝 131字 | 查看原文 →

↑ 返回顶部

Machina @exm7777

running ai-powered agencies | http://weeklyaiops.com | 影响力: 665万粉丝

💡 核心观点: Meta前员工推出全自动AI广告代理,可独立制作优化广告活动。

可信度: 8/10 – 1项声明可直接验证;3项需进一步确认;1项为观点陈述

事实核查:

  • ◐ 部分可验证: 一位前 Meta 员工亲手打造了 Meta 广告系统,并推出了一款全自动运行广告活动的 AI 代理工具 (可通过 LinkedIn 或公开履历验证此人是否曾在 Meta 参与广告系统开发,但需依赖其自我披露或第三方确认;AI 代理工具的功能需实测或官方文档验证。)
  • ◐ 部分可验证: 该 AI 代理能自动制作静态广告、UGC 广告和 VSL 广告,并配备 B-roll 素材 (工具是否存在可通过官网或演示验证,但“全自动制作”需实测确认生成质量和合规性(如版权问题)。)
  • ✓ 可验证: 代理能扫描 Meta 广告库提取竞争对手的获胜广告,并优化自身广告 (Meta 广告库的竞争对手数据访问权限通常受限,此功能是否合规或真实实现缺乏公开证据。)

原文内容:

一位前 Meta 员工,他亲手打造了 Meta 广告系统,刚刚推出了一款代理工具,可以全自动运行整个广告活动……

这款 AI 代理只需一条提示,就能制作静态广告、UGC 广告和 VSL 广告,并配上 B-roll 素材

然后它会独自运行整个活动:

- 从 Meta 广告库扫描竞争对手广告,在制作任何广告前提取该领域的获胜广告
- 确定他们使用的角度中你尚未涉及的部分
- 基于获胜广告进行构建和优化
- 将制作的广告推送到 Meta 广告账户
- 按分钟收集和审查数据
- 根据这些数据提出广告建议
- 24/7 全天候运行,无需人工输入
整个营销团队都被其超越

试试这个,然后告诉我结果如何

⏰ 02:47 | ❤️ 384点赞 | 📝 210字 | 查看原文 →

↑ 返回顶部

Jerry Liu @jerryjliu0

解析世界上最难处理的 PDF @llama_index。公司联合创始人/首席执行官

职业机会:https://llamaindex.ai/careers
企业服务:https://llamaindex.ai/contact | 影响力: 0万粉丝

💡 核心观点: LlamaExtract提供全球领先的复杂文档精准提取服务

可信度: 9/10 – 2项声明可直接验证;2项需进一步确认

事实核查:

  • ◐ 部分可验证: 我们已经构建了世界上最先进的复杂文档提取引擎 (需通过实际测试或第三方基准数据验证其“最先进”的宣称,但官网可能提供技术文档或案例支持部分功能描述。)
  • ◐ 部分可验证: LlamaExtract Agentic Plus 可处理长表格、巨型表单、校准的置信度分数及可靠提取 (功能描述可通过官网演示视频或试用版部分验证,但“可靠提取”等性能需实际用例或用户反馈确认。)
  • ✓ 可验证: 现有供应商无法满足复杂文档提取需求时,可联系其解决 (依赖用户主观体验和未公开的供应商对比数据,无法直接验证。)

原文内容:

我们打造了全球最先进的复杂文档解析引擎

下方视频展示了LlamaExtract Agentic Plus的实际应用场景:超长表格、巨型表单、精准置信度评分,以及稳定可靠的信息提取。

若您遇到现有供应商无法处理的复杂文档解析需求,欢迎随时联系我们:
https://llamaindex.ai/promo/switch

立即注册LlamaParse:

⏰ 08:35 | ❤️ 71点赞 | 📝 96字 | 查看原文 →

↑ 返回顶部

Artificial Analysis @artificialanlys

Independent analysis of AI | 影响力: 0万粉丝

💡 核心观点: 蚂蚁开源模型Ming-Image-0.1-Design登顶UI/UX设计领域榜首

可信度: 10/10 – 2项声明可直接验证;3项需进一步确认

事实核查:

  • ◐ 部分可验证: Ming-Image-0.1-Design 是 Artificial Analysis 文本到图像排行榜上 UI/UX 设计领域的 #1 开源权重模型 (需查看 Artificial Analysis 的官方排行榜数据,但若该平台公开且排名信息可查,则可通过其官网验证。若平台未公开具体排名方法或数据,则为部分可验证。)
  • ✓ 可验证: Ming-Image-0.1-Design 是蚂蚁集团 inclusionAI 计划推出的 6B 参数文本到图像模型 (可通过 inclusionAI 或蚂蚁集团的官方开源页面(如 GitHub)验证模型参数、许可证(MIT)及发布信息。)
  • ◐ 部分可验证: 该模型在 UI/UX 设计类别 81 个模型中排名第 17,整体 160 个模型中排名第 45 (依赖 Artificial Analysis 的公开排名数据。若平台提供详细分类和排名规则则可验证,否则需实测或依赖第三方分析。)

原文内容:

inclusionAI推出的Ming-Image-0.1-Design模型在Artificial Analysis文本到图像排行榜的UI/UX设计领域位列开源权重模型第一,同时在该类别全部模型中排名第17位。

这款由蚂蚁集团AI计划inclusionAI发布的6B参数文本生成图像模型,专为UI界面、信息图表、海报等富含文本的视觉设计场景打造,支持RGBA格式输出及透明背景,并以MIT开源协议发布。我们采用inclusionAI推荐配置,在2K分辨率下通过12步推理对其进行了系统评估。

Ming-Image-0.1-Design在文本生成图像模型的UI/UX设计能力评估中表现卓越:在81个UI/UX设计模型中排名第17位,同时在160个全品类文本生成图像模型中位列第45名。作为开源权重模型,它已成为UI/UX设计用例的新标杆。

祝贺@AntLingAGI团队成功发布!

下方展示我们在Artificial Analysis图像竞技场中对Ming-Image-0.1-Design的分析案例及输出示例

⏰ 08:26 | ❤️ 48点赞 | 📝 222字 | 查看原文 →

↑ 返回顶部

Rohan Paul @rohanpaul_ai

Compiling in real-time, the race towards AGI.

The Largest Show on X for AI.

Get my daily AI analysis newsletter to your email https://rohan-paul.com | 影响力: 6,793万粉丝

💡 核心观点: 数学领域AI使用率半年内激增,应用分布不均。

可信度: 6/10 – 1项声明可直接验证;2项需进一步确认

事实核查:

  • ◐ 部分可验证: 在不到6个月的时间里,数学领域披露的AI使用率从1.39%上升到14.09%。 (需通过访问arXiv论文数据库并统计2026年3月1日至8月20日期间数学相关论文的AI使用披露数据。若原始数据或统计方法未公开,则无法完全复现结果。)
  • ✓ 可验证: 作者们扫描了2026年3月1日至8月20日发布的32,944篇与数学相关的arXiv论文。 (可通过arXiv官网的论文检索功能,按时间范围和学科分类筛选并验证论文总数是否匹配。)
  • ◐ 部分可验证: AI在数学领域的传播并不均匀:组合数学整体上拥有最多AI辅助论文,而度量几何在其自身论文中AI使用比例最高。 (需分别统计组合数学和度量几何领域的论文数量及AI使用比例,但若细分领域分类或AI标注标准不明确,可能影响验证准确性。)

原文内容:

在不到6个月的时间里,数学领域披露的AI使用率从1.39%上升到14.09%。

作者们扫描了2026年3月1日至8月20日发布的32,944篇与数学相关的arXiv论文。

证明构建是最大的类别,出现在1,225篇论文中。

AI在数学领域的传播并不均匀:组合数学整体上拥有最多AI辅助论文,而度量几何在其自身论文中AI使用比例最高。

⏰ 12:23 | ❤️ 22点赞 | 📝 109字 | 查看原文 →

↑ 返回顶部

Rohan Paul @rohanpaul_ai

Compiling in real-time, the race towards AGI.

The Largest Show on X for AI.

Get my daily AI analysis newsletter to your email https://rohan-paul.com | 影响力: 6,793万粉丝

💡 核心观点: Anthropic拟租1GW算力设施以摆脱云商控制,自管芯片与成本。

可信度: 6/10 – 1项声明可直接验证;2项需进一步确认;1项为观点陈述

事实核查:

  • ◐ 部分可验证: Anthropic 正在初步谈判,从一家由 Apollo Global Management(APO)控股的数据中心开发商那里租赁高达 1GW 的计算能力。 (可通过 Anthropic 或 Apollo Global Management 的官方公告或财报验证谈判的存在,但具体细节(如 1GW 的计算能力)可能因商业机密无法完全确认。)
  • ✓ 可验证: Stream 由 Apollo 控股,该公司曾在 2025 年表示,该运营商控制着超过 4 GW 的带电土地。 (可通过 Apollo Global Management 或 Stream 的公开声明、财报或行业报告验证控股关系和带电土地数据。)
  • ◐ 部分可验证: Anthropic 可能会用与 Broadcom 共同设计的 Google TPU 填充这些设施,同时 Nvidia GPU 也在讨论之中。 (可通过 Anthropic、Google 或 Broadcom 的官方合作声明验证 TPU 的使用,但“正在讨论”的 Nvidia GPU 需依赖内部消息,难以完全验证。)

原文内容:

Anthropic正就租用高达1吉瓦(1GW)计算能力的事宜进行初步谈判,潜在合作方为阿波罗全球管理公司(Apollo Global Management, APO)控股的数据中心开发商Stream。

——The Information报道

由阿波罗控股的Stream运营商曾在2025年透露,其掌控着超4吉瓦(4GW)已通电土地资源。

报告显示,Anthropic可能采用与博通(Broadcom)联合设计的谷歌TPU芯片来部署这些设施,同时英伟达GPU方案也在考虑范围内。

此举意味着Anthropic正试图绕过传统云服务供应商的中间环节,此举或将使其在芯片供应、硬件配置及成本控制方面获得更大自主权,但也需自行承担更多融资与运营责任。

⏰ 11:41 | ❤️ 60点赞 | 📝 141字 | 查看原文 →

↑ 返回顶部

Rohan Paul @rohanpaul_ai

Compiling in real-time, the race towards AGI.

The Largest Show on X for AI.

Get my daily AI analysis newsletter to your email https://rohan-paul.com | 影响力: 6,793万粉丝

💡 核心观点: 医疗代理需测试新能力并设置改进护栏以提升准确性。

可信度: 8/10 – 1项声明可直接验证;3项需进一步确认;1项为观点陈述

事实核查:

  • ◐ 部分可验证: 斯坦福和牛津大学的新论文MedRSI表明,医疗代理可以从自己的错误中改进自身,但前提是新能力在应用于新患者之前必须经过测试。 (可通过查找斯坦福和牛津大学发表的论文(如arXiv或期刊)验证该研究是否存在,但需进一步阅读论文内容以确认具体结论是否与推文描述一致。)
  • ◐ 部分可验证: 论文揭示自我改进需要护栏,如果每个有前景的工具都立即添加,准确率会下降(第30轮使用57个工具时为76.9%);而通过更慢的注册,代理仅保留18个工具并保持94.4%的准确率。 (论文中若包含实验数据和对比结果(如工具数量与准确率的关系),则可验证该声明,但需依赖论文公开的具体数据。若论文未公开详细数据,则无法完全验证。)
  • ◐ 部分可验证: 医疗代理对可能造成更大临床危害的错误投入更多精力,而非仅关注最常见错误。 (需验证论文是否明确提到代理的优先级设计逻辑(如危害评估机制),但可能涉及算法细节,需依赖作者公开的模型或代码。)

原文内容:

斯坦福+牛津大学新论文 MedRSI 表明,医疗代理可以从自己的错误中改进自身,但前提是新能力在应用于新患者之前必须经过测试。

显示自我改进的代理需要两件事:关注有害失败,并拒绝保留新能力,直到它们在后续案例中有效。

更重要的是,该论文揭示了为什么自我改进需要护栏。

如果每个有前景的工具都立即添加,准确率最终会下降:在第 30 轮使用 57 个工具时为 76.9%。

通过更慢的注册,代理仅保留了 18 个工具,并保持了 94.4%。

它还对可能造成更大临床危害的错误投入更多精力,而不是仅仅最常见的错误。

让代理积极发明,但通过反复独立的评估来让永久的自我改变赢得其位置。

⏰ 11:27 | ❤️ 41点赞 | 📝 230字 | 查看原文 →

↑ 返回顶部

Venture Twins @venturetwins

Partner @a16z AI and twin to @omooretweets | Investor in @elevenlabs, @bfl_ml, @hedra_labs, @krea_ai, @heyglif, @ShizukuAILabs, @wabi, @TownAI | 影响力: 986万粉丝

💡 核心观点: 技术扩展艺术创作空间而非削弱技艺。

可信度: 6/10 – 1项声明可直接验证;1项需进一步确认;1项为观点陈述

事实核查:

  • ✓ 可验证: 迪士尼动画从纯手工绘制动画转向CGI (迪士尼动画制作技术的转变是公开的行业历史,可通过迪士尼官方发布的纪录片、媒体报道或行业分析文章验证。)
  • ◐ 部分可验证: 技术扩展了画布,给了艺术家更大的创作空间 (这一声明部分可验证,因为技术进步对艺术创作的影响可以通过艺术家访谈或行业案例研究佐证,但“更大创作空间”是主观描述,难以量化。)
  • ◦ 观点: 娱乐业传奇人物撰写的出色文章 (“出色”是主观评价,无法客观验证;作者是否为“传奇人物”取决于公众认知,缺乏统一标准。)

原文内容:

娱乐业传奇人物撰写的出色文章。

我很喜欢这篇讲述迪士尼动画如何从纯手工绘制动画转向CGI以及这带来了什么突破的故事。

“技术并没有削弱技艺,它扩展了画布。它给了艺术家们更大的创作空间。”

⏰ 07:29 | ❤️ 45点赞 | 📝 81字 | 查看原文 →

↑ 返回顶部

Boris Cherny @bcherny

Claude Code @anthropicai | 影响力: 0万粉丝

💡 核心观点: Claude对关键代码建模找反例并修复疑似bug。

可信度: 10/10 – 2项声明可直接验证;2项需进一步确认;1项为观点陈述

事实核查:

  • ◐ 部分可验证: Claude构建程序模型,针对棘手的状态机或容易发生竞争条件的代码部分 (需实测或查看Claude的官方技术文档(若存在)确认其是否具备程序建模能力,但建模目标(如“棘手状态机”)的界定具有主观性。)
  • ◐ 部分可验证: Claude在模型中找到反例并将其视为疑似bug (形式化方法工具通常支持反例生成,但具体是否由Claude实现需依赖官方披露的案例或用户实测验证。)
  • ✓ 可验证: Claude能重现并修复模型中发现的反例(bug) (修复能力需实际测试或查看Claude的代码修改记录,目前推文未提供具体案例或第三方验证。)

原文内容:

给形式化方法专家的更多细节——发生的事情是 Claude 在做类似这样的事情:

1. 构建程序模型,针对棘手的状态机或容易发生竞争条件的代码部分
2. 在模型中找到反例。这些是疑似 bug
3. 重现这些 bug
4. 在代码中修复这些 bug

并不是整个代码库都经过形式化验证(至少目前还没有!……),而是代码中最棘手部分被建模、检查反例并修复。

⏰ 07:09 | ❤️ 55点赞 | 📝 124字 | 查看原文 →

↑ 返回顶部

SemiAnalysis @semianalysis_

In-depth research on semiconductors, AI infra & hardware | 影响力: 0万粉丝

💡 核心观点: 巨额GPU云投资下,仅少数服务商能实现百倍扩容。

可信度: 10/10 – 2项声明可直接验证;2项需进一步确认;1项为观点陈述

事实核查:

  • ✓ 可验证: 7万亿美元即将被投入到GPU云服务中,每个提供商都被要求在一夜之间扩大100倍。 (该声明涉及未明确来源的巨额资金投入和极端扩张要求,缺乏具体机构、时间或公开数据支持,可能为夸张表述或内部预测,无法通过公开渠道验证。)
  • ◐ 部分可验证: ClusterMAX 3.0花了三个月时间对77个GPU云服务进行测试并排名。 (若ClusterMAX 3.0是公开的研究项目或报告,其测试范围和方法可能通过官网或发布渠道部分验证,但具体测试数据、排名标准需依赖报告全文,目前信息不足。)
  • ◦ 观点: “现在业内几乎每个人看起来都像个天才。” (此为受访者的主观评价,反映个人对行业现状的看法,无客观事实依据,属于观点陈述。)

原文内容:

7万亿美元即将被投入到GPU云服务中,每个提供商都被要求在一夜之间扩大100倍。ClusterMAX 3.0花了三个月时间找出谁真正能做到这一点。

SemiAnalysis Weekly第033期已上线。Jordan Nanos (@JordanNanos) 与刚完成对77个GPU云服务的测试的Sam Harshe (@sharshe02) 和Pratt Bhatt (@PrathmeshBhat19) 坐下来畅谈:新的排名、健康检查、缓存命中率、NCCL、集群上的代理程序、一个Linux内核漏洞、安全性、融资和后备方案、H100s,以及托管RL训练。

“今天其实是我测试开始以来第一次见到阳光。”
 “这次我们对77个提供商进行了排名。”
 “现在业内几乎每个人看起来都像个天才。”
 “不可能吧。我以为你可以在推理业务上轻松赚到80%的利润,对吧?”
 “明年你的Vera Rubin项目要信任谁?”

⏰ 07:00 | ❤️ 73点赞 | 📝 201字 | 查看原文 →

↑ 返回顶部

Suchen Zang @suchenzang

Always hungry for intelligence. | 影响力: 1,373万粉丝

💡 核心观点: 高AI标准突显突破价值,但需兼顾生物领域新人培养。

可信度: 6/10 – 1项声明可直接验证;1项需进一步确认;1项为观点陈述

事实核查:

  • ◦ 观点: AI发现全新生物机制是了不起的大事 (这是主观评价,表达对AI未来潜力的期待,无客观事实依据)
  • ✓ 可验证: 后经济时代需吸引新人进入生物矿场 (“后经济时代”和“生物矿场”为模糊比喻,无具体定义或数据支持,无法验证)
  • ◐ 部分可验证: 经验丰富的人忙于数十家CRISPR相关生物技术公司 (CRISPR行业公司数量可通过公开数据查证,但“忙于”涉及主观判断,需具体从业者调研)

原文内容:

> 我宁愿他们现在就把标准定得很高,这样当一个AI真正发现一种全新的生物机制时,每个人都会意识到这是一件多么了不起的大事。

我的意思是,是的,但也有不是的时候,当你处于后经济时代并表演以吸引新人进入生物矿场时!

(现有的经验丰富的人似乎都忙于数十家与CRISPR相关的生物技术公司,唉)

⏰ 06:59 | ❤️ 35点赞 | 📝 121字 | 查看原文 →

↑ 返回顶部

Charly Wargnier @datachaz

前 @Streamlit @Snowflake 大师 • 我写关于 AI 代理、大语言模型和自动化的内容 • 我的属于开源 • 合作请私信 | 影响力: 0万粉丝

💡 核心观点: 免费课程教你构建自适应AI智能体的三大核心层。

可信度: 10/10 – 2项声明可直接验证;2项需进一步确认;1项为观点陈述

事实核查:

  • ✓ 可验证: ORACLE 和 @DEEPLEARNINGAI 刚刚推出了一门关于自适应智能体的大师课程 (可通过访问 ORACLE 或 DeepLearning.AI 的官方网站、官方社交媒体账号或课程链接直接验证课程是否存在及其合作方信息。)
  • ✓ 可验证: 课程完全免费且时长为一个多小时 (可通过课程链接或官方页面直接查看课程价格(免费)和时长(如课程目录或介绍中标注的时长)。)
  • ◐ 部分可验证: 课程教授如何从零构建 3 个核心适应层(行为、知识、模型) (课程大纲或内容目录可验证是否包含这三部分,但具体教学效果和深度需实际学习后才能确认。)

原文内容:

 ORACLE 和 @DEEPLEARNINGAI 刚刚推出了一门关于自适应智能体的大师课程。

短短一小时内塞满了海量价值,而且完全免费 

现在残酷的现实是,AI 智能体在会话结束时会忘记一切,迫使你每天为完全相同的错误付出代价,一次又一次。

Nacho Martínez 和 Casius Lee 联手 @AndrewYNg 和 @DeepLearningAI,彻底拆解了这个问题。

这份课程的节奏正是它的精髓所在。

短短一个多小时,它教会你如何从零构建 3 个核心适应层:

 第一部分 - 行为:
→ 你将把智能体轨迹转化为可复用技能,设置人工审批关卡,确保只有经过验证的逻辑才能推进。

 第二部分 - 知识:
→ 你将通过构建从导入和历史 Git 共同编辑得出的知识图谱来映射你的代码库,精确证明为什么图检索胜过基本的关键词搜索。

 第三部分 - 模型:
→ 你将学会识别确切的阈值,在这些阈值处,你的堆栈需要微调和权重空间方法来变得必要。

你将带着对如何让智能体在每次运行中都显著改进的完整理解离开。

免费课程链接在  ↓

⏰ 04:50 | ❤️ 24点赞 | 📝 316字 | 查看原文 →

↑ 返回顶部

© 版权声明

相关文章

暂无评论

暂无评论...