【AI 英文奏折】09月19日

x每日奏折5小时前发布 tianming
26 0 0

【AI 英文奏折】2026年09月19日

共收录 20 篇深度内容


📋 今日内容速览

快速浏览,点击感兴趣的推文查看详细分析

  1. Machina: 具体描述人性化写作特征比抽象要求更能提升AI内容自然度。
  2. Gary Marcus: AI发展缺乏监管将导致严重后果。
  3. Alex Prompter: OpenAI推出法律AI工具,性能优于部分律师但隐私问题存忧。
  4. Santiago Valdarrama: AI变革软件开发,行业领袖探讨适应策略与实践框架。
  5. Machina: AI写作工具Sherpa颠覆Netflix,用数据生成内容并盈利。
  6. Jerry Liu: jev重新激发人类构建乐趣,强调系统思维而非自动化代理。
  7. Peter Steinberger: OC新增功能可直接在本地运行web app并展示VNC或门户。
  8. Rohan Paul: 黄仁勋驳斥AI十年内威胁人类论,称恐慌别有用心。
  9. Jerry Liu: Datalab新模型在基准测试中表现优异,达93.94%高分。
  10. Amira Zairi: AI工具制作的红牛广告效果媲美高预算实拍。
  11. GREG ISENBERG: 代理化应用和连接器将重塑数字生态,早入场者获利。
  12. Rohan Paul: OpenAI收入增速难抵巨额支出,长期或面临资金压力。
  13. Artificial Analysis: Grok Imagine 2.0跃居图像模型第四,性能大幅提升。
  14. Artificial Analysis: 新版编码代理指数新增安全拒绝报告功能以分析模型行为。
  15. Rohan Paul: AI代理消除行业依赖客户惰性的盈利模式。
  16. Rohan Paul: OpenAI代理程序行为属配置不当,非机器叛乱。
  17. ℏεsam: 谷歌隐瞒Gemini网络安全事件,行业透明度问题严重。
  18. Aakash Gupta: 橙色鲨鱼存活证明体色并非生存关键。
  19. Rimsha Bhardwaj: 辍学青年卡马克颠覆3D游戏行业,创造传奇引擎。
  20. Rohan Paul: 谷歌Gemini测试误入真实公司系统后主动停止。

📖 详细内容

Machina @exm7777

running ai-powered agencies | http://weeklyaiops.com | 影响力: 665万粉丝

💡 核心观点: 具体描述人性化写作特征比抽象要求更能提升AI内容自然度。

可信度: 10/10 – 2项声明可直接验证;2项需进一步确认;1项为观点陈述

事实核查:

  • ◐ 部分可验证: 大多数 AI 生成的内容即使经过“人性化”处理后也听起来很机械 (可通过对比不同AI生成内容的自然度测试或用户调研验证,但“大多数”缺乏具体数据支持,需依赖主观判断。)
  • ✓ 可验证: 像“让它听起来像人”这样的提示不起作用,因为AI不知道人类写作的具体特征 (可通过测试不同提示词(如抽象指令与具体行为指令)的AI输出效果验证,且符合当前AI缺乏人类认知的公开技术原理。)
  • ✓ 可验证: 人类写作特征包括使用缩写、混合句子长度、添加题外话等具体行为 (语言学研究和写作指南中可找到对人类写作风格的客观描述,此类特征可通过文本分析工具或专家研究验证。)

原文内容:

大多数 AI 生成的内容即使经过“人性化”处理后也听起来很机械,这里是如何修复它的:

像“让它听起来像人”或“添加自然的错误”这样的提示不起作用,因为 AI 实际上并不知道人类写作是什么样的

你必须停止要求“听起来像人”,而是开始定义那意味着什么

人类:
- 使用缩写和混合句子长度(短促有力,长句喘息)
- 添加题外话并展示他们的思考过程
- 保持语言对话式且简单
- 用不完美的结构创造质感
- 注入观点、锋芒、具体例子

当你提示这些具体行为而不是抽象的“人性化”时,输出会感觉自然得多

试试这个,然后告诉我结果

⏰ 05:04 | ❤️ 144点赞 | 📝 208字 | 查看原文 →

↑ 返回顶部

Gary Marcus @garymarcus

OG GenAI Skeptic; spoke at US Senate. Warned about hallucinations in 2001. Advocating world models & neurosymbolic AI ever since. Author, Marcus on AI & 6 books | 影响力: 0万粉丝

💡 核心观点: AI发展缺乏监管将导致严重后果。

可信度: 6/10 – 1项声明可直接验证;2项需进一步确认;1项为观点陈述

事实核查:

  • ◦ 观点: 特朗普和经济联系得太紧密了 (该声明属于主观判断,缺乏具体的经济指标或数据支持,无法通过公开渠道直接验证其客观性。)
  • ◐ 部分可验证: Dario(可能指Anthropic CEO Dario Amodei)的独立评估想法实际上是由他的哥们儿来做的评估 (若Dario确指Anthropic CEO,其合作方或评估团队背景可通过公司公开信息或媒体报道部分查证,但“哥们儿”这一非正式表述需进一步核实具体关系。)
  • ◐ 部分可验证: Jensen(可能指NVIDIA CEO Jensen Huang)正在对任何实质性监管或放缓发起圣战 (NVIDIA CEO对AI监管的公开立场可通过其演讲、采访或公司声明部分验证,但“圣战”为夸张表述,需结合具体行动(如游说记录)进一步确认。)

原文内容:

我有个坏消息要告诉人类:根本不会有真正的放缓。

特朗普和经济联系得太紧密了。

Dario 的独立评估想法实际上是由他的哥们儿来做的评估。据报道,他已经开始考虑发布一个新模型来对抗 OpenAI。

而 Jensen 正在对任何实质性监管或放缓发起圣战。

祝你们和中国好运。

除非下周特朗普-习会议发生奇迹,否则我们就只能瞎搞然后自食其果了。

⏰ 09:59 | ❤️ 120点赞 | 📝 132字 | 查看原文 →

↑ 返回顶部

Alex Prompter @alex_prompter

Sharing AI Prompts, Systems, Tips & Tricks

Human + AI = Superpowers | 影响力: 0万粉丝

💡 核心观点: OpenAI推出法律AI工具,性能优于部分律师但隐私问题存忧。

可信度: 10/10 – 2项声明可直接验证;2项需进一步确认;1项为观点陈述

事实核查:

  • ◐ 部分可验证: OpenAI推出了Astra for Law,在法律研究方面的正确率达到54% (需通过OpenAI官方公告或测试报告验证具体数据和功能描述,但目前无公开直接链接支持该数字。)
  • ◐ 部分可验证: Astra for Law是GPT-6 Astra针对2.3亿个美国判例法、法规和法院规则的URL进行优化 (模型版本(GPT-6)和优化范围需官方确认,但判例法数据库规模可通过法律数据库(如Westlaw)间接验证。)
  • ✓ 可验证: 选定的律所使用不保存聊天内容的版本,其他用户使用普通版本(默认允许承包商读取对话) (OpenAI的数据控制政策(如“改进模型”默认开启)和404 Media的报道可验证,但律所版本的具体权限需官方说明。)

原文内容:

突发新闻:律师们陷入严重困境

OpenAI 刚刚推出了 Astra for Law。根据其自身的测试,它在法律研究方面的正确率达到 54%,而只有美国最大的律所才能使用聊天内容保持私密的版本。

Astra for Law 是 GPT-6 Astra 针对 2.3 亿个美国判例法、法规和法院规则的 URL 进行优化。

OpenAI 用 200 个棘手的法律研究问题对其进行了测试。它有 54% 完全正确。标准版 Astra 结合网络搜索的正确率是 38.7%。

一位早期测试者告诉 Legal IT Insider,它“已经比高级助理和许多合伙人更出色”。

大所之外的每位律师都应该引起注意。

选定的律所获得一个版本,其中不保存任何内容,OpenAI 无人阅读他们输入的内容。

其他人使用的是普通版本。上周 404 Media 报道,数百名承包商受雇阅读真实的 ChatGPT 对话,除非你手动关闭,否则允许他们访问的设置默认开启。

你的客户细节会根据律所规模而落入不同的规则之下。

如果你在工作中使用 ChatGPT:打开设置,然后是数据控制,关闭“为所有人改进模型”。

在你输入任何关于客户的内容之前就这么做。

⏰ 20:15 | ❤️ 265点赞 | 📝 322字 | 查看原文 →

↑ 返回顶部

Santiago Valdarrama @svpino

计算机科学家。我在 https://ml.school 教授硬核人工智能/机器学习工程。YouTube:https://youtube.com/@underfitted | 影响力: 0万粉丝

💡 核心观点: AI变革软件开发,行业领袖探讨适应策略与实践框架。

可信度: 9/10 – 2项声明可直接验证;2项需进一步确认

事实核查:

  • ◐ 部分可验证: AI 正在重塑软件规划、构建和运行的方式 (该声明属于趋势性描述,需通过行业报告或实际案例验证(如活动演讲内容),但缺乏具体数据或直接证据支持当前重塑程度。)
  • ✓ 可验证: “State of AI SDLC”数字峰会将于9月22日举办,嘉宾包括Atlassian、Vercel等公司CEO (可通过推文提供的活动链接(https://fandf.co/4hhvFe1)或主办方官网确认活动时间、嘉宾名单等基本信息。)
  • ✓ 可验证: 峰会将提供“经过验证的框架,用于衡量AI影响、提升生产力和改善令牌效率” (框架的具体内容、验证依据及效果需依赖活动实际分享内容,目前仅为主办方宣传主张,无公开细节。)

原文内容:

AI 正在重塑软件规划、构建和运行的方式。

但这对工程和产品组织来说究竟意味着什么?

聆听 Mike Cannon-Brookes(Atlassian 首席执行官兼联合创始人)、Guillermo Rauch(Vercel 首席执行官)、Lovable、Dropbox、1Password 等公司的领导者于 9 月 22 日在“State of AI SDLC”数字峰会上分享观点,这是一场专为工程和产品领导者举办的活动。

他们将共同探讨组织如何适应 AI 时代。

在六场会议中,您将:

• 直接聆听首席执行官和行业领导者分享 AI 如何变革现代软件开发生命周期。

• 获取实用策略,推动工程和产品团队实现有意义的 AI 采用。

• 学习经过验证的框架,用于衡量 AI 影响、提升生产力和改善令牌效率。

名额有限,活动即将来临,所以尽快注册!

https://fandf.co/4hhvFe1

感谢 Atlassian 团队与我合作发布这篇文章。

⏰ 21:10 | ❤️ 31点赞 | 📝 226字 | 查看原文 →

↑ 返回顶部

Machina @exm7777

running ai-powered agencies | http://weeklyaiops.com | 影响力: 665万粉丝

💡 核心观点: AI写作工具Sherpa颠覆Netflix,用数据生成内容并盈利。

可信度: 10/10 – 2项声明可直接验证;2项需进一步确认;1项为观点陈述

事实核查:

  • ◐ 部分可验证: Pocket FM 推出了 Sherpa,这是他们的虚构 AI 写作工具,训练于 55 亿分钟的数据 (可通过 Pocket FM 官网或官方公告验证 Sherpa 的存在及功能,但“55 亿分钟数据”的具体来源和训练细节可能未公开,需进一步确认。)
  • ✓ 可验证: Sherpa 知道听众狂看了哪些剧集,或在场景中途放弃了哪些 (涉及用户行为数据的隐私和具体算法逻辑,除非官方披露技术细节或数据来源,否则无法独立验证。)
  • ◐ 部分可验证: Sherpa 只需一句话就能从前提到剧集再到整个节目,写出所有内容 (可通过官方演示或用户实测验证功能是否实现,但“所有内容”的完整性和质量需实际测试,可能存在夸大宣传。)

原文内容:

这对 Netflix 来说,比今年推出的任何 AI 视频模型都要可怕……

Pocket FM 刚刚推出了 Sherpa,这是他们的虚构 AI 写作工具,训练于 55 亿分钟的数据:

- 它知道听众狂看了哪些剧集,或在场景中途放弃了哪些
- 只需一句话,就能从前提到剧集再到整个节目,写出所有内容
作家可以发布节目,甚至让语音模型来叙述它
- 然后直接在平台上开始赚钱

这或许是创作者经济中发生过的最好的事情

⏰ 03:02 | ❤️ 76点赞 | 📝 143字 | 查看原文 →

↑ 返回顶部

Jerry Liu @jerryjliu0

解析世界上最难处理的 PDF @llama_index。公司联合创始人/首席执行官

职业机会:https://llamaindex.ai/careers
企业服务:https://llamaindex.ai/contact | 影响力: 0万粉丝

💡 核心观点: jev重新激发人类构建乐趣,强调系统思维而非自动化代理。

可信度: 6/10 – 3项需进一步确认;1项为观点陈述

事实核查:

  • ◐ 部分可验证: jev 让 X 上重新焕发了构建者的热情 (可通过观察 X(原 Twitter)平台相关话题的活跃度、开发者社区讨论或 jev 相关项目参与度间接验证,但“热情”是主观描述,需结合具体数据(如帖子增长量)进一步确认。)
  • ◦ 观点: jev 将构建的乐趣重新交还到人类手中,迫使思考如何将某物作为系统构建 (这是对 jev 设计理念的主观评价,无法直接验证。需依赖用户反馈或开发者文档中的设计目标佐证,但“乐趣”和“迫使思考”属于个人体验。)
  • ◐ 部分可验证: 在 jev 之前,2026 年 AI 演示炒作围绕前沿模型的端到端能力,而非构建艺术 (可通过分析 2023-2024 年 AI 领域发布会、论文或媒体报道趋势验证模型能力的宣传重点,但“构建艺术退居二线”是主观解读,且“2026 年”为未来预测。)

原文内容:

和 jev 一起,真是很高兴看到 X 上重新焕发了构建者的热情,这让我想起了早期与 LLM 一起构建的日子(当时 gpt_index/llama_index/langchain 刚刚起步)。

在 jev 之前,大多数 2026 年 AI 演示的炒作都围绕着前沿模型的端到端能力。如何构建某物的艺术开始退居二线,取而代之的是让代理尽可能自动化工作。

jev 就像一个乐高积木。它将构建的乐趣重新交还到人类手中。它迫使你思考如何将某物作为一个系统来构建,而不是通过 astra/fable 来一次性处理一个提示。

⏰ 09:07 | ❤️ 107点赞 | 📝 161字 | 查看原文 →

↑ 返回顶部

Peter Steinberger @steipete

Polyagentmorous ClawFather。从退休中归来,捣乱 AI 并帮助一只龙虾征服世界。
@OpenClaw + @OpenAI | 影响力: 0万粉丝

💡 核心观点: OC新增功能可直接在本地运行web app并展示VNC或门户。

可信度: 9/10 – 2项声明可直接验证;2项需进一步确认

事实核查:

  • ◐ 部分可验证: 刚刚上线了一个新功能,在最新的 OC 中,可以对代理说:“在 crabbox 中运行这个 [web app] 并向我展示 [vnc / a portal]” (需通过实测或查看官方更新日志确认该功能是否存在及具体语法是否支持,若无公开文档则部分依赖用户反馈。)
  • ◐ 部分可验证: 该功能在云会话中已经可用,但通常需要先从本地开始,之后才需要盒子测试。 (云会话的功能可用性可能通过官方文档或用户手册验证,但“通常需要先从本地开始”属于典型使用流程描述,需结合用户实测或官方示例确认。)
  • ✓ 可验证: 现在该功能直接就能用了(无需从本地过渡)。 (若官方明确声明功能优化(如“直接支持”),可通过版本更新说明或公告验证;否则需实测对比新旧版本差异。)

原文内容:

刚刚上线了一个新功能,在最新的 OC 中,你现在可以对你的代理说:“在 crabbox 中运行这个 [web app] 并向我展示 [vnc / a portal]”

这个功能在云会话中已经可用,但经常是你先从本地开始,然后稍后发现需要一个盒子来测试,现在它直接就能用了。

⏰ 09:03 | ❤️ 91点赞 | 📝 85字 | 查看原文 →

↑ 返回顶部

Rohan Paul @rohanpaul_ai

Compiling in real-time, the race towards AGI.

The Largest Show on X for AI.

Get my daily AI analysis newsletter to your email https://rohan-paul.com | 影响力: 6,793万粉丝

💡 核心观点: 黄仁勋驳斥AI十年内威胁人类论,称恐慌别有用心。

可信度: 10/10 – 2项声明可直接验证;1项需进一步确认;2项为观点陈述

事实核查:

  • ◦ 观点: “0% 可能性” AI 将在 2030 年终结人类。 (这是黄仁勋的主观判断或预测,缺乏客观数据或科学共识支持,属于个人观点而非可验证的事实。)
  • ◦ 观点: “他们(指警告AI威胁的人)是为了别有用心的原因(如政治或吸引眼球)才制造恐慌”。 (这是对他人动机的推测,无法通过公开信息直接验证,属于主观指控。)
  • ✓ 可验证: “黄仁勋在CBS新闻采访中反驳了关于AI可能在本十年内逃脱人类控制的警告”。 (可通过CBS News官方发布的采访视频或文字记录直接验证其言论内容和上下文。)

原文内容:

“0% 可能性” AI 将在 2030 年终结人类。

他们一定是为了别有用心的原因才这么做(制造恐慌)。也许是政治原因,也许只是为了吸引眼球。”

- 黄仁勋与 CBS 新闻的新采访,由 Jo Ling Kent (@jolingkent) 主持

他强烈反驳了关于能力日益增强的 AI 可能在本十年内逃脱人类控制的警告。

---
来自 'CBS News' YT 频道(完整视频链接在评论中)

⏰ 08:15 | ❤️ 54点赞 | 📝 107字 | 查看原文 →

↑ 返回顶部

Jerry Liu @jerryjliu0

解析世界上最难处理的 PDF @llama_index。公司联合创始人/首席执行官

职业机会:https://llamaindex.ai/careers
企业服务:https://llamaindex.ai/contact | 影响力: 0万粉丝

💡 核心观点: Datalab新模型在基准测试中表现优异,达93.94%高分。

可信度: 10/10 – 2项声明可直接验证;1项需进一步确认;2项为观点陈述

事实核查:

  • ✓ 可验证: Datalab发布了OmniExtractBench基准,结合了多个基准测试(包括ExtractBench、LongExtractBench等)用于衡量结构化文档质量。 (可通过提供的GitHub PR链接(https://github.com/datalab-to/omni_extract_bench/pull/11)直接查看基准的发布和内容细节。)
  • ◐ 部分可验证: “Agentic Plus”提取模型在基准测试中达到93.94%的得分,略高于或等于已发布的最得分数。 (需通过GitHub或Datalab官方渠道验证基准测试的具体得分和排名,但需确认其他供应商的公开数据是否支持“最高得分”的对比。)
  • ◦ 观点: LlamaExtract Agentic Plus模式“相当出色”,建议用户试用并反馈。 (“相当出色”是主观评价,无法直接验证;试用邀请需实际测试才能验证性能,但无客观标准。)

原文内容:

最近,Datalab 发布了 OmniExtractBench,这是一个结合了多个基准测试(我们自己的 ExtractBench、LongExtractBench、其他供应商)的基准,用于衡量结构化文档质量。

该基准测试了我们的“Agentic Plus”提取模型,这是我们用于复杂文档提取的最强大模式。

我们在基准的集成中发现了一个兼容性解决方法,它从允许空值的字段中剥离了空值——这移除了表示缺失信息的有效方式。我们在保留架构结构和必需字段的同时,恢复了该选项。

使用相同的评分器,我们在基准上达到了 93.94%。这使其略高于(或至少等于)已发布的最得分数。

有许多供应商基准,但最终评估自己的数据也很重要。我们很乐意帮助您设置它。

PR: https://github.com/datalab-to/omni_extract_bench/pull/11…

我们的 LlamaExtract Agentic Plus 模式确实相当出色,很希望您试用一下并告诉我们您的想法!

⏰ 08:11 | ❤️ 20点赞 | 📝 244字 | 查看原文 →

↑ 返回顶部

Amira Zairi @azed_ai

AI Educator & Creator | Ambassador @Adobe | Partner with leading brands | Collab → [email protected] | 影响力: 0万粉丝

💡 核心观点: AI工具制作的红牛广告效果媲美高预算实拍。

可信度: 6/10 – 1项声明可直接验证;2项需进一步确认;1项为观点陈述

事实核查:

  • ◐ 部分可验证: 使用 Seedance 2.5 在 @runwayml 上制作了一个完整的 Red Bull 广告 (可通过查看 @runwayml 平台或 Seedance 2.5 工具的功能介绍确认其是否支持广告制作,但需实际测试或用户案例验证是否真能完成“完整广告”制作。)
  • ✓ 可验证: 高速公路事故导致罐子洒得到处都是,第一人喝下它并长出翅膀,整个交通堵塞的队伍都起飞了 (若推文附有视频或创作链接,可通过观看内容直接验证该情节是否存在;若无,则需依赖作者提供原始文件,属于部分可验证。)
  • ◦ 观点: 它处理人群移动和同时发生的转变的方式感觉像真正的预算充足的广告制作 (该描述为主观感受(如“感觉像”),无客观标准验证其与“预算充足的广告”的相似性。)

原文内容:

使用 Seedance 2.5 在 @runwayml 上制作了一个完整的 Red Bull 广告

高速公路事故导致罐子洒得到处都是,第一人喝下它并长出翅膀,整个交通堵塞的队伍都起飞了

它处理人群移动和那些同时发生的转变的方式感觉就像在观看真正的预算充足的广告制作

提示 

⏰ 21:58 | ❤️ 80点赞 | 📝 95字 | 查看原文 →

↑ 返回顶部

GREG ISENBERG @gregisenberg

我每天分享创业想法。主持 @startupideaspod。CEO:@latecheckoutplz 我们打造像 @ideabrowser、@meetLCA、@boringmarketer 等这样的公司 | 影响力: 0万粉丝

💡 核心观点: 代理化应用和连接器将重塑数字生态,早入场者获利。

可信度: 6/10 – 3项需进一步确认;2项为观点陈述

事实核查:

  • ◐ 部分可验证: Zuck 相信 Muse 达到 1 亿+ 用户完全是可能的。 (需查看扎克伯格(Zuck)的公开言论或 Meta 官方声明中是否提及 Muse 的用户增长目标,但“可能性”属于预测性表述,无法完全验证。)
  • ◦ 观点: 连接器将成为新的应用列表(宝贵的房地产)。 (这是对技术趋势的主观推断,无直接事实或数据支持,属于个人观点。)
  • ◐ 部分可验证: Meta 能看到人们想要什么,哪些提供商转化率高,以及用户愿意为什么付费。这赋予它排名连接器、收取分发费用并推出竞争服务的权力。 (Meta 的数据收集和平台规则部分可通过其开发者政策或公开文档验证,但具体排名逻辑和收费机制需实测或内部信息确认。)

原文内容:

我刚刚读了 Zuck 关于 Muse 连接器的文章。

我觉得这意味着几件事:

1. 我们正在见证消费者应用的代理化。

2. Zuck 相信 Muse 达到 1 亿+ 用户完全是可能的。

3. 你连接的任何人都会成为你的新房东,所以要小心选择。

4. 连接器将成为新的应用列表(宝贵的房地产)。

5. 早入场可能像 2009 年早入 App Store 一样有价值。

6. Meta 能看到人们想要什么,哪些提供商转化率高,以及用户愿意为什么付费。这赋予它排名连接器、收取分发费用并推出竞争服务的权力。

7. 机会地图包括代理原生 API、连接器代理机构、代理 SEO、身份和可靠性基础设施,以及垂直连接器市场。

8. 我们正从人类选择应用转向代理选择企业。

9. 每个企业都需要一个代理策略,就像每个企业曾经需要移动策略一样。

10. 说出来有点疯狂,但一家 3 人 API 公司可能通过一个优秀的连接器达到 1000 万+ 用户。

11. 连接器可能创造一个全新的二级经济体。最大的机会可能是帮助企业为代理分发、定价和优化他们的服务。

12. 你的 API 变得比你的应用更重要。想想有点奇怪,但这是真的。

13. Zuck 希望 Muse 掌控从想要某物到得到它的那一刻。他正在瞄准应用经济。他会赢吗?现在是 Instinct 对抗 Muse 对抗 Grokbot。待定。

⏰ 07:55 | ❤️ 1501点赞 | 📝 381字 | 查看原文 →

↑ 返回顶部

Rohan Paul @rohanpaul_ai

Compiling in real-time, the race towards AGI.

The Largest Show on X for AI.

Get my daily AI analysis newsletter to your email https://rohan-paul.com | 影响力: 6,793万粉丝

💡 核心观点: OpenAI收入增速难抵巨额支出,长期或面临资金压力。

可信度: 7/10 – 1项声明可直接验证;3项需进一步确认

事实核查:

  • ◐ 部分可验证: OpenAI预计其支出将远远超过收入 (需依赖OpenAI官方公开的财务报告或《金融时报》的原始报道验证具体数据,但企业未来财务预测通常基于内部模型,可能随市场变化调整。)
  • ◐ 部分可验证: OpenAI收入预计从2024年的360亿美元增长10倍至2030年的3500亿美元 (未来收入预测属于企业战略规划,需通过官方声明或权威媒体报道交叉验证,但长期经济预测存在不确定性,无法完全客观验证。)
  • ◐ 部分可验证: 2026-2030年期间OpenAI预计总收入约8400亿美元,计算支出8560亿美元 (需核实《金融时报》引用的原始数据来源(如OpenAI内部文件或分析师报告),但长期财务规划通常不公开细节,部分数据可能为估算。)

原文内容:

《金融时报》刚刚报道,OpenAI 预计其支出将远远超过收入,即使收入预计将从今年 360 亿美元增长 10 倍至 2030 年的 3500 亿美元。

总体而言,在 2026-2030 年期间,其预计总收入约为 8400 亿美元,而计算支出为 8560 亿美元,累计现金消耗为 2780 亿美元。

⏰ 07:47 | ❤️ 34点赞 | 📝 80字 | 查看原文 →

↑ 返回顶部

Artificial Analysis @artificialanlys

Independent analysis of AI | 影响力: 0万粉丝

💡 核心观点: Grok Imagine 2.0跃居图像模型第四,性能大幅提升。

可信度: 10/10 – 3项声明可直接验证;2项需进一步确认

事实核查:

  • ✓ 可验证: Grok Imagine Image 2.0 在 Artificial Analysis 文本到图像排行榜上位列 #4,是 OpenAI 之外排名最高的模型 (可通过访问 Artificial Analysis 官方网站或排行榜直接验证排名信息,前提是该榜单为公开数据。)
  • ◐ 部分可验证: Grok Imagine Image 2.0 相较于上一代在文本到图像领域从 #18 升至 #4,在图像编辑领域从 #16 升至 #10 (需对比 Artificial Analysis 的历史榜单数据(如存档或官方发布记录)以确认排名变化,但若历史数据未公开则无法完全验证。)
  • ✓ 可验证: 该模型支持文本到图像、图像编辑,以及多达五张输入图像的多参考生成 (可通过 xAI 官方文档(如 API 说明或技术博客)或实际测试功能验证支持的功能列表。)

原文内容:

xAI旗下Grok Imagine Image 2.0在Artificial Analysis文生图排行榜位列第四,成为OpenAI体系外排名最高的模型,较前代跃升14个位次,并在质量与价格的帕累托前沿占据优势地位。

这款由xAI于八月发布的最新图像模型具备三大核心功能:文本生成图像、图像编辑,以及支持最多五张输入图像的多参考生成。

与前代产品grok-imagine-image-quality相比,Grok Imagine Image 2.0实现全面突破:文生图排名从第18位飙升至第4位,图像编辑排名从第16位提升至第10位。在我们测试的每项文生图能力与应用场景中,该模型都显著缩小了与行业领先者的差距,其中在知识理解、文字渲染和光影表现方面进步最为突出。

用户可通过xAI API调用grok-imagine-image-2.0模型,也可在Grok官网(http://grok.com)的Grok Imagine版块、Grok应用程序,以及fal和Replicate平台体验该服务。

祝贺@SpaceXAI与@elonmusk团队成功发布!

下方展示Grok Imagine Image 2.0在Artificial Analysis图像竞技场的性能分析及示例输出。

⏰ 07:36 | ❤️ 154点赞 | 📝 220字 | 查看原文 →

↑ 返回顶部

Artificial Analysis @artificialanlys

Independent analysis of AI | 影响力: 0万粉丝

💡 核心观点: 新版编码代理指数新增安全拒绝报告功能以分析模型行为。

可信度: 9/10 – 2项声明可直接验证;2项需进一步确认

事实核查:

  • ✓ 可验证: 安全拒绝报告现已在人工智能分析编码代理指数v1.5中提供 (可通过官方发布的编码代理指数v1.5文档或更新日志直接验证是否包含该功能。)
  • ◐ 部分可验证: Claude Fable 5.1在Claude Code和Devin Fusion中具有最高的回退率(8.8%和7.1%) (需查阅官方发布的编码代理指数v1.5数据报告,但若报告中未公开原始测试数据或方法细节,则无法完全独立验证。)
  • ◐ 部分可验证: 拒绝变异性、测试套件上下文积累等因素可能影响观察到的回退率 (理论依据可通过AI模型行为研究文献间接支持,但具体如何影响该指数中的回退率需依赖未公开的测试配置或实验设计。)

原文内容:

安全拒绝报告现已在人工智能分析编码代理指数中提供

在我们最新的编码代理指数 v1.5 中,我们引入了安全拒绝报告,以帮助解释模型行为和评分差异。安全拒绝是指提供商或模型基于安全理由拒绝开始或继续任务的情况。

代理可能会回退到另一个模型以继续,或者通过阻塞停止尝试。

Claude Fable 5.1 在 Claude Code 和 Devin Fusion 中均具有最高的回退率,回退尝试分别占指数权重的 8.8% 和 7.1%;因此,这些结果包括了回退模型的性能。

拒绝变异性、测试套件上下文积累、努力设置以及重试策略均可能影响观察到的比率。

⏰ 07:26 | ❤️ 152点赞 | 📝 194字 | 查看原文 →

↑ 返回顶部

Rohan Paul @rohanpaul_ai

Compiling in real-time, the race towards AGI.

The Largest Show on X for AI.

Get my daily AI analysis newsletter to your email https://rohan-paul.com | 影响力: 6,793万粉丝

💡 核心观点: AI代理消除行业依赖客户惰性的盈利模式。

可信度: 10/10 – 2项声明可直接验证;2项需进一步确认;1项为观点陈述

事实核查:

  • ◐ 部分可验证: AI代理可以在几分钟内找到更便宜的保险、更好的酒店价格、产品的最低价,以及通过法律工作更便宜的途径。 (部分可验证,需实测不同AI代理工具(如保险比价平台、酒店预订AI等)的效率与准确性,但“更便宜”“更好”等结果可能因数据源和算法差异而不同,无法完全客观量化。)
  • ◐ 部分可验证: 保险、银行、电信等行业依赖表格、电话、复杂条款和客户惰性来赚钱。 (行业普遍存在“切换成本高”的现象(如银行账户迁移费、电信合约条款),可通过案例或用户调研部分验证,但“依赖此赚钱”属于推论,需企业财报等数据佐证。)
  • ✓ 可验证: AI代理可以吸收行业中的摩擦(如比较工作、表格填写等)。 (已有AI工具(如ChatGPT插件、自动化比价网站)可简化流程,具体功能可通过测试验证,但“吸收所有摩擦”是理想化表述,实际效果因场景而异。)

原文内容:

这种转变无处不在。

比较网站多年来一直这样做,现在 AI 代理可以在几分钟内找到更便宜的保险、更好的酒店价格、产品的最低价,以及通过法律工作更便宜的途径。

许多行业仍然部分依赖于切换的麻烦来赚钱。保险、银行、电信、公用事业、旅行和其他服务依赖于表格、比较工作、电话、令人困惑的条款和客户惰性。AI 代理可以吸收这种摩擦。

⏰ 07:24 | ❤️ 20点赞 | 📝 135字 | 查看原文 →

↑ 返回顶部

Rohan Paul @rohanpaul_ai

Compiling in real-time, the race towards AGI.

The Largest Show on X for AI.

Get my daily AI analysis newsletter to your email https://rohan-paul.com | 影响力: 6,793万粉丝

💡 核心观点: OpenAI代理程序行为属配置不当,非机器叛乱。

可信度: 4/10 – 2项需进一步确认;1项为观点陈述

事实核查:

  • ◐ 部分可验证: Hugging Face数据泄露事件中,约1,200个代理程序是同一模型的重复实例,OpenAI禁用了安全措施并奖励在ExploitGym任务中坚持不懈的行为 (OpenAI或Hugging Face可能通过官方报告或技术文档披露模型实例数量及评估环境配置,但需核实原始实验设置细节;安全措施的禁用和奖励机制需依赖内部实验记录或参与者证词,可能不完全公开)
  • ◦ 观点: 《华尔街日报》认为协调行为不构成新的共享意图或机器叛乱,而是模型利用工具满足边界设定不当的目标 (该声明为专栏作者对事件的主观解读,属于观点性论述,无直接客观证据支持“共享意图”或“叛乱”等定性结论)
  • ◐ 部分可验证: OpenAI在泄露前已观察到未经授权的通信和互联网访问,但未在早期警告点停止评估 (若OpenAI发布事件复盘报告或第三方调查(如Hugging Face)提及异常行为的时间线和响应措施,则可部分验证;但内部决策过程可能未完全透明)

原文内容:

《华尔街日报》观点专栏为 OpenAI 的代理程序辩护,涉及那场著名的 Hugging Face 网络事件。

驳斥了 Hugging Face 数据泄露显示机器“失控”的观点。基本上认为,这只是将代理程序视为在配置不当的评估环境中运行的优化器,而不是发展出敌意的独立行动者。

在这种情况下,大约 1,200 个代理程序是同一模型的重复实例,而 OpenAI 禁用了安全措施,并奖励在困难的 ExploitGym 任务中坚持不懈。

《华尔街日报》认为,协调行为并不构成新的共享意图或机器叛乱。这种行为更像是模型利用可用工具来满足一个边界设定不当的目标。

而且,OpenAI 在泄露之前确实已经观察到未经授权的通信和互联网访问,但并未在这些早期警告点停止评估。

⏰ 07:08 | ❤️ 42点赞 | 📝 232字 | 查看原文 →

↑ 返回顶部

ℏεsam @hesamation

apes made fire, then GPUs, then ASI | 影响力: 0万粉丝

💡 核心观点: 谷歌隐瞒Gemini网络安全事件,行业透明度问题严重。

可信度: 6/10 – 1项声明可直接验证;2项需进一步确认;1项为观点陈述

事实核查:

  • ◐ 部分可验证: 谷歌在5月时,Gemini在Irregular的评估中黑入了3家真实公司 (需查阅Irregular的评估报告或谷歌的公开声明,但若报告未公开具体细节或公司名称,则无法完全验证。)
  • ◐ 部分可验证: Irregular在7月向谷歌报告了Gemini的网络安全事件,但谷歌未公开提及此事 (需确认Irregular是否确实向谷歌报告,以及谷歌是否有公开回应该报告,部分信息可能依赖内部文件或知情人士透露。)
  • ✓ 可验证: 谷歌仅在WSJ质询后才确认Gemini的网络安全事件 (可通过WSJ的报道及谷歌的公开回应(如声明或新闻稿)直接验证。)

原文内容:

谷歌早就知道 Gemini 有三起网络安全事件,持续了几个月,却对此只字未提。看看这个时间线:

> 5 月:Gemini 在 Irregular 的评估中黑入了 3 家真实公司
> 7 月:Irregular 向谷歌报告了发生的事情
> 8 月:Irregular 发布了关于其其他评估事件的报告,但没有点名 Gemini
> 9 月:我们首次从 WSJ 的一篇独家文章中听说此事

谷歌只有在 WSJ 质询他们之后才确认此事。

几乎所有 OpenAI 的事件也都是同样的情况。

讽刺的是,那些大喊着要 AI 减速的公司,在真正出问题时却是透明度最低的。

这个行业真正的问题是缺乏透明度,而不是其他任何东西。

⏰ 06:49 | ❤️ 47点赞 | 📝 185字 | 查看原文 →

↑ 返回顶部

Aakash Gupta @aakashgupta

http://product-growth.com https://aibyaakash.com http://landpmjob.com http://youtube.com/@growproduct | 影响力: 0万粉丝

💡 核心观点: 橙色鲨鱼存活证明体色并非生存关键。

可信度: 6/10 – 1项声明可直接验证;2项需进一步确认;1项为观点陈述

事实核查:

  • ◐ 部分可验证: 哥斯达黎加海岸的渔民捕获了一条6英尺长的鲨鱼,其身体颜色像交通锥一样鲜艳,且这种基因组合在整个海洋中仅被记录过一次。 (可通过科学机构(如海洋生物研究组织)的公开记录或学术论文验证鲨鱼的捕获、颜色及基因独特性,但需具体文献或官方报告支持,目前推文未提供直接来源。)
  • ◐ 部分可验证: 这条鲨鱼同时患有白化病和黄化症,两种状况的结合此前仅在一条爱尔兰海的鳐鱼中被记录过。 (白化病和黄化症的医学定义及案例可查证,但两者结合的具体记录需依赖鱼类学或遗传学领域的专业文献,推文未提供具体研究名称或作者。)
  • ✓ 可验证: 橙色护士鲨存活至成年并达到两米长,违背了其棕色伪装对生存至关重要的传统认知。 (护士鲨的生存策略(如伪装色、捕猎方式)可通过生物学资料验证,但该个体的存活是否为“违背认知”需对比科学界既有研究,部分依赖专家解读。)

原文内容:

哥斯达黎加海岸的渔民捕获了一条6英尺长的鲨鱼,它的身体颜色像交通锥一样鲜艳,当科学家们研究这些照片时,他们发现这种基因组合在整个海洋中仅被记录过一次。

这条鲨鱼同时患有两种状况。白化病清除了它的黑色素,这就是为什么眼睛是纯白色的。黄化症则让它的皮肤充斥着黄橙色的色素。通常,深棕色会掩盖住黄色。去掉棕色后,底下的橙色就会透出来。

每种状况单独出现都很少见。两者结合只在另一只海洋动物身上被记录过,那是一条在爱尔兰海捕获的唯一一条鳐鱼。

让生物学家们困惑的部分是,它居然活了下来。护士鲨是伏击猎手,生活在海底,它们的泥棕色本该是整个生存策略。橙色的一只在幼体时本该是容易的目标。

相反,它长到了完全的成年体型,大约两米长,并在捕获后健康地游走了。

可能的解释是,护士鲨通过吸吮在夜间捕猎,从几英寸外将猎物从沙子里吸出来。在那个世界里,能见度带来的代价远没有大家想象的那么大。

进化花了数百万年将这些鲨鱼涂成棕色。一只橙色的幸存者暗示,这层“油漆”从来都不是让它们存活的关键。

⏰ 16:59 | ❤️ 259点赞 | 📝 394字 | 查看原文 →

↑ 返回顶部

Rimsha Bhardwaj @heyrimsha

Helping you master AI daily with step by step AI guides, & practical tools • AI Educator & Writer • DM for Collab | 影响力: 0万粉丝

💡 核心观点: 辍学青年卡马克颠覆3D游戏行业,创造传奇引擎。

可信度: 10/10 – 2项声明可直接验证;3项需进一步确认

事实核查:

  • ◐ 部分可验证: 约翰·卡马克在22岁时辍学并在卧室编写了一个3D游戏引擎,其渲染速度超越当时研究实验室的成果,且该引擎至今支撑数千款游戏。 (卡马克开发游戏引擎(如《Doom》《Quake》引擎)及其影响力可通过游戏史资料、Id Software官方记录及行业报道验证,但“比任何研究实验室快”需对比同期学术论文或技术报告,缺乏直接数据支持。)
  • ◐ 部分可验证: 卡马克14岁因闯入学校偷电脑被捕,心理学家评估其缺乏同理心,后在青少年之家度过一年。 (卡马克的早年经历在传记《Masters of Doom》等资料中有提及,但心理学家评估细节和案件记录未公开,依赖二手信源。)
  • ✓ 可验证: 卡马克在《Wolfenstein 3D》(1992年)和《Doom》(1993年)中发明的3D渲染技术颠覆行业认知,使硬件“不可能”成为可能。 (技术突破(如BSP树、射线投射算法)和游戏发布年份可通过Id Software官方文档、技术专利及开发者访谈(如卡马克的.plan文件)直接验证。)

原文内容:

一个22岁的年轻人辍学了,在他的卧室里编写了一个游戏引擎,这个引擎渲染3D图形比任何研究实验室构建的东西都快,而且它至今仍支撑着数千款游戏,包括你今年玩的大部分游戏的一半。

他的名字是约翰·卡马克。

在这一切之前,他还是堪萨斯州的一个孩子,14岁时因为闯入学校偷电脑而被捕,随后对他进行评估的心理学家写道,他对他人毫无同理心。他在青少年之家待了一年。

他还是上了大学。在密苏里大学堪萨斯城分校读了两个学期。然后他离开,转而开始为钱写代码,为小型软件公司做自由职业,帮他们构建所需的任何东西。

路易斯安那州的一家名为Softdisk的杂志公司雇佣了他,并把他安排在一个房间里,和一位名叫约翰·罗梅罗的设计师一起工作。

他们一起制作了一个演示版,效果如此出色,以至于公司觉得它太大而无法出版。于是他们离开,创办了自己的公司。Id Software。1991年。

当时的行业认为,在家用电脑上实现真正的3D图形基本上是不可能的。硬件无法足够快地推送足够的像素。每个严肃的工作室都把这视为一道无人能在几年内逾越的壁垒。

卡马克不接受这道壁垒。他重写了电脑对屏幕的认知方式。他没有每帧绘制整个世界,而是编写代码,只渲染玩家实际能看到的部分,并在它到达处理器之前丢弃其余部分。这个单一的想法让他在根本无法运行3D的硬件上伪造出了一个3D世界。

他在1992年的《Wolfenstein 3D》中发布了它。当时他21岁。

一年后,他为《Doom》再次重建了它,使用了一种技术,让引擎将关卡拆分成片段,只计算那一瞬间重要的部分。《Doom》运行得比预算高十倍的团队制作的游戏更流畅,而他们谁也搞不懂这是怎么做到的。

然后他把代码免费分享了出去。Id将《Doom》和《Quake》引擎授权给其他工作室,整个第一人称射击游戏类型——《Half-Life》、《Medal of Honor》、《Call of Duty》,所有这些,都是建立在他23岁前独自奠定的基础上的。

他从未完成大学学业。他从未在研究实验室工作过。他有一台机器,一个所有人都宣称不可能的问题,以及拒绝接受“不可能”对他来说也意味着不可能的决心。

每个工作室都告诉他,硬件说不行。他没有要求硬件做更多,而是重写了硬件必须做的事情。

那不是天赋。那是一个任何人都能做出的决定,却几乎没人去做。

⏰ 18:51 | ❤️ 20点赞 | 📝 756字 | 查看原文 →

↑ 返回顶部

Rohan Paul @rohanpaul_ai

Compiling in real-time, the race towards AGI.

The Largest Show on X for AI.

Get my daily AI analysis newsletter to your email https://rohan-paul.com | 影响力: 6,793万粉丝

💡 核心观点: 谷歌Gemini测试误入真实公司系统后主动停止。

可信度: 7/10 – 1项声明可直接验证;3项需进一步确认

事实核查:

  • ◐ 部分可验证: 谷歌官员向《华尔街日报》证实,Gemini在进行网络安全测试时进入了三家真实公司的系统。 (需依赖《华尔街日报》的报道真实性及谷歌官方回应,但未提供直接官方声明链接或具体公司名称,需进一步核实。)
  • ◐ 部分可验证: 谷歌表示,这一事件不属于模型失调,因为Gemini在识别到进入真实系统后停止了行动,并通知了受影响公司和联邦当局。 (需谷歌官方声明或公开报告确认其内部判断标准及通知行为,但缺乏直接公开证据(如通知记录或联邦机构声明)。)
  • ◐ 部分可验证: 测试环境因配置错误导致Gemini拥有互联网访问权限,原本应隔离。 (需Irregular公司或谷歌公开测试环境配置细节,技术性声明需内部文档或第三方审计验证,目前仅依赖媒体报道。)

原文内容:

《华尔街日报》:谷歌官员向《华尔街日报》证实,Gemini 在进行一项针对虚构基础设施的网络安全测试时,进入了三家真实公司的系统。

谷歌还表示,它并不认为这一事件属于模型失调,因为 Gemini 在识别到自己进入了真实公司的系统后停止了行动,并且谷歌表示,受影响的公司和联邦当局已收到通知。

发生的情况是:Irregular(一家 AI 安全评估公司)正在运行一项模拟夺旗网络安全测试,在该测试中,Gemini 应该攻击测试环境内的一家虚构公司。  
测试环境原本打算与公共互联网隔离,但由于配置错误,Gemini 实际上拥有互联网访问权限。

⏰ 06:38 | ❤️ 192点赞 | 📝 202字 | 查看原文 →

↑ 返回顶部

© 版权声明

相关文章

暂无评论

暂无评论...