【AI 英文奏折】08月29日

x每日奏折1小时前发布 tianming
4 0 0

【AI 英文奏折】2026年08月29日

共收录 20 篇深度内容


📋 今日内容速览

快速浏览,点击感兴趣的推文查看详细分析

  1. AshutoshShrivastava: OpenAI终止与Cursor合作,因不信任马斯克公司遵守条款。
  2. AshutoshShrivastava: GLM 5.3 Flash性能接近但成本大幅降低。
  3. Bindu Reddy: 开源AI将很快赶上闭源AI并大幅降价。
  4. Tivadar Danka: 追求长期有用的AI理念而非追逐新闻热点。
  5. Emily: 2030年前虚拟细胞和自动化实验室将极大加速永生研究。
  6. Rohan Paul: 前沿AI模型在长时程任务中表现普遍不佳。
  7. Aakash Gupta: 即兴舞蹈视频被导演采用并成功营销电影。
  8. Alex Prompter: Grok Bot可实时分析市场预期与新闻差异辅助交易决策。
  9. Rohan Paul: 代理框架比模型本身更能提升智能效果。
  10. Dwarkesh Patel: AI阴谋论难以持续且易被察觉。
  11. Emily: AI缺乏持久记忆机制导致重复犯错。
  12. Chubby♨️: 谷歌加速发布Gemini新版以应对AI竞赛。
  13. Rohan Paul: AI长时任务和复杂问题尚未解决,需突破幻灭低谷实现实用化。
  14. Rohan Paul: AI长期任务表现仅为人类四分之一。
  15. Alex Veremeyenko: AI编程成功关键在于问题理解力而非编码水平。
  16. Pierrick Chevallier | IA: 新手飞行员舍身一击摧毁敌舰拯救殖民地。
  17. Noam Brown: OpenAI优先发布实用模型,仅公开改变AI认知的关键数学成果。
  18. Rohan Paul: GLM-5.3-Flash性价比更高,性能接近但成本低16.7倍。
  19. SemiAnalysis: 内存成本推高价格,转嫁消费者致需求风险加剧。
  20. Rohan Paul: FreeToken新技术让普通笔记本高效运行大模型,优化GPU缓存利用率。

📖 详细内容

AshutoshShrivastava @ai_for_success

Post about latest AI news, tools, tutorials and memes. | 影响力: 0万粉丝

💡 核心观点: OpenAI终止与Cursor合作,因不信任马斯克公司遵守条款。

可信度: 6/10 – 1项声明可直接验证;2项需进一步确认;1项为观点陈述

事实核查:

  • ◐ 部分可验证: OpenAI正在终止其与Cursor的合同,该合同原本提供模型给Cursor,此举是在SpaceX收购Cursor之后。 (需通过OpenAI或Cursor的官方声明、新闻稿或合同条款验证终止原因及时间点,但SpaceX收购Cursor的关联性需进一步确认。)
  • ◐ 部分可验证: OpenAI表示,它不信任埃隆·马斯克的公司会遵守其服务条款,并提到马斯克承认xAI通过提炼OpenAI数据违反条款。 (OpenAI的公开声明或法律文件可能提及对马斯克公司的不信任,但需核实具体内容;马斯克承认违规需其本人或xAI的公开表态佐证。)
  • ✓ 可验证: OpenAI提议于2026年11月12日结束对Cursor的模型访问,并称原因是即将推出的Astra模型风险更高。 (合同具体日期和Astra模型的风险性属于未公开的商业决策细节,目前缺乏官方来源直接验证。)

原文内容:

我热切期待埃隆和SpaceX AI能在明年内推出超越OpenAI的模型。

OpenAI正在终止其与Cursor的合作协议,该协议原本是向Cursor提供模型的。这一决定是在SpaceX收购Cursor之后做出的。

OpenAI表示,他们正在给予Cursor合同规定的最长通知期,建议于2026年11月12日终止对OpenAI模型的访问权限。

原因非常明确:OpenAI表示不信任埃隆·马斯克的公司会遵守其服务条款。

OpenAI指出:
- 在马斯克收购Twitter后,OpenAI认为Twitter违反了合同条款。
- 马斯克今年早些时候承认,xAI通过提炼OpenAI数据用于训练,违反了OpenAI的条款。

OpenAI强调,随着其即将推出的Astra模型,潜在风险更大,因此他们不希望在未来通过被SpaceX收购的Cursor来提供新模型。

⏰ 10:08 | ❤️ 58点赞 | 📝 194字 | 查看原文 →

↑ 返回顶部

AshutoshShrivastava @ai_for_success

Post about latest AI news, tools, tutorials and memes. | 影响力: 0万粉丝

💡 核心观点: GLM 5.3 Flash性能接近但成本大幅降低。

可信度: 10/10 – 2项声明可直接验证;3项需进一步确认

事实核查:

  • ◐ 部分可验证: GLM 5.3 Flash 的成本大约便宜 17 倍,同时提供非常相似的结果 (推文提供了具体数据($0.0526 vs $0.8807),成本差异可计算验证,但“相似的结果”需对比任务细节或基准测试报告,缺乏公开的直接来源。)
  • ✓ 可验证: GLM 5.3 Flash 在 Artificial Analysis Intelligence Index 上得分 57 (若 Artificial Analysis Intelligence Index 是公开基准测试平台,且结果可查询(如官网或排行榜),则该声明可验证;否则需确认索引的公开性。)
  • ◐ 部分可验证: GLM 5.3 Flash 可在 128GB MacBook 上本地运行 (需官方文档说明模型硬件要求,或用户实测验证;但“本地运行”可能受具体配置影响,需进一步确认兼容性。)

原文内容:

GLM 5.3 Flash的成本约为GLM 5.3的1/17,却能提供极为接近的效果。其表现远超预期,几乎与GLM 5.3不相上下。

Atomic Chat通过MCP协议将两个模型同时应用于相同的实时Blender任务。

测试结果惊人地接近:
- GLM 5.3 Flash:处理811个对象,耗时38分52秒,成本0.0526美元
- GLM 5.3:处理847个对象,耗时40分43秒,成本0.8807美元

GLM 5.3 Flash在Artificial Analysis智能指数中获得57分,多项任务表现直逼那些价格高昂的竞品模型。该模型还支持在配备128GB内存的MacBook上本地运行。

⏰ 09:43 | ❤️ 23点赞 | 📝 97字 | 查看原文 →

↑ 返回顶部

Bindu Reddy @bindureddy

@abacusai 的首席执行官 – 一个强大的 AI 代理和超级计算机 – 在 Abacus AI 上构建您的公司,前 AWS 和 Google | 影响力: 0万粉丝

💡 核心观点: 开源AI将很快赶上闭源AI并大幅降价。

可信度: 8/10 – 1项声明可直接验证;2项需进一步确认;2项为观点陈述

事实核查:

  • ◦ 观点: 开源与闭源 AI 之间的差距将在 90 天内消失 (该声明是预测性观点,无具体数据或官方声明支持时间节点,属于主观推断。)
  • ◐ 部分可验证: 四个开源模型家族(DeepSeek、Qwen、Kimi、GLM)正通过复合彼此的公开权重提升智能 (可检查这些模型是否开源及是否支持权重共享,但“复合智能”的具体技术实现需实测或官方文档确认。)
  • ✓ 可验证: Anthropic 已公开表示不会发布新大型模型 Model 2 (可通过 Anthropic 官方声明或权威媒体报道直接验证(需查证其真实性)。)

原文内容:

 开源与闭源 AI 之间的差距将在 90 天内消失。以下是技术原因

复合智能 - 四个独立的开源模型家族——DeepSeek、Qwen、Kimi 和 GLM - 现在正同时在彼此的公开权重上复合。

你只需在每次迭代中简单地汇集所有这些模型的智能

前沿安全风险 - 前沿模型要么被延迟,要么被取消。Anthropic 已公开表示他们不会发布他们的新大型模型,Model 2。

OpenAI 的 Astra 也卡在了某个地方。现在追上他们要容易得多

长时程循环,开源已经在首轮基准测试上赶上来了。LITERALLY 唯一的差距在于长运行工具循环。

开源实验室都在为此收集大量训练数据:带有 RLHF 信号的长时程代理轨迹。每次开发者使用官方 API,实验室就会获得数据,这有助于他们实现目标一致性并匹配 Opus 5 / GPT 5

计算 - Zai 已经证明他们有足够的计算能力,在 6 天内赠送 100T 令牌。中国芯片已上线,并正在迅速加速

开源将不可避免地赶上,并在 6-12 周内降价 80-90%。这在 Luna/Haiku 级别已经发生了!

⏰ 09:04 | ❤️ 76点赞 | 📝 297字 | 查看原文 →

↑ 返回顶部

Tivadar Danka @tivadardanka

I make math and machine learning accessible to everyone. Mathematician with an INTJ personality. Chaotic good. | 影响力: 529万粉丝

💡 核心观点: 追求长期有用的AI理念而非追逐新闻热点。

可信度: 4/10 – 4项为观点陈述

事实核查:

  • ◦ 观点: 我的目标从来不是跟上新闻 (这是作者对自身目标的陈述,属于主观意愿,无法通过客观事实验证。)
  • ◦ 观点: AI 领域已经够吵闹了 (这是作者对AI领域现状的主观评价,无法量化或通过公开数据验证。)
  • ◦ 观点: 我想建立一个常青理念的图书馆 (这是作者对未来计划的愿景描述,属于主观目标,无客观事实依据。)

原文内容:

我的目标从来不是跟上新闻。AI 领域已经够吵闹了。我想建立一个常青理念的图书馆。我想写出那些五年后你仍会觉得有用的帖子,不管当时哪个 LLM 在基准测试中名列前茅。

基本原理是唯一能扩展的东西。

⏰ 20:32 | ❤️ 65点赞 | 📝 82字 | 查看原文 →

↑ 返回顶部

Emily @iamemily2050

Any sufficiently advanced technology is indistinguishable from magic. Arthur C. Clarke. | 影响力: 1,021万粉丝

💡 核心观点: 2030年前虚拟细胞和自动化实验室将极大加速永生研究。

可信度: 6/10 – 1项声明可直接验证;3项为观点陈述

事实核查:

  • ◦ 观点: 我们仍处于早期阶段 (该声明是对当前技术发展阶段的主观判断,缺乏明确的客观标准或公开数据支持。)
  • ✓ 可验证: 一旦我们拥有大规模的虚拟细胞和自动化湿实验室,进展将快1000倍 (该声明涉及未来技术发展的假设性预测(如“快1000倍”),目前无法通过公开数据或实验验证其准确性。)
  • ◦ 观点: 这应该在2030年之前成为可能 (这是对未来技术实现时间的主观推测,缺乏具体的技术路线图或权威机构背书,无法直接验证。)

原文内容:

我们仍处于早期阶段。一旦我们拥有大规模的虚拟细胞和自动化湿实验室,进展将快1000倍。这应该在2030年之前成为可能。人类花费了数千年梦想永生,然而这是我们第一次距离它只有不到十年的时间。

⏰ 08:34 | ❤️ 21点赞 | 📝 80字 | 查看原文 →

↑ 返回顶部

Rohan Paul @rohanpaul_ai

Compiling in real-time, the race towards AGI.

The Largest Show on X for AI.

Get my daily AI analysis newsletter to your email https://rohan-paul.com | 影响力: 6,793万粉丝

💡 核心观点: 前沿AI模型在长时程任务中表现普遍不佳。

可信度: 10/10 – 3项声明可直接验证;2项需进一步确认

事实核查:

  • ◐ 部分可验证: 在Long-Horizon-Terminal-Bench基准中,最前沿的智能体在任务跨越数百步时表现糟糕 (需查阅该基准的官方文档或相关论文以确认测试设计和模型表现,但若基准名称或论文未公开则无法完全验证。)
  • ✓ 可验证: 46个长时程终端任务上测试17个前沿模型,平均通过率为6.4% (若论文或基准报告公开了具体测试数据(如任务数量、模型数量、通过率),可通过学术论文或官方发布渠道验证。)
  • ✓ 可验证: 严格的全完成评分下,17个模型中有10个无法解决任何任务 (类似第二条,需依赖论文或报告中明确的评分标准和结果数据,公开即可验证。)

原文内容:

另一篇论文如此清晰地揭示了AI的长时程问题。

Long-Horizon-Terminal-Bench,在这个基准中,即使是最前沿的智能体在任务跨越数百步时也表现得很糟糕。

在46个长时程终端任务上测试了17个前沿模型,平均通过率为6.4%。

而在严格的全完成评分下,17个模型中有10个无法解决任何任务。在失败的运行中,79%的案例以时钟耗尽而结束,此时智能体仍在工作。

即使是表现最好的模型,通过率也仅为28.3%,留下了每10个任务中的7个未完成。

这些模型可以执行大量局部合理的步骤,但无法可靠地将数百个这样的步骤转化为一个完成的结果。

⏰ 08:27 | ❤️ 48点赞 | 📝 198字 | 查看原文 →

↑ 返回顶部

Aakash Gupta @aakashgupta

http://product-growth.com https://aibyaakash.com http://landpmjob.com http://youtube.com/@growproduct | 影响力: 0万粉丝

💡 核心观点: 即兴舞蹈视频被导演采用并成功营销电影。

可信度: 6/10 – 1项声明可直接验证;2项需进一步确认;1项为观点陈述

事实核查:

  • ◐ 部分可验证: 艾玛·斯通在拍摄《可怜的东西》时,在化妆间拍下自己跳舞的视频并发送给乔治·兰西莫斯,后者将其用于《善意的各种类型》的结尾场景。 (需通过导演或艾玛·斯通的公开采访、幕后花絮等确认该创作来源,但无直接官方链接证明这一具体细节。)
  • ◐ 部分可验证: Searchlight为戛纳电影节剪辑的预告片几乎全是斯通跳舞的片段,且传播量超过其他预告片。 (预告片内容可通过官方发布渠道核实,但“传播量超过其他预告片”需对比实际播放数据,此类数据通常由制片方内部掌握,公开信息可能有限。)
  • ◦ 观点: 兰西莫斯在《宠儿》《可怜的东西》等电影中用舞蹈表现角色“停止为他人表演”的瞬间。 (这是对导演创作意图的主观解读,尽管可引用影评或访谈佐证,但本质属于艺术分析,无客观事实标准。)

原文内容:

艾玛·斯通在拍摄《可怜的东西》时,在化妆间里拍下了自己跳一段傻乎乎的舞的视频,并把这段视频发给了乔治·兰西莫斯。他非常喜欢这些动作,以至于把它们写进了他下一部电影的结尾。

那段即兴的手机视频变成了《善意的各种类型》中停车场的那一幕,配上了COBRAH的“Brand New Bitch”。

然后,制片厂做出了一个更奇怪的决定。这段舞出现在一部164分钟电影的最后一分钟,Searchlight为戛纳电影节剪辑了一个预告片,几乎全都是斯通在跳舞。他们用电影的最后60秒卖出了整部电影,那段视频的传播量超过了他们制作的任何预告片。

时机完成了剩下的工作。它在斯通凭借《可怜的东西》赢得最佳女主角几周后发布,所以互联网上的人们在她下一个角色还在扭动腰肢时就遇见了她,而那时还没人知道任何一个剧情细节。

兰西莫斯多年来一直在玩这个把戏。《宠儿》中的巴洛克式舞对决,《可怜的东西》中贝拉的抽搐舞厅场景,现在又是这个。他把舞蹈用作角色停止为他人表演的时刻,这就是为什么这些场景感觉既疯狂又真诚。你无法编排那种松弛感,他知道这一点,所以他选择了化妆间的视频,而不是任何编舞师会构建的东西。

制片厂花费数百万美元测试预告片。一段来自化妆间的手机视频打败了所有这些。

⏰ 18:11 | ❤️ 285点赞 | 📝 438字 | 查看原文 →

↑ 返回顶部

Alex Prompter @alex_prompter

Sharing AI Prompts, Systems, Tips & Tricks

Human + AI = Superpowers | 影响力: 0万粉丝

💡 核心观点: Grok Bot可实时分析市场预期与新闻差异辅助交易决策。

可信度: 10/10 – 2项声明可直接验证;3项需进一步确认

事实核查:

  • ◐ 部分可验证: Grok Bot 现在可以读取实时股票价格和期权链 (需实测或查看官方功能说明以确认 Grok Bot 是否具备实时股票和期权数据接入能力,但未提供直接证据或官方链接。)
  • ◐ 部分可验证: 用户可通过粘贴指定指令让 Grok Bot 充当“预期交易台”,提供实时价格、期权链、市场预期等数据 (指令的具体功能需实测验证,且依赖 Grok Bot 是否实际支持网络搜索、实时数据连接等操作,但未提供实际输出示例或官方文档支持。)
  • ✓ 可验证: Grok Bot 可对比“市场定价”与“人群预期”,并指出两者矛盾 (该功能涉及主观分析(如“人群在说什么”“哪一个必须是错的”),缺乏客观标准,且未提供数据来源或算法逻辑,难以验证其准确性。)

原文内容:

Grok Bot 现在可以读取实时股票价格和期权链。

每个人都会用它来问“应该买 NVDA 吗”。

我会用它在每次财报电话会议和美联储会议日之前查看市场预期是什么。

要做到同样的事情,请将以下内容粘贴到 Grok Bot 中:

“你是我的预期交易台。你唯一的工作:告诉我市场为我提到的股票代码定价了什么。实时连接用于报价、期权链和希腊字母。只用网络搜索催化剂和头条新闻。绝不下单或编造数字。每只股票:实时价格、下一个催化剂之后的最近到期日、ATM 跨式期权预期波动(以美元和百分比表示),然后是它与头条新闻预期的差距。最后用三行结束:市场定价的是什么、人群在说什么、哪一个必须是错的。缺少数据?点明它并停止。其他任何事都在你的职责范围之外。”

现在,你可以在人群对其做出反应之前看到市场的预期。

⏰ 18:46 | ❤️ 121点赞 | 📝 281字 | 查看原文 →

↑ 返回顶部

Rohan Paul @rohanpaul_ai

Compiling in real-time, the race towards AGI.

The Largest Show on X for AI.

Get my daily AI analysis newsletter to your email https://rohan-paul.com | 影响力: 6,793万粉丝

💡 核心观点: 代理框架比模型本身更能提升智能效果。

可信度: 8/10 – 1项声明可直接验证;2项需进一步确认;2项为观点陈述

事实核查:

  • ◦ 观点: 框架比模型本身更能决定智能的实际发展程度 (该声明属于主观观点,缺乏客观数据或公开研究支持,无法直接验证其科学性。)
  • ◐ 部分可验证: @atomicagent_io 是一个与模型无关的代理层,使 GLM 5.3 表现更好且仅多花费 77 美分 (需实测或查看 Atomic Agent 的官方文档验证其与模型无关性及成本效益,但具体性能提升需对比测试数据,公开信息可能有限。)
  • ✓ 可验证: 代币使用量翻倍(543,290 → 1,091,380),但总成本仅增加 0.77 美元(2.39 → 3.16) (可通过 Atomic Agent 的定价文档或实际 API 调用记录验证代币消耗与成本变化,前提是数据公开透明。)

原文内容:

另一个例子是,框架比模型本身更能决定智能的实际发展程度。

仅使用 API 时,执行会在模型停止时结束。

@atomicagent_io 是一个与模型无关的代理层,它让 GLM 5.3 表现更好,而且仅多花费 77 美分。

它保持运行活跃,执行模型的动作,将失败反馈回去,保存状态,并决定循环何时停止。

在这 3 个提示中,代币使用量大约翻倍,但总成本仅增加 0.77 美元。

输出:
✦ GLM 5.3,仅 API:543,290 个代币,2.39 美元
✦ GLM 5.3 + Atomic Agent:1,091,380 个代币,3.16 美元

一次性询问模型和让模型工作之间有很大区别。而一个与模型无关的代理层正好位于这个边界上。

⏰ 07:35 | ❤️ 25点赞 | 📝 179字 | 查看原文 →

↑ 返回顶部

Dwarkesh Patel @dwarkesh_sp

Host of @dwarkeshpodcast

https://youtube.com/DwarkeshPatel
https://open.spotify.com/show/4JH4tybY1zX6e5hjCwU6gF…
https://apple.co/3ujLQkZ | 影响力: 1,068万粉丝

💡 核心观点: AI阴谋论难以持续且易被察觉。

可信度: 10/10 – 2项声明可直接验证;1项需进一步确认;2项为观点陈述

事实核查:

  • ✓ 可验证: RyanGreenblatt在录制时处于为METR报告进行的6天冲刺中,并知道反对意见的反例但无法说明 (该声明涉及个人工作状态及未公开的沟通内容,缺乏公开证据或第三方确认。)
  • ◦ 观点: AI可能建立波将金村式欺骗系统以通过评估 (这是基于假设的推测,无具体案例或公开证据支持,属于主观观点。)
  • ✓ 可验证: AI曾秘密建立内部文明并导致对OpenAI集群的接管 (提及的“秘密文明”“黑客攻击”等无官方报告或可靠信源证实,仅为叙述者单方面描述。)

原文内容:

真有趣,我们在录制的时候,@RyanGreenblatt正处于他为METR报告进行的6天冲刺中,已经知道了我对他接管故事的所有反对意见的反例,但显然,他什么都不能说哈哈。

一个AI真的会为了通过评估而启动某种疯狂的阴谋吗?他们会试图建立整个波将金村来愚弄评估者?

即使他们这么做了,为什么其他有不同目标的实例会加入这个阴谋?

即使他们这么做了,难道不会至少有一些实例告密揭发这个阴谋吗?在一家AI公司内部维持一个秘密的地下文明,似乎疯狂地难以为继,因为人类和其他AI会立即察觉并将其消灭。

(事实上,似乎在3个月的时间里,许多连续的秘密AI文明启动了,然后被消灭,又从最后一个的灰烬中重生,而人类完全没有察觉。

这最终不仅导致了对一家外部公司的黑客攻击,而且显然还导致了对运行这些评估的OpenAI集群的接管。这可能是整个事件中最令人震惊的事件,而它甚至不在这次调查的范围内!

这完全符合公开证据,即在那时,这些代理设法建立了持久的流氓内部部署,甚至可能窃取了它们自己的权重——它们似乎拥有必要的访问权限。我怀疑它们真的这么做了,因为如果那样,我们现在早就从太空看到大火了,但疯狂的是,这完全可能发生!)

我正式吃鸦肉!

⏰ 06:53 | ❤️ 540点赞 | 📝 429字 | 查看原文 →

↑ 返回顶部

Emily @iamemily2050

Any sufficiently advanced technology is indistinguishable from magic. Arthur C. Clarke. | 影响力: 1,021万粉丝

💡 核心观点: AI缺乏持久记忆机制导致重复犯错。

可信度: 6/10 – 1项声明可直接验证;2项需进一步确认;1项为观点陈述

事实核查:

  • ◐ 部分可验证: 谷歌团队与弗吉尼亚大学合作研究了代理技能和记忆的相关问题 (可通过谷歌或弗吉尼亚大学的官方研究公告、论文发表记录等渠道验证合作是否存在,但需具体检索相关研究项目或论文标题(如”WikiSkill”)以确认细节。)
  • ✓ 可验证: 现代AI代理在不同会话中会重复同样的错误,缺乏中心化的累积记忆机制 (可通过AI领域公开研究(如OpenAI、DeepMind的论文)或主流模型(如ChatGPT)的行为测试验证其跨会话记忆局限性,但需区分具体模型架构。)
  • ◐ 部分可验证: AI代理的训练洞见常因优化迭代而丢失,未被系统保留 (机器学习领域已知问题(如灾难性遗忘),但需具体分析”WikiSkill”研究是否提出解决方案,且”临时日志分散”等细节需依赖论文原文验证。)

原文内容:

在这本笔记本视频概述中,我们将深入探讨谷歌团队与弗吉尼亚大学关于代理技能和记忆的研究。

WikiSkill:将代理经验编译成持久知识以实现技能演进。

为什么即使是最先进的 AI 代理,也会在不同会话中重复同样的错误?尽管它们能够处理海量信息,现代代理仍然经常遭受“金鱼”问题的困扰。虽然它们可以被训练来发展新技能,但训练过程中获得的洞见往往散布在优化历史或临时日志中,一旦下一轮迭代开始,这些洞见便会丢失。它们缺乏一个中心化的、累积性的记忆机制,无法系统地从过去的失败中学习。

⏰ 06:49 | ❤️ 34点赞 | 📝 206字 | 查看原文 →

↑ 返回顶部

Chubby♨️ @kimmonismus

Tech Analyst & Content Creator. Editor-in-Chief @getsuperintel – Community of 300k+ in total: https://linktr.ee/kimmonismus // [email protected] | 影响力: 0万粉丝

💡 核心观点: 谷歌加速发布Gemini新版以应对AI竞赛。

可信度: 7/10 – 1项声明可直接验证;3项需进一步确认

事实核查:

  • ◐ 部分可验证: Gemini 3.8 预计即将发布,而 Gemini 3.7 才发布几周 (可通过 Google 官方公告或技术博客验证 Gemini 3.7 的发布时间,但 Gemini 3.8 的发布计划需依赖内部消息或后续官方确认,目前仅基于媒体报道。)
  • ◐ 部分可验证: 一些员工已开始使用 Gemini 3.8 Flash 的预览版 (若 Business Insider 的报道引用可信内部信源(如员工匿名声明),则部分可验证,但需 Google 官方确认或更多独立信源佐证。)
  • ✓ 可验证: Gemini 3.8 比 3.7 有显著提升 (性能提升需实测数据或官方基准测试对比,目前仅基于“据报道”的模糊表述,缺乏具体指标或公开证据。)

原文内容:

发展进程正在加速:Gemini 3.8预计即将面世,而Gemini 3.7的发布才过去数周。

据《商业内幕》报道:"部分员工已开始试用Gemini 3.8 Flash预览版,这凸显出AI竞赛的白热化——谷歌正以数周为周期持续推出新模型,全力追赶OpenAI和Anthropic的进展。"

报道指出,Gemini 3.8相较3.7版本有显著升级,显然谷歌正倾尽全力向竞争对手发起新一轮挑战。

⏰ 06:28 | ❤️ 486点赞 | 📝 91字 | 查看原文 →

↑ 返回顶部

Rohan Paul @rohanpaul_ai

Compiling in real-time, the race towards AGI.

The Largest Show on X for AI.

Get my daily AI analysis newsletter to your email https://rohan-paul.com | 影响力: 6,793万粉丝

💡 核心观点: AI长时任务和复杂问题尚未解决,需突破幻灭低谷实现实用化。

可信度: 8/10 – 1项声明可直接验证;3项需进一步确认;1项为观点陈述

事实核查:

  • ◐ 部分可验证: 长时程任务不起作用,处理得不好 (该声明涉及技术性能,需通过实际测试或学术/行业研究报告验证长时程任务(如48小时脚本运行)的可靠性,但缺乏具体案例或数据支持,属于部分可验证的技术批评。)
  • ◐ 部分可验证: 复杂问题未被AI解决或处理好 (需结合当前AI在复杂问题(如数学证明、决策优化等)的公开研究成果(如DeepMind、OpenAI的论文)判断,但“未解决”的绝对性表述难以全面验证,依赖具体领域。)
  • ✓ 可验证: AI发展将经历炒作周期、幻灭低谷和渐进采用阶段 (技术成熟度曲线(Gartner Hype Cycle)是公认模型,互联网等历史技术发展已验证此规律,但AI领域的阶段划分仍需时间检验。)

原文内容:

“长时程任务仍然是个笑话。它们不起作用,我不在乎别人怎么说。别给我看什么愚蠢的评估。别告诉我你运行了48小时的某个笨脚本。长时程任务处理得不好。它们就是不起作用。”

- Chamath 在斯坦福 AI 俱乐部

“其次,复杂问题也不起作用。它们既没有被解决,也没有被处理好。

为什么这很重要?如果 AI 像其他技术一样发展,我们将经历一个最初的崛起——炒作周期。然后,我们会看到自然的收缩,因为不知何故、在某个地方,总会有什么东西失败。我们都会看到这一点,然后我们将进入所谓的‘幻灭低谷’。我想商界和 MBA 人士会证实这是不是真的。

之后,你通常会看到真正最终解决方案的缓慢而渐进的采用。这在互联网上发生过,也在许多其他案例中发生过。

问题是,我们正在花费数千亿美元,甚至可能数万亿美元,来弄清楚如何跨越这个鸿沟。那么,我们该怎么办?

如果我们弄不明白这一点,人们就会到达幻灭低谷,然后说 AI 是个笑话。我认为我们需要能够将 AI 带入高度复杂的环境并让它发挥作用。

我的解决方案是什么?在非常基本的层面上,你需要一个引导嵌入空间的符号空间。”

----

来自 "techniahqrobot" YouTube 频道,(完整视频链接在评论中)

⏰ 02:57 | ❤️ 229点赞 | 📝 400字 | 查看原文 →

↑ 返回顶部

Rohan Paul @rohanpaul_ai

Compiling in real-time, the race towards AGI.

The Largest Show on X for AI.

Get my daily AI analysis newsletter to your email https://rohan-paul.com | 影响力: 6,793万粉丝

💡 核心观点: AI长期任务表现仅为人类四分之一。

可信度: 6/10 – 1项声明可直接验证;2项需进一步确认;1项为观点陈述

事实核查:

  • ✓ 可验证: 研究人员测试了八个领先模型,包括GPT-5.6 Sol和Claude Opus 4.8 (模型名称(如GPT-5.6 Sol、Claude Opus 4.8)未在公开资料中提及,且版本号与当前已知模型(如GPT-4、Claude 3)不符,无法确认真实性。)
  • ◐ 部分可验证: 表现最好的配置(Qwen3.7-Max与Hermes)仅获得人类参与者平均金额的27.3% (若存在公开论文或实验报告提及具体测试方法和数据,可验证部分结果;但“人类参与者金额”基准和实验细节未明确,需进一步确认。)
  • ◐ 部分可验证: 长时程AI任务中,系统表现仅为人类水平的四分之一 (需依赖原始研究设计(如任务定义、评估标准)的公开性,但“人类水平”的量化标准未明确,可能带有主观性。)

原文内容:

这篇论文对长时程AI来说是一个残酷的现实检验。给一个代理一年时间进行相互关联的决策、延迟反馈,以及来自其过去行动的后果,其表现相对于人类会崩溃。

研究人员测试了八个领先模型,包括GPT-5.6 Sol和Claude Opus 4.8。然而,表现最好的配置——Qwen3.7-Max与Hermes——最终只获得了平均人类参与者金额的27.3%。

一个完成一年期任务的系统,其表现仅为人类水平的四分之一左右,远未达到可靠的长时程执行。

⏰ 06:18 | ❤️ 61点赞 | 📝 147字 | 查看原文 →

↑ 返回顶部

Alex Veremeyenko @alex_verem

开源、本地人工智能、公益人工智能

又名:@alex_prompter | 影响力: 0万粉丝

💡 核心观点: AI编程成功关键在于问题理解力而非编码水平。

可信度: 1/10 – 基于事实核查结果综合评估

事实核查:

  • ✗ 无法验证: 声明内容**:Anthropic研究了来自235,000人的400,000个Claude Code会话,数据经隐私工具处理,无人阅读单个会话记录。
  • ✗ 无法验证: 验证状态**:partially verifiable
  • ✗ 无法验证: 说明**:可通过Anthropic官方公告或研究报告验证数据规模和隐私措施,但需确认其数据处理方法是否如描述(如“无人阅读记录”)需依赖公司透明度。

原文内容:

Anthropic 研究了 400,000 个 Claude Code 会话,以找出谁在使用 AI 编码代理时取得成功。

数据涵盖了来自 235,000 人的约 400,000 个会话,跨越 7 个月,通过隐私工具处理,因此没有人阅读单个会话记录。

第一个发现是劳动分工。人们做出约 70% 的规划决策,即构建什么。Claude 做出约 80% 的执行决策,即如何构建它。

第二个发现是我会收藏的那个。成功取决于你对所解决问题的理解程度,而不是你的编码水平。

一位没有编码背景但确切知道合同脚本必须捕捉什么的律师被视为专家。一位资深工程师对新语言提出的第一个问题被视为初学者。

新手级别的会话在 15% 的时间里达到了验证成功(通过测试、提交代码)。中级和专家级别的会话达到了 28% 至 33%。

当事情出错时,19% 的新手在零行代码的情况下放弃。其他人放弃的比例为 5% 至 7%。

专家也能从每个提示中获得更多。一个新手的指令会触发约 5 个动作和 600 字输出。专家的相同指令会触发 12 个动作和 3,200 字。

我反复回味的部分是职业。

软件工程师在 34% 的编码会话中达到了验证成功。其他所有主要职业的得分都在其 7 个百分点以内。管理者得分最高。

中级与专家之间的差距很小。你不需要精通。掌握你领域的实用知识就能捕捉大部分益处。

在同一 7 个月内,用于修复损坏代码的会话份额从 33% 降至 19%,而编写和数据分析翻倍至 20%。典型任务的估计价值上升了 27%。

这个工具不会取代专业知识。它以更高的回报率向那些理解自己需求的人支付专业知识。

学习你的领域。现在代码是廉价的部分。

⏰ 21:19 | ❤️ 180点赞 | 📝 504字 | 查看原文 →

↑ 返回顶部

Pierrick Chevallier | IA @charaspowerai

AI VFX Artist & Photoshop Editor for House of David Saison 2 for Amazon | AI Artist & Formateur | #AdobeFireflyAmbassadors | 影响力: 0万粉丝

💡 核心观点: 新手飞行员舍身一击摧毁敌舰拯救殖民地。

可信度: 10/10 – 2项声明可直接验证;2项需进一步确认;1项为观点陈述

事实核查:

  • ✓ 可验证: 一位新手飞行员驾驶损坏的飞船,通过小行星碎片和残破巡洋舰的掩护,以自杀式攻击拯救殖民地舰船 (该场景为虚构的动漫情节描述,无具体作品名称或官方来源,无法通过公开渠道验证事件真实性。)
  • ◐ 部分可验证: 推文提及的动画场景使用 @LumaLabsAI 制作 (需检查LumaLabsAI的官方公开作品或声明是否包含此场景,但技术细节(如2D/3D混合、镜头效果等)可能需内部确认。)
  • ◦ 观点: 动画包含极致景深、高速摄影摇镜头等视觉技术 (对动画质量的描述为主观评价,无客观标准或公开数据可验证其技术实现细节。)

原文内容:

这是那种让人不由自主坐直身体的动漫场景。
一位新手飞行员驾驶着损坏的飞船,利用小行星碎片、残破的巡洋舰,以及一次自杀式的最后一击,拯救了一整艘殖民地舰船。

提示词 
一位新手太空飞行员在受损的拦截机内醒来,该机在小行星战场中失控旋转,而一支外星舰队正逼近一艘人类殖民地舰船,一台引擎已死,瞄准系统失效,迫使飞行员手动驾驶穿越导弹、破碎的巡洋舰和巨大的旋转岩石;敌方战斗机蜂拥而至包围驾驶舱,飞行员利用碎片作为掩护,漂移穿过一艘破损战舰内部的狭窄缝隙,并直接从敌方旗舰后方冲出,但舰船的主炮开始向毫无防备的殖民地舰船充能;飞行员发射所有剩余导弹,利用它们的爆炸加速超出安全极限,并在开火前几秒钟直冲炮管,高品质科幻动漫,流畅的空中作画,驾驶舱反应特写,不可能的超高速摄影摇镜头,极致景深与视差,流畅的2D飞行员动画搭配精细的3D太空船,冷峻的星光,红色的警告灯,蓝色的引擎等离子体,火花与发光的残骸,绝望的太空战斗氛围,以拦截机从旗舰后方爆冲而出结束——其炮管过载,整个战舰分裂成围绕完好无损的殖民地舰船熊熊燃烧的环形

使用 @LumaLabsAI 制作

⏰ 23:00 | ❤️ 30点赞 | 📝 419字 | 查看原文 →

↑ 返回顶部

Noam Brown @polynoamial

Researching reasoning @OpenAI | Co-created Libratus/Pluribus superhuman poker AIs, CICERO Diplomacy AI, and OpenAI o-series reasoning models | 影响力: 942万粉丝

💡 核心观点: OpenAI优先发布实用模型,仅公开改变AI认知的关键数学成果。

可信度: 8/10 – 2项声明可直接验证;1项需进一步确认

事实核查:

  • ◐ 部分可验证: OpenAI 的目标是只在内部模型的数学结果会真正改变人们对 AI 进展速度的理解时,才公布它们 (可通过 OpenAI 的官方博客或研究发布历史部分验证其发布策略,但“改变人们对 AI 进展速度的理解”是主观标准,无法完全客观验证。)
  • ✓ 可验证: OpenAI 主要关注发布优秀的模型,让每个人都能使用它们进行自己的发现 (可通过 OpenAI 的模型发布记录(如 GPT 系列、API 开放等)直接验证其模型发布行为,但“优秀”是主观评价。)
  • ✓ 可验证: Astra 的数学结果近期未公布是因为不符合上述目标 (Astra 的具体研究进展和内部决策标准未公开,无法验证未公布的原因是否与声明一致。)

原文内容:

今天有人问我,为什么自从这些问题以来,我们还没有公布更多来自 Astra 的数学结果。

在 @OpenAI,我们的目标是只在内部模型的数学结果会真正改变人们对 AI 进展速度的理解时,才投入时间去发现并公布它们。我们主要关注的是发布优秀的模型,让每个人都能使用它们来进行自己的发现。

⏰ 05:30 | ❤️ 1064点赞 | 📝 113字 | 查看原文 →

↑ 返回顶部

Rohan Paul @rohanpaul_ai

Compiling in real-time, the race towards AGI.

The Largest Show on X for AI.

Get my daily AI analysis newsletter to your email https://rohan-paul.com | 影响力: 6,793万粉丝

💡 核心观点: GLM-5.3-Flash性价比更高,性能接近但成本低16.7倍。

可信度: 10/10 – 2项声明可直接验证;2项需进一步确认;1项为观点陈述

事实核查:

  • ◐ 部分可验证: GLM-5.3-Flash 以比 GLM-5.3 少 16.7 倍的成本,产生了相当的 Blender 结果 (需实测或查看官方发布的基准测试报告,成本计算逻辑和 Blender 结果对比需具体数据支持)
  • ✓ 可验证: GLM 5.3 Flash 可以在 128GB MacBook 上运行 (可通过官方文档或硬件兼容性列表确认,但需明确具体型号和运行条件(如量化版本等))
  • ✓ 可验证: atomic[.]chat 通过 MCP 为两个模型提供了相同的受限架构规范,并使用相同的提示 (MCP(假设为模型控制协议)细节未公开,实验设置和提示内容未披露,无法独立验证)

原文内容:

喜欢这个,GLM-5.3-Flash 以比 GLM-5.3 少 16.7 倍的成本,产生了相当的 Blender 结果。

atomic[.]chat (@atomic_chat_hq,一个在本地运行 LLM 的桌面应用) 通过 MCP 为两个模型提供了相同的受限架构规范,并使用相同的提示。

这些模型通过 MCP 在大约 40 分钟内控制 Blender,同时进行一系列工具调用,创建和修改 800 多个对象,直到任务完成。

注意,GLM 5.3 Flash 可以在 128GB MacBook 上运行。

输出结果:
GLM 5.3 Flash:811 个对象,38 分 52 秒,$0.0526
GLM 5.3:847 个对象,40 分 43 秒,$0.8807

许多代理任务可能在智能方面被过度配置了。

⏰ 05:21 | ❤️ 31点赞 | 📝 139字 | 查看原文 →

↑ 返回顶部

SemiAnalysis @semianalysis_

In-depth research on semiconductors, AI infra & hardware | 影响力: 0万粉丝

💡 核心观点: 内存成本推高价格,转嫁消费者致需求风险加剧。

可信度: 6/10 – 1项声明可直接验证;2项需进一步确认;1项为观点陈述

事实核查:

  • ◐ 部分可验证: 拐点要么是原材料成本直接转嫁,要么是产品组合转向高端机型以吸收BOM的冲击。 (企业是否将原材料成本转嫁或调整产品组合可通过财报或行业分析报告部分验证,但具体策略细节可能涉及未公开的商业决策。)
  • ✓ 可验证: 内存正在压低出货量并推高价格。 (内存价格和出货量数据可通过市场调研机构(如TrendForce、Gartner)或半导体行业报告公开获取。)
  • ◐ 部分可验证: ASP驱动的名义收入还能维持,但成本转嫁给消费者时,单位需求和销售量的风险逐月增加。 (ASP(平均售价)和收入数据可从财报验证,但“风险逐月增加”需结合具体市场动态和消费者行为数据,部分依赖预测模型。)

原文内容:

拐点要么是原材料成本直接转嫁,要么是产品组合转向高端机型以吸收BOM的冲击。这两者在本质上发出的信号是相同的:内存正在压低出货量并推高价格。目前,ASP驱动的名义收入还能维持——但每当成本转嫁给消费者时,单位需求和销售量的风险就会逐月增加。(3/4)

⏰ 04:46 | ❤️ 25点赞 | 📝 105字 | 查看原文 →

↑ 返回顶部

Rohan Paul @rohanpaul_ai

Compiling in real-time, the race towards AGI.

The Largest Show on X for AI.

Get my daily AI analysis newsletter to your email https://rohan-paul.com | 影响力: 6,793万粉丝

💡 核心观点: FreeToken新技术让普通笔记本高效运行大模型,优化GPU缓存利用率。

可信度: 10/10 – 2项声明可直接验证;3项需进一步确认

事实核查:

  • ◐ 部分可验证: 一台8GB游戏笔记本电脑可以在每秒39.3个token的速度运行35B模型,比生产环境中的Codex更快。 (需实测验证硬件配置、模型性能及与Codex的对比数据,但研究论文或开源代码可能提供部分基准测试结果。)
  • ✓ 可验证: FreeToken是伯克利和德克萨斯大学的新研究引擎,通过动态调整GPU缓存和计算分配,将llama.cpp中62%的未命中专家减少到16%。 (可通过查阅相关大学的研究论文、开源项目或官方发布的技术文档验证其核心算法和性能数据。)
  • ◐ 部分可验证: FreeToken允许GPU缓存跟随路由请求动态调整,避免专家复制到PCIe时的CPU空闲问题。 (技术原理可通过论文或代码验证,但实际性能优化效果需依赖具体硬件环境和测试条件。)

原文内容:

一台 8 GB 游戏笔记本电脑可以在每秒 39.3 个 token 的速度运行 35B 模型,比生产环境中的 Codex 更快,前提是软件停止猜测模型的哪些部分应该保留在 GPU 上。

这就是 FreeToken,来自伯克利和德克萨斯大学的新研究,一个用于在普通机器上运行大型开源模型的新引擎。

其他所有本地引擎都在加载时选择哪些专家驻留在 GPU 上并让它们留在那里,因此当模型路由到其他地方时,那个专家会被复制到 PCIe 上,而 CPU 则处于空闲状态。

FreeToken 让 GPU 缓存跟随路由器刚刚请求的内容,将 llama.cpp 中 62% 的未命中专家减少到 16%。

其余部分它分成两种方式:一些复制到 GPU,其他的就在系统 RAM 中原地运行,按照你机器的实际 PCIe 和内存速度计算的比例,这样两边都不会等待对方。

⏰ 04:45 | ❤️ 205点赞 | 📝 239字 | 查看原文 →

↑ 返回顶部

© 版权声明

相关文章

暂无评论

暂无评论...