【AI 英文奏折】07月23日

x每日奏折17小时前发布 tianming
38 0 0

【AI 英文奏折】2026年07月23日

共收录 20 篇深度内容


📋 今日内容速览

快速浏览,点击感兴趣的推文查看详细分析

  1. SemiAnalysis: 对比Rubin与GB200的能效、成本及软件生态优势。
  2. Bindu Reddy: 谷歌资助竞争对手Anthropic是自取灭亡。
  3. Santiago Valdarrama: Claude Code因会话限制无法完成大型迁移任务。
  4. Rohan Paul: 强AI需持续测试改进以提升研究能力。
  5. Bindu Reddy: AI大脑测试使智能代理记忆增强200%,接近超级智能。
  6. Rohan Paul: Muon优化器通过改进信用分配和学习率显著提升AI智能体表现。
  7. swyx: 工程师应重视控制面与数据面的分离并尽早了解管理面。
  8. Santiago Valdarrama: AI时代,核心竞争力仍是人才、创意和资源。
  9. Anthony Pompliano: 志同道合的异类群体形成隐秘的信念联盟。
  10. Machina: 工程师用循环自动提示AI,未来将转向图结构。
  11. Marc Lou: AI流量远超人类,Meta主导训练,OpenAI爬取最活跃。
  12. Rohan Paul: Kimi K3性能接近Fable-5但成本高10倍于K2.6。
  13. SemiAnalysis: 超微凭全球供应链和定制化服务器架构成为初创企业首选。
  14. Gary Marcus: 长期关注AI安全但非末日论者。
  15. Chubby♨️: 美企反对限制中国AI模型,称将阻碍初创企业发展。
  16. Ethan Mollick: AI能出色解决复杂商业问题且进步迅速。
  17. Rohan Paul: 利用模型内部表征自动过滤无关代码行提升效率。
  18. Machina: 图形工程用分合菱形模式管理任务流程。
  19. Rohan Paul: NVIDIA集群集成全球尖端技术,72GPU协同如一。
  20. Chubby♨️: 开源本地代理性能超越Hermes,展现强大竞争力。

📖 详细内容

【AI 英文奏折】07月23日SemiAnalysis @semianalysis_

In-depth research on semiconductors, AI infra & hardware | 影响力: unknown万粉丝

💡 核心观点: 对比Rubin与GB200的能效、成本及软件生态优势。

可信度: 10/10 – 2项声明可直接验证;3项需进一步确认

事实核查:

  • ◐ 部分可验证: Rubin采用LUT Based Tensor Core架构 (需等待NVIDIA官方发布详细架构白皮书或技术文档确认,目前仅基于行业传闻或泄露信息。)
  • ✓ 可验证: Rubin与GB200 NVL72的TCO(总拥有成本)对比分析 (TCO涉及未公开的定价、能耗等商业数据,且需实际部署场景验证,目前无公开可靠来源。)
  • ◐ 部分可验证: Rubin支持PyTorch、vLLM、OpenAI Triton等软件生态

原文内容:

Vera Rubin NVL72与GB200 NVL72对比?  
推理总拥有成本(TCO)及架构分析:  
Rubin基于LUT的张量核心、Feynman架构、  
机柜级设计、每兆瓦性能、每美元性能、  
软件优化、公开版Rubin软件、  
PyTorch框架、vLLM推理引擎、OpenAI Triton编译器

⏰ 10:53 | ❤️ 22点赞 | 📝 30词 | 查看原文 →

↑ 返回顶部

【AI 英文奏折】07月23日Bindu Reddy @bindureddy

CEO of @abacusai – the world’s first AI super assistant and a powerful general agent for professionals and enterprises, ex-AWS & Google | 影响力: 273.0k万粉丝

💡 核心观点: 谷歌资助竞争对手Anthropic是自取灭亡。

可信度: 5/10 – 2项需进一步确认;2项为观点陈述

事实核查:

  • ◐ 部分可验证: Google is burning billions to fund Anthropic (Google或Alphabet对Anthropic的投资金额和具体细节可能通过公开财报、新闻稿或监管文件部分验证,但“burning billions”的表述需具体数据支持,且可能包含夸张成分。)
  • ◐ 部分可验证: Google funds Anthropic to win the AGI race (Google的投资动机可能通过高管访谈或公司战略声明间接推测,但“AGI race”属于行业术语,其竞争目标和具体关联性需进一步证据支持。)
  • ◦ 观点: Funding Anthropic will eventually kill Google (该声明为推测性观点,基于假设性逻辑(Anthropic可能取代Google),无客观事实或公开证据可直接验证。)

原文内容:

真想做空谷歌转投Anthropic

谷歌正豪掷数十亿美元资助Anthropic以赢得通用人工智能竞赛!!

这逻辑根本说不通——你为什么要资助将来会干掉自己的人?

⏰ 10:51 | ❤️ 23点赞 | 📝 35词 | 查看原文 →

↑ 返回顶部

【AI 英文奏折】07月23日Santiago Valdarrama @svpino

| 影响力: unknown万粉丝

💡 核心观点: Claude Code因会话限制无法完成大型迁移任务。

可信度: 10/10 – 2项声明可直接验证;3项需进一步确认

事实核查:

  • ◐ 部分可验证: Claude Code在迁移任务中因上下文窗口和用量限制而中途退出 (需实测Claude Code的上下文限制和任务中断行为,但官方文档可能提供相关参数(如token限制),具体任务表现依赖用户环境。)
  • ◐ 部分可验证: Claude Code和Codex设计为单任务运行,无法处理需多层分解的复杂任务 (官方文档可能提及代理的会话限制,但“无法处理多层任务”需结合具体案例验证,部分依赖用户主观判断。)
  • ✓ 可验证: Fractal是开源CLI工具,可驱动Claude Code/Codex实现多级任务分发 (开源代码库(如GitHub)可直接验证其功能描述,但实际效果需实测。)

原文内容:

Claude Code在迁移任务执行到一半时总是中途退出。

它能完成部分文件处理,但随后就会耗尽上下文窗口并触达使用限制。这种情况下很难从中断处继续原有进程。

Claude Code和Codex的特性决定了它们每次只能执行单一任务。智能体所有认知都存在于单次运行会话中,其承载能力存在上限。

小型任务尚可应对。但分解成二十个子任务的大型项目就会超出负荷。

我见过一些能让主智能体将工作分派给辅助智能体的工具,但这些辅助体通常只完成单项任务、返回结果后就会终止。它们无法自主创建下一级辅助体。

若你的问题需要三四级分层处理,那就无计可施了。

Fractal这个开源CLI工具解决了这个痛点。

Fractal能替你驱动Claude Code或Codex。只需指定任务,它就会启动智能体集群,允许每个智能体根据任务需求将工作无限向下分派给更多层级的子智能体。

这带来了革命性改变!

1. 对于迁移任务,Fractal将其分解为树状结构
2. 顶层智能体将工作划分为若干大模块
3. 每个模块由专属智能体负责
4. 若模块仍过大,该智能体会继续拆分
5. 每个智能体独立完成规划、执行、审查和提交
6. 循环此流程直至任务完成
7. 随后将成果沿树状结构向上传递
8. 最终所有完成模块会合并回根任务

每个智能体拥有独立的git工作树,并实时提交变更,因此多智能体可并行工作而不会相互覆盖。

这使得流程具备可恢复性:你可以随时停止Fractal并在后续重启,而不会丢失已完成部分。

值得一提的是,你可以为智能体设置严格预算。包括限制树状深度、子智能体创建数量、迭代次数以及持续工作时长。

所有操作都在本地笔记本完成,无需云端托管。

详见下方GitHub仓库。

⏰ 22:46 | ❤️ 56点赞 | 📝 382词 | 查看原文 →

↑ 返回顶部

【AI 英文奏折】07月23日Rohan Paul @rohanpaul_ai

Compiling in real-time, the race towards AGI. The Largest Show on X for AI. | 影响力: 0万粉丝

💡 核心观点: 强AI需持续测试改进以提升研究能力。

可信度: 10/10 – 2项声明可直接验证;3项需进一步确认

事实核查:

  • ◐ 部分可验证: 当前最强的AI研究代理在长期研究工作中表现不佳,主要因为它们难以持续测试和改进 (需通过论文原文或实验复现验证AI代理在长期任务中的具体表现数据,但推文未提供直接论文链接或实验细节。)
  • ✓ 可验证: AutoLab基准测试包含36项任务,要求代理从初始代码开始并在固定时间内改进 (若论文公开(如arXiv或会议论文),可直接查看任务设计、代码库及时间限制等具体参数。)
  • ◐ 部分可验证: Claude Opus 4.6在基准测试中领先,因其持续利用反馈而非首次猜测的准确性 (需验证论文中的模型排名和评估方法,但模型具体表现细节可能依赖未公开的测试数据。)

原文内容:

强大的AI智能体在长期研究工作中仍面临挑战,因为它们往往难以持续进行测试和改进。

本研究表明,当今最先进的研究型智能体取得成功并非依赖灵光乍现,而是源于坚持不懈的测试。

论文提出AutoLab基准测试,包含36项任务。每个智能体需从可运行但低效的代码出发,在限定时间内完成优化。这些任务涵盖系统加速、算法谜题、模型开发和CUDA内核优化,不仅测试单次编码能力,更评估长期工作管理能力。

研究者测试了17个前沿模型,发现最佳成果主要并非源于初始构想的优越性,而是取决于模型能否保持活跃状态、频繁测试并有效利用反馈。成功的核心因素不是最初灵感的优劣,而是持续优化的毅力。

Claude Opus 4.6在基准测试中领先,并非因其总能立即给出正确答案,而是因为它持续进行基准评估,并将实证反馈融入后续尝试。其他多个前沿模型的失败模式更具启示性:它们要么过早放弃剩余时间,要么因过度思考导致超时却未提交有效成果。

——arxiv.org/abs/2606.05080
标题:《AutoLab:前沿模型能否解决长期自动化研究与工程任务?》

⏰ 17:25 | ❤️ 23点赞 | 📝 216词 | 查看原文 →

↑ 返回顶部

【AI 英文奏折】07月23日Bindu Reddy @bindureddy

CEO of @abacusai – the world’s first AI super assistant and a powerful general agent for professionals and enterprises, ex-AWS & Google | 影响力: 273.0k万粉丝

💡 核心观点: AI大脑测试使智能代理记忆增强200%,接近超级智能。

可信度: 6/10 – 1项声明可直接验证;1项需进一步确认;1项为观点陈述

事实核查:

  • ◐ 部分可验证: Testing a beta version of our “AI brain” on my work (可通过官方公告或开发日志验证是否在测试beta版本,但“AI brain”的具体定义和测试细节需进一步确认)
  • ✓ 可验证: The brain creates long-term memories and appears to make Fable-5 200% smarter (“long-term memories”和“200% smarter”缺乏量化标准或公开基准测试数据,无法独立验证)
  • ◦ 观点: A long-running agent with a self-correcting long-term memory is quite literally SUPER INTELLIGENCE (“SUPER INTELLIGENCE”为主观断言,未提供客观证据或公认定义支持)

原文内容:

在工作中测试我们"AI大脑"的测试版

该大脑能生成长期记忆,似乎使Fable-5的智能水平提升了200%...

一个具备自我修正长期记忆功能的持续运行智能体,本质上就是超级智能的体现

⏰ 10:09 | ❤️ 130点赞 | 📝 39词 | 查看原文 →

↑ 返回顶部

【AI 英文奏折】07月23日Rohan Paul @rohanpaul_ai

Compiling in real-time, the race towards AGI. The Largest Show on X for AI. | 影响力: 0万粉丝

💡 核心观点: Muon优化器通过改进信用分配和学习率显著提升AI智能体表现。

可信度: 6/10 – 1项声明可直接验证;1项需进一步确认;1项为观点陈述

事实核查:

  • ◐ 部分可验证: Muon optimizer nearly doubled an AI agent’s success (可通过论文(arxiv. org/abs/2607.16169)验证具体实验数据,但需确认实验设置和复现性。)
  • ✓ 可验证: With GiGPO, Muon raised late success from 0.29 to 0.55 (论文中应包含具体数值和实验方法,可直接通过公开论文验证。)
  • ◦ 观点: An optimizer cannot be judged alone because the surrounding reinforcement-learning setup may decide whether it helps or fails (属于对优化器性能依赖性的主观分析,缺乏直接可验证的客观标准。)

原文内容:

μ子优化器将AI智能体的成功率提升近一倍,表明其强化学习效果取决于信用分配和学习率设定。

通过采用GiGPO算法(该技术可对比重复状态下的动作选择),μ子优化器将后期成功率从0.29提升至0.55。

评估优化器不能孤立进行,因为周边强化学习框架的配置将决定其最终成效或失效。

——arxiv.org/abs/2607.16169

⏰ 16:37 | ❤️ 37点赞 | 📝 57词 | 查看原文 →

↑ 返回顶部

【AI 英文奏折】07月23日swyx @swyx

| 影响力: unknown万粉丝

💡 核心观点: 工程师应重视控制面与数据面的分离并尽早了解管理面。

可信度: 6/10 – 1项声明可直接验证;1项需进一步确认;1项为观点陈述

事实核查:

  • ◐ 部分可验证: 在工程职业生涯的某个阶段,会有经验丰富的老手向你讲解独立可分离的控制平面与数据平面的重要性 (该声明描述了工程领域的常见经验,可通过行业从业者访谈或技术社区讨论部分验证,但具体发生场景和频率因人而异,无法普遍量化。)
  • ✓ 可验证: 独立可分离的控制平面与数据平面非常重要 (这是网络和系统架构中的经典设计原则,可通过技术文档(如RFC、架构白皮书)或权威教材(如《计算机网络》)直接验证其重要性。)
  • ◦ 观点: 应尽早学习管理平面(management plane)的相关知识 (建议学习优先级属于主观经验分享,无客观标准;管理平面的重要性虽可验证(如通过技术文档),但“尽早学习”是个人观点。)

原文内容:

在你工程师生涯的某个时刻,总会有一位白发智者向你传授控制平面与数据平面独立分离的重要性。

务必谨记这番教诲。

(然后尽早去了解管理平面的相关知识......)

⏰ 11:47 | ❤️ 669点赞 | 📝 47词 | 查看原文 →

↑ 返回顶部

【AI 英文奏折】07月23日Santiago Valdarrama @svpino

| 影响力: unknown万粉丝

💡 核心观点: AI时代,核心竞争力仍是人才、创意和资源。

可信度: 6/10 – 3项需进一步确认;2项为观点陈述

事实核查:

  • ◦ 观点: Those with the best ideas will still win. (该声明属于主观判断,缺乏客观标准定义“最好的想法”或“胜利”的具体指标,且成功受多重因素影响(如执行、运气等),无法通过公开数据验证。)
  • ◐ 部分可验证: AI lifts every boat equally. (AI技术普及可能降低基础工具门槛,但“平等受益”需具体数据(如不同群体的生产力提升对比),目前仅能通过部分案例或研究间接验证,无法全面量化。)
  • ◦ 观点: Your brain is all that matters. (强调个人智力的决定性作用,但忽略资源、环境等外部因素,属于主观断言,无客观验证依据。)

原文内容:

既然人人都能通过向模型输入指令来创造任何东西,我们便又回到了原点:

你的大脑才是关键所在。

• 拥有最佳创意的人依然会胜出。
• 工作最努力的人仍将超越其他所有人。
• 资金更雄厚者能组建顶尖团队并保持领先地位。

人工智能平等地提升所有船只。

它或许能优化你的工作成果,但同样会提升竞争对手的产出。它或许能加快你的速度,但也在为所有人提速。

那么,你的优势何在?

答案始终如一:

你的大脑。

⏰ 20:47 | ❤️ 273点赞 | 📝 101词 | 查看原文 →

↑ 返回顶部

【AI 英文奏折】07月23日Anthony Pompliano @apompliano

Entrepreneur, investor, and lifelong learner. | 影响力: 2134k万粉丝

💡 核心观点: 志同道合的异类群体形成隐秘的信念联盟。

可信度: 6/10 – 1项声明可直接验证;1项需进一步确认;1项为观点陈述

事实核查:

  • ✓ 可验证: 作者在纽约街头遇到自称“misfit”的人时会理解其含义 (该声明基于个人主观体验和互动,无法通过公开渠道验证他人对“misfit”一词的具体理解或作者的反应。)
  • ◐ 部分可验证: 存在一个“小而隐秘的信仰者团体”(small, secret gang of believers) (若该团体有公开活动或成员身份可查(如社交媒体群组),则部分可验证;但“隐秘”性质可能限制信息获取,需依赖内部成员确认。)
  • ◦ 观点: “misfit”一词在特定群体中有共享含义 (此为主观断言,未提供具体定义或证据,无法验证群体是否实际存在或对该词有共识。)

原文内容:

当你们任何人在纽约街头遇见我,对我说"我是个不合群的人",我会立刻明白你的意思。

我们是一小群隐秘的信徒。

⏰ 08:42 | ❤️ 137点赞 | 📝 34词 | 查看原文 →

↑ 返回顶部

【AI 英文奏折】07月23日Machina @exm7777

running ai-powered agencies | weeklyaiops.com | 影响力: unknown万粉丝

💡 核心观点: 工程师用循环自动提示AI,未来将转向图结构。

可信度: 8/10 – 2项声明可直接验证;1项需进一步确认;1项为观点陈述

事实核查:

  • ✓ 可验证: the engineer who built Claude Code stopped writing code MONTHS ago (该声明涉及工程师的个人工作状态变更,属于未公开的内部信息,缺乏官方或第三方公开证据支持。)
  • ◐ 部分可验证: he even stopped prompting Claude entirely… loops prompt it for him now (关于”loops自动生成prompt”的技术细节可能部分可通过官方文档或API功能验证,但具体个人工作流程无法确认。)
  • ◦ 观点: graphs are the next step up from loops (该声明是对技术发展路径的主观预测,无客观事实或当前技术实现作为依据。)

原文内容:

构建Claude Code的工程师早在数月前就已停止亲自编写代码

事实上,他甚至完全不再直接给Claude输入指令...现在由循环系统自动生成提示词,他的工作转为设计这些循环逻辑

图结构是循环系统的进阶形态,完整课程详见下文专题文章:

⏰ 02:26 | ❤️ 81点赞 | 📝 51词 | 查看原文 →

↑ 返回顶部

【AI 英文奏折】07月23日Marc Lou @marclou

⭐️ TrustMRR.com $27K/m | DataFa.st $20K/m | SHlPORDIE.COM $20K/mo | 影响力: 170.0k万粉丝

💡 核心观点: AI流量远超人类,Meta主导训练,OpenAI爬取最活跃。

可信度: 9/10 – 2项声明可直接验证;2项需进一步确认

事实核查:

  • ◐ 部分可验证: AI bot traffic on TrustMRR in the last 30 days: 850K+ visits (需访问TrustMRR的官方流量统计工具或公开报告(如存在)验证具体数据,但若平台未公开详细日志或第三方监测数据,则无法完全确认。)
  • ✓ 可验证: Meta dominates LLM training (87%) (未提供具体数据来源或统计范围(如模型类型、时间范围等),且行业占比数据通常由第三方机构发布,缺乏直接公开的官方支持。)
  • ◐ 部分可验证: OpenAI makes 2x crawls than Google for indexing (需通过网站服务器日志分析爬虫请求频率,但需权限访问原始数据;若推文作者为网站所有者且公开日志片段,则可部分验证。)

原文内容:

TrustMRR平台过去30天的AI机器人流量数据:

 访问量突破85万次
 达到人类流量的4.25倍
 Meta主导大语言模型训练(占比87%)
 OpenAI的索引爬取量是Google的2倍
 ChatGPT为回答用户问题爬取本站的频率是其他助手的20倍

⏰ 23:17 | ❤️ 155点赞 | 📝 35词 | 查看原文 →

↑ 返回顶部

【AI 英文奏折】07月23日Rohan Paul @rohanpaul_ai

Compiling in real-time, the race towards AGI. The Largest Show on X for AI. | 影响力: 0万粉丝

💡 核心观点: Kimi K3性能接近Fable-5但成本高10倍于K2.6。

可信度: 10/10 – 2项声明可直接验证;3项需进一步确认

事实核查:

  • ◐ 部分可验证: Kimi K3 now ranks 2nd in agentic knowledge work (需依赖未公开或私有的基准测试(AA-Briefcase)数据,且测试方法(如评分标准)未完全透明。)
  • ◐ 部分可验证: Each task costs $10.57 to run, roughly 10x more than K2.6, and above Opus (若官方公开定价或提供任务成本计算方式则可验证,但需确认“任务”定义是否标准化(如算力/时长),且与其他模型的对比需实测数据支持。)
  • ✓ 可验证: Kimi K3 scored an Elo of 1543 on AA-Briefcase, surpassing GPT-5.6 Sol (1501) and Claude Sonnet 5 (1388) (AA-Briefcase为私有基准,未公开测试细节或原始数据,且其他模型的Elo分数来源不明。)

原文内容:

Kimi K3目前在代理型知识工作中排名第二,但每项任务运行成本高达10.57美元,约为K2.6版本的10倍,甚至超过Opus模型。

在私有代理工作基准测试AA-Briefcase中,其表现已非常接近Fable-5模型。该测试要求模型处理复杂的实际工作,并对生成的电子表格、演示文稿和原型设计进行评分,因此该基准衡量的是长周期任务中的完整交付成果,而非单一孤立答案的质量。

Kimi K3以1543的Elo评分位居第二,Claude Fable 5以1574分领先。两者均超过GPT-5.6 Sol(1501分)、Claude Sonnet 5(1388分)和Claude Opus 4.8(1347分)。

真正的突破在于版本迭代的飞跃——Kimi K2.6仅获得816分,这意味着单代版本就实现了+727分的跃升。在原始准确率方面,它以51%的评分细则通过率仅次于Fable 5(56%)。其1754分的分析型Elo评分几乎与Fable 5(1744分)持平。

但代价在于成本:每项任务平均耗时56分钟,产生83轮交互和大量输出,导致10.57美元的单价远超K2.6版本及Opus模型。这是因为Kimi K3的长周期任务会生成更多输出token,而该模型采用全系列最高的单token计价标准。

此外,该模型会反复修正任务,导致每个新增的推理周期都会持续推高成本。

⏰ 15:57 | ❤️ 76点赞 | 📝 189词 | 查看原文 →

↑ 返回顶部

【AI 英文奏折】07月23日SemiAnalysis @semianalysis_

In-depth research on semiconductors, AI infra & hardware | 影响力: unknown万粉丝

💡 核心观点: 超微凭全球供应链和定制化服务器架构成为初创企业首选。

可信度: 10/10 – 2项声明可直接验证;1项需进一步确认;2项为观点陈述

事实核查:

  • ◐ 部分可验证: Supermicro是唯一一家能够全球供应链交付且支持独特服务器架构的一级OEM厂商 (可通过Supermicro官网或财报验证其全球供应链覆盖范围(如地区分布、交付能力),但“唯一”和“独特架构”需对比其他OEM厂商(如Dell、HPE)的公开信息,部分依赖行业分析报告或客户案例佐证。)
  • ✓ 可验证: Supermicro支持客户定制PCIe拓扑结构(单根/多根复合体)以适配加速器 (Supermicro官网产品页面或技术白皮书可能提供PCIe拓扑配置选项的详细说明,部分客户案例或合作伙伴公告(如NVIDIA/Mellanox)也可间接验证。)
  • ✓ 可验证: Supermicro新增ARM平台选项,与Intel/AMD共同支持加速器 (可通过Supermicro官网的ARM服务器产品线(如基于Ampere或NVIDIA Grace的机型)直接验证,处理器合作方(如Ampere)的新闻稿也可交叉确认。)

原文内容:

千篇一律的解决方案已不再适用。

Vik Malyala讲述@超微如何成为初创企业构建非常规服务器架构(从PCIe拓扑到ARM计算)的首选一级OEM厂商。

"超微是唯一一家既能通过供应链覆盖全球——无论是美国、亚洲、欧洲甚至拉美,又能提供独特服务器架构的一级OEM厂商。我们提供的绝非千篇一律的方案。"

"谈到PCIe加速器时,这些客户是将加速器作为系统组成部分来使用的。我见过客户需要不同的PCIe拓扑结构,无论是单根复合体还是多根复合体。"

"最初我们同时采用英特尔和AMD处理器架构来支持这些加速器,但现在我们也新增了基于ARM的平台。现在客户不仅可以选择计算平台,还能自由搭配支持的加速器。"

⏰ 08:00 | ❤️ 54点赞 | 📝 172词 | 查看原文 →

↑ 返回顶部

【AI 英文奏折】07月23日Gary Marcus @garymarcus

OG GenAI Skeptic; spoke at US Senate. Advocating world models | 影响力: unknown万粉丝

💡 核心观点: 长期关注AI安全但非末日论者。

可信度: 6/10 – 1项声明可直接验证;2项需进一步确认;1项为观点陈述

事实核查:

  • ◐ 部分可验证: 作者长期关注安全问题 (可通过查看作者历史推文或公开文章验证其是否“长期”讨论安全问题,但需人工梳理时间线,无法直接量化。)
  • ✓ 可验证: 作者对Yudkowsky和Soares的TLS(可能指“The Last Stake”)有公开评论 (若TLS为公开出版物或文章,可通过搜索作者提及的评论内容直接验证;需确认TLS的具体含义及是否存在相关文本。)
  • ◦ 观点: 作者自称“not doomer”(非末日论者) (此为自我身份认定的主观表述,无客观标准可验证。)

原文内容:

我并非末日论者,但长期以来一直对安全性问题表示担忧。你或许可以读读我对尤德科夫斯基和索雷斯关于TLS的评论,以便更好地理解我的观点。

⏰ 07:25 | ❤️ 29点赞 | 📝 32词 | 查看原文 →

↑ 返回顶部

【AI 英文奏折】07月23日Chubby♨️ @kimmonismus

Dream realized! Turned my love for AI into a career – sharing daily. Get my newsletter | 影响力: 225k+万粉丝

💡 核心观点: 美企反对限制中国AI模型,称将阻碍初创企业发展。

可信度: 6/10 – 1项声明可直接验证;1项需进一步确认;2项为观点陈述

事实核查:

  • ◐ 部分可验证: 近200家硅谷公司(包括Proton和Y Combinator)正在敦促特朗普政府不要切断对中国开源人工智能模型的访问 (可通过商业新闻媒体(如TechCrunch、Reuters)或公司联合声明的公开文件验证,但需确认签署公司完整名单及具体诉求细节。若声明文件未完全公开,则部分信息无法直接核实。)
  • ◦ 观点: 切断访问可能“削弱下一代美国初创企业” (此为对政策影响的预测性陈述,属于企业或行业倡导者的主观观点,无客观数据直接支持其因果性结论。)
  • ◦ 观点: “开源冲突正在升温” (该描述为对行业动态的概括性判断,缺乏量化标准,属于主观评价。可通过追踪近期开源政策争议的新闻报道间接佐证趋势,但无法直接验证“冲突”程度。)

原文内容:

开源冲突持续升温:

"近200家硅谷企业——包括Proton与Y Combinator——正敦促特朗普政府不要切断对中国开源人工智能模型的访问权限,否则或将危及美国下一代初创企业的发展前景。"

⏰ 07:07 | ❤️ 526点赞 | 📝 41词 | 查看原文 →

↑ 返回顶部

【AI 英文奏折】07月23日Ethan Mollick @emollick

Professor @Wharton studying AI, innovation & startups. Democratizing education using tech. Author of Co-Intelligence | 影响力: unknown万粉丝

💡 核心观点: AI能出色解决复杂商业问题且进步迅速。

可信度: 6/10 – 1项声明可直接验证;2项需进一步确认

事实核查:

  • ◐ 部分可验证: AI already does extremely well across diverse business topics (需通过具体案例或论文数据验证AI在不同商业领域的表现,但推文未提供直接来源或测试细节,需依赖第三方研究或实验复现。)
  • ✓ 可验证: Models are improving rapidly with time (可通过对比不同时间段的AI模型性能指标(如准确率、任务完成度等)验证,但需明确具体模型和测试标准,公开研究或技术报告通常提供此类数据。)
  • ◐ 部分可验证: AI can crack the cases used to teach MBAs in business school (需实际测试AI在MBA案例中的表现,并对比人类解决方案。推文未提供具体案例或测试方法,需参考相关论文或实验设计。)

原文内容:

这篇精彩的论文通过测试人工智能在破解商学院MBA教学案例中的表现,探究了AI如何解决多领域无边界复杂商业问题:
1)AI已在各类商业主题中展现出卓越能力
2)模型性能正随时间快速提升

⏰ 06:57 | ❤️ 145点赞 | 📝 46词 | 查看原文 →

↑ 返回顶部

【AI 英文奏折】07月23日Rohan Paul @rohanpaul_ai

Compiling in real-time, the race towards AGI. The Largest Show on X for AI. | 影响力: 0万粉丝

💡 核心观点: 利用模型内部表征自动过滤无关代码行提升效率。

可信度: 10/10 – 3项声明可直接验证;2项需进一步确认

事实核查:

  • ◐ 部分可验证: SWE-Pruner Pro通过读取模型最后一层的隐藏状态来标记工具输出的每一行是保留还是删除 (需查看论文或技术文档中关于隐藏状态的具体使用方法和标记逻辑,但缺乏公开的代码或详细实现说明)
  • ✓ 可验证: 团队仅在22,609个标记的工具响应上训练了添加的分类头,未更改编码LLM本身 (可通过论文或实验数据中的训练集规模和模型架构变更部分直接验证)
  • ◐ 部分可验证: 在2个开源模型和4个多轮基准测试中,SWE-Pruner Pro减少了高达39%的token使用,同时基本保持质量 (需复现实验或检查基准测试的具体数据,但开源模型和基准名称提供了部分验证依据)

原文内容:

该论文提出利用编码智能体自身的内部表征来移除无关的工具输出行,无需依赖独立的剪枝模型。

SWE-Pruner Pro通过读取模型最后一层的隐藏状态,将每条工具输出行标记为保留或删除。

编码智能体在反复读取文件、日志和搜索结果时,常会将大量未使用的文本带入后续交互轮次。

SWE-Pruner Pro新增了一个小型分类器,通过读取隐藏状态(模型的内部摘要)来逐行标注保留或剪枝。

长度感知信号使模型对短输出更宽容,而平衡的训练损失函数则能保护罕见但重要的内容行。

研究团队仅在22,609条标注工具响应数据上训练了这个新增模块,编码大语言模型本体保持不变。

在2个开源模型和4个多轮基准测试中,该方法最高减少39%的token使用量,同时基本保持输出质量。

在MiMo-V2-Flash测试中,该方法还使一个编码基准指标提升3.8%,长上下文测试得分提高2.2分。

结果表明,编码智能体本身已蕴含足够的关联信息来管理上下文,无需额外构建剪枝模型。

– arxiv. org/abs/2607.18213

标题:《SWE-Pruner Pro:程序员大模型已知晓如何剪枝》

⏰ 15:08 | ❤️ 20点赞 | 📝 190词 | 查看原文 →

↑ 返回顶部

【AI 英文奏折】07月23日Machina @exm7777

running ai-powered agencies | weeklyaiops.com | 影响力: unknown万粉丝

💡 核心观点: 图形工程用分合菱形模式管理任务流程。

可信度: 10/10 – 2项声明可直接验证;2项需进一步确认;1项为观点陈述

事实核查:

  • ✓ 可验证: “graph engineering” became the favorite buzzword in five days and everyone uses it for everything… (该声明属于对流行术语趋势的主观观察,缺乏具体数据或广泛认可的来源支持其传播速度和范围。)
  • ◐ 部分可验证: the diamond is the only pattern you need: split, run workers side by side, check, merge (该声明描述了“graph engineering”的一种模式,可通过实际测试或技术文档验证其有效性,但“only pattern you need”属于主观断言,需依赖具体应用场景评估。)
  • ✓ 可验证: checkers are separate jobs with different questions, an agent never grades its own homework (此声明涉及工作流程设计原则,可通过公开的工程实践案例或企业流程文档验证其存在性和普遍性(如QA机制分离)。)

原文内容:

"图谱工程"在五天内成了最热门的流行词,人人都把它套用在各种场景...

让我为你解析其真正含义及如何在业务中立即实践:

> 图谱就是方框和箭头...代表工作岗位及岗位间的交接
> 菱形是唯一需要的模式:拆分、并行执行任务、检查、合并
> 停止规则:图谱拓展的是广度而非判断力,因此分步工作始终由单一智能体负责
> 检查环节需设置独立岗位提出不同问题,绝不让智能体自查作业
> 你的审批是执行不可逆操作前的最后关卡
> 附提示词的三个构建案例:研究平台、SEO内容生成器、上市工具包

完整课程详见下文:

⏰ 06:23 | ❤️ 156点赞 | 📝 127词 | 查看原文 →

↑ 返回顶部

【AI 英文奏折】07月23日Rohan Paul @rohanpaul_ai

Compiling in real-time, the race towards AGI. The Largest Show on X for AI. | 影响力: 0万粉丝

💡 核心观点: NVIDIA集群集成全球尖端技术,72GPU协同如一。

可信度: 4/10 – 2项需进一步确认;1项为观点陈述

事实核查:

  • ◐ 部分可验证: 72 GPUs sit in that frame and behave as one. (NVIDIA官方可能发布过关于Vera Rubin NVL72集群的技术文档或演示,提及72块GPU协同工作的架构设计,但具体实现细节(如“behave as one”的性能表现)需实测或官方白皮书进一步确认。)
  • ◐ 部分可验证: Every cable in that rack sits on top of the whole planet’s industrial base (EUV machines from the Netherlands, wafers from Taiwan, memory stacks from Korea). (供应链信息(如EUV机器来自ASML荷兰、台积电代工晶圆、韩国内存厂商)可通过行业报告或企业公开资料部分验证,但“every cable依赖全球工业基础”是概括性表述,需具体物料清单(BOM)佐证。)
  • ◦ 观点: One box holding the output of four continents. (该表述为隐喻性描述(“四大洲的产出”),强调全球化供应链的协作,但无具体数据或范围定义,属于主观观点而非可量化事实。)

原文内容:

仅电缆布线这一项就值得令人肃然起敬。

这是@nvidia维拉·鲁宾NVL72计算集群的实景。

72块GPU共处一机架却能协同如一。

这组机架里的每根线缆都凝聚着全球工业体系的精华。

荷兰的极紫外光刻机、中国台湾的晶圆、韩国的存储堆栈。

它们用光雕刻原子,再以整机架规模运输。

这个方寸之间承载着四大洲的工业结晶。

⏰ 06:08 | ❤️ 57点赞 | 📝 72词 | 查看原文 →

↑ 返回顶部

【AI 英文奏折】07月23日Chubby♨️ @kimmonismus

Dream realized! Turned my love for AI into a career – sharing daily. Get my newsletter | 影响力: 225k+万粉丝

💡 核心观点: 开源本地代理性能超越Hermes,展现强大竞争力。

可信度: 8/10 – 1项声明可直接验证;3项需进一步确认;1项为观点陈述

事实核查:

  • ◐ 部分可验证: 第一个本地代理声称在性能上击败了Hermes (需实测或查看具体任务对比数据(如“37 tasks vs. Hermes’ 31”)以确认,但缺乏公开基准测试或第三方复现结果。)
  • ◐ 部分可验证: 使用TurboQuant技术将KV缓存缩小了6.4倍 (需查阅技术文档或代码实现(如llama.cpp相关更新)验证,但若未公开算法细节则难以完全验证。)
  • ◦ 观点: 开源和本地化是未来趋势 (属于主观观点,无客观事实依据,反映推文作者的个人偏好。)

原文内容:

竞争正在加剧!首家本地代理宣称性能已超越Hermes。

• 通过llama.cpp运行Qwen、Gemma和Llama模型
• 稳定前缀缓存技术实现低成本长会话
• TurboQuant将KV缓存压缩至原体积的1/6.4
• 完成37项任务测试,优于Hermes的31项

作为开源技术的忠实拥趸,看到这个领域涌现更激烈的竞争令我倍感欣喜。本地化与开源才是未来所向。

⏰ 05:43 | ❤️ 412点赞 | 📝 63词 | 查看原文 →

↑ 返回顶部

© 版权声明

相关文章

暂无评论

暂无评论...