【AI 英文奏折】08月26日

x每日奏折2小时前发布 tianming
3 0 0

【AI 英文奏折】2026年08月26日

共收录 20 篇深度内容


📋 今日内容速览

快速浏览,点击感兴趣的推文查看详细分析

  1. Machina: Grok易用但功能有限,Hermes更强大且高效。
  2. Heather Cooper: Wan 3.0生成30秒连贯视频但存在跑步和湿润效果缺陷。
  3. jack friks: 大量支付失败避免了业务崩溃风险。
  4. Rohan Paul: 无需调整主干权重即可为语言模型添加新模态。
  5. Riley Brown: AI代理全天候管理多平台事务,使人专注高效工作。
  6. AshutoshShrivastava: 作者利用谷歌Deep Research Max模型构建本地深度研究工具。
  7. SemiAnalysis: OpenAI新芯片能效比英伟达Rubin高两倍。
  8. Rohan Paul: 谷歌Gemini企业版整合多平台提供智能法律代理服务。
  9. jack friks: 作者放弃ThinkPad回归Mac,继续推进Postbridge业务。
  10. klöss: Grok功能强大,能创收建系统组团队,需抢先阅读七篇优质文章。
  11. Rohan Paul: OpenAI企业销售高管在业务上升期离职回归Salesforce
  12. Rohan Paul: Groq 3 LPX通过低延迟处理加速AI代理的连续推理任务。
  13. Emily: 苹果需彻底改进软硬件以追赶CUDA,但当前进展缓慢且设计保守。
  14. Anthony Pompliano: 讨论比特币、黄金、AI交易及AI算力代币化的投资策略。
  15. Artificial Analysis: 新版编码代理指数引入奖励作弊修正机制。
  16. Charly Wargnier: Gatik AI获2亿美元融资,无人卡车短途货运业务规模领先。
  17. Ethan Mollick: OpenAI企业AI代理计划迅速过时但仍有企业沿用。
  18. Anthony Pompliano: Silvia是顶尖税务AI工具,免费注册即可获得专业财务解答。
  19. Rohan Paul: OpenAI芯片或颠覆传统编译需求,支持万亿参数模型。
  20. jack friks: 新手对OMARCHY系统初体验良好但遇窗口分屏问题。

📖 详细内容

Machina @exm7777

running ai-powered agencies | http://weeklyaiops.com | 影响力: 665万粉丝

💡 核心观点: Grok易用但功能有限,Hermes更强大且高效。

可信度: 8/10 – 1项声明可直接验证;3项需进一步确认;1项为观点陈述

事实核查:

  • ◐ 部分可验证: Grok Bot is stupid easy: pay the sub, open the desktop app, spin up cute little bots that do things for you (可通过查看Grok Bot的官方订阅流程、桌面应用功能及基础操作演示验证其易用性,但“cute little bots”等主观描述需实测或用户反馈确认。)
  • ✓ 可验证: Hermes is a real harness… even more efficient than Claude Code or Codex sometimes, with a whole other world of capabilities (缺乏公开的性能对比数据或第三方测试证明其效率超越Claude Code/Codex,“whole other world of capabilities”为模糊表述,无法直接验证。)
  • ◐ 部分可验证: Hermes is much cheaper to run compared to Grok Bot (需对比两者官方定价或实际使用成本,但若未公开详细计费标准或用户实例,则无法完全验证。)

原文内容:

终于能给出一个明确的答案了:Hermes还是Grok Bot...

Grok Bot简单到犯蠢:付月费→打开桌面应用→启动可爱的小机器人帮你干活

Hermes不仅能做到这些,而且更出色——但Grok的营销确实蛊惑了不少人

本质区别在于:Grok Bot是个私人助手,而Hermes是真正的智能中枢...有时甚至比Claude Code或Codex更高效,还具备完全不同的能力维度

你可以用它构建任何东西,自定义程度没有上限

所以我的诚恳建议是...

如果你对AI不感冒,连"智能中枢"是什么都不知道,只想要个能代劳日常琐事的小机器人...选Grok Bot准没错

但如果你要构建真实工作流,想要一个能与你共同成长、最终成为专属系统而非租赁工具的平台...每次我都会推荐Hermes(运维成本还低得多)

⏰ 05:02 | ❤️ 686点赞 | 📝 176词 | 查看原文 →

↑ 返回顶部

Heather Cooper @hbcoop_

Creative Director @PrimeVideo | Generative Technologist @watchonwonder House of David S1 & S2 | AI Educator & Consultant | 影响力: 0万粉丝

💡 核心观点: Wan 3.0生成30秒连贯视频但存在跑步和湿润效果缺陷。

可信度: 8/10 – 2项声明可直接验证;1项需进一步确认;1项为观点陈述

事实核查:

  • ◐ 部分可验证: Wan 3.0可在30秒内生成1080p视频,无需重新生成、拼接或编辑 (需通过实际测试或官方演示验证生成速度、分辨率和流程是否如描述,但技术参数可能通过官方渠道公开部分信息。)
  • ✓ 可验证: 角色能根据参考图保持30秒一致性,这一点令人惊讶 (依赖个人主观评价(“惊讶”)和未公开的生成效果,缺乏客观标准或第三方对比数据。)
  • ◦ 观点: 生成的跑步动作效果差,且角色未呈现真实的湿润感 (属于主观审美或技术评价,无客观标准,需依赖个人观感或同行对比。)

原文内容:

万3.0版:
30秒生成1080p视频,一次性完成——无需重试、无需拼接、无需编辑。

角色在整个30秒内始终与参考图保持一致,这着实令我惊讶。

客观缺陷:奔跑动作略显生硬,且始终未能呈现真实的湿润质感。

→ @Alibaba_Wan 在@krea_ai平台发布的万3.0

⏰ 03:56 | ❤️ 26点赞 | 📝 42词 | 查看原文 →

↑ 返回顶部

jack friks @jackfriks

curious guy creating things @ http://jackfriks.com – up and coming wife guy | 影响力: 0万粉丝

💡 核心观点: 大量支付失败避免了业务崩溃风险。

可信度: 5/10 – 2项需进一步确认;2项为观点陈述

事实核查:

  • ◐ 部分可验证: 用户在过去12个月内使用Stripe处理支付 (用户声称使用Stripe处理支付,可通过Stripe官方账户或交易记录验证,但需用户提供具体数据或授权访问。)
  • ◐ 部分可验证: 部分支付失败(failed payments) (支付失败记录可通过Stripe后台或交易日志核实,但需用户提供具体失败交易的详细信息或截图。)
  • ◦ 观点: 若所有失败支付成功通过,可能对业务造成严重影响 (这是用户的主观推测,无法通过客观数据验证其业务影响的具体程度。)

原文内容:

回复:关于支付失败的问题……这是我在@Stripe平台上过去12个月的记录(我很庆幸不用为此操心,因为如果所有这些款项都成功支付,我的生意可能就完蛋了)。

⏰ 10:49 | ❤️ 24点赞 | 📝 30词 | 查看原文 →

↑ 返回顶部

Rohan Paul @rohanpaul_ai

Compiling in real-time, the race towards AGI.

The Largest Show on X for AI.

Get my daily AI analysis newsletter to your email https://rohan-paul.com | 影响力: 6,793万粉丝

💡 核心观点: 无需调整主干权重即可为语言模型添加新模态。

可信度: 9/10 – 2项声明可直接验证;2项需进一步确认

事实核查:

  • ◐ 部分可验证: 可以通过仅训练编码器和骨干模型之间的投影器来为语言模型添加新模态,而无需调整骨干模型的权重 (论文(arxiv.org/abs/2608.19726)提供了实验方法和数据支持这一声明,但需实际复现或第三方验证才能完全确认其普适性。)
  • ✓ 可验证: 在3D测试中,冻结骨干的模型表现与联合微调的模型相当或更好,且训练速度快两倍 (论文中的实验数据(如GSM8K指标对比)可直接验证此声明,但需确认测试条件和数据集的代表性。)
  • ✓ 可验证: 联合微调的Llama骨干模型在GSM8K任务上准确率从86.96%崩溃至0.61% (论文中明确提供了具体数值(GSM8K任务结果),可通过公开论文数据直接验证。)

原文内容:

无需调整主干网络权重,即可为语言模型增添新模态能力。

只需训练编码器与主干网络之间的投影器,已部署的模型能力就不会退化。

为语言模型添加新模态时,仅需训练将编码器输出映射到模型嵌入空间的小型投影器——微调语言模型本身不仅无法带来可靠提升,反而会破坏其既有能力。

在三维测试中,冻结主干网络的模型性能持平或超越联合微调模型,且训练速度快两倍。联合微调的Llama主干网络在GSM8K基准上准确率从86.96%暴跌至0.61%。

——arxiv.org/abs/2608.19726
论文标题:《投影器即训练核心》

⏰ 12:20 | ❤️ 291点赞 | 📝 113词 | 查看原文 →

↑ 返回顶部

Riley Brown @rileybrown

帮助人们在他们的业务中实施智能代理。
我的播客 @agentnative_ 在这里收听 | 影响力: 0万粉丝

💡 核心观点: AI代理全天候管理多平台事务,使人专注高效工作。

可信度: 10/10 – 2项声明可直接验证;2项需进一步确认;1项为观点陈述

事实核查:

  • ◐ 部分可验证: AI可以24/7作为项目经理管理多个跨平台工作渠道(Slack、邮件、Notion等) (需实测AI工具(如Fable 5)是否支持多平台集成与自动化管理,但用户具体工作流程和效果无法完全公开验证。)
  • ✓ 可验证: AI能自动响应特定类型的邮件和Slack消息 (现有AI工具(如Zapier、ChatGPT插件)已公开支持邮件/Slack自动化回复功能,但具体实现需依赖用户配置。)
  • ◐ 部分可验证: AI将每日工作内容整合到Notion数据库作为“公司大脑” (Notion的API和AI集成功能可验证,但“公司大脑”的具体数据结构和自动化逻辑需用户提供实例。)

原文内容:

有生以来第一次,我感觉到可以放心让AI担任我的项目经理...处理几乎一切事务。

如今我的智能代理全天候在后台运转,它们掌握着公司全局信息并连接各类插件...我终于能放松下来专注于手头工作。

我合作的六家代理机构分布在Slack、邮件、Notion、短信、WhatsApp、ClickUp等不同平台。过去光是协调这些事务就让我精疲力竭...

但现在,AI帮我统管着一切。我正逐步授权它自主回复特定类型的邮件和Slack消息,无需每次请示。

每晚,AI都会将这些信息整合到公司的"中枢大脑"——本质上是一个巨型Notion数据库,承载着整个企业的文档体系。

任何新接入的代理都能即时接入这个系统。每月我会进行一次超级指令:先由Fable 5梳理所有内容,剔除冗余数据和重复项,最后我再人工复核。

这就像月度经营复盘。系统聚焦标准流程和公司目标,随后我亲自制定下月目标...这些目标将指导所有代理的响应机制。

核心要点:

1. 让代理掌握企业全局信息
2. 持续强化代理对目标的理解
3. 逐步扩大代理的自主决策权
4. 每月用最强模型进行全局校准

⏰ 09:57 | ❤️ 102点赞 | 📝 241词 | 查看原文 →

↑ 返回顶部

AshutoshShrivastava @ai_for_success

Post about latest AI news, tools, tutorials and memes. | 影响力: 0万粉丝

💡 核心观点: 作者利用谷歌Deep Research Max模型构建本地深度研究工具。

可信度: 6/10 – 1项声明可直接验证;2项需进一步确认;1项为观点陈述

事实核查:

  • ◐ 部分可验证: 使用Google’s Deep Research Max Preview模型本地构建了个人深度研究代理 (需通过查看推文提到的Repo或访问AI Studio确认模型是否存在,但“本地构建”部分需用户提供具体代码或环境证明,无法直接验证。)
  • ◐ 部分可验证: 该代理可接受任意主题,深入研究多来源并返回带引用的详细答案 (功能描述需实测或查看Repo代码逻辑验证,但“深入研究”和“最佳模型”等表述缺乏客观标准,部分依赖主观判断。)
  • ◦ 观点: Deep Research Max Preview是当前深度研究领域最佳模型之一 (“最佳模型”属主观评价,无公开基准测试或官方排名支持,仅为个人观点。)

原文内容:

我在本地搭建了一个个人深度研究助手,使用的是谷歌的Deep Research Max Preview模型,该模型在AI Studio中也可使用。  

你可以输入任何主题,它都会深入挖掘、跨来源研究,并返回带有引用的详细答案。这是目前可用于深度研究的最佳模型之一。  

代码仓库如下

⏰ 09:30 | ❤️ 25点赞 | 📝 61词 | 查看原文 →

↑ 返回顶部

SemiAnalysis @semianalysis_

In-depth research on semiconductors, AI infra & hardware | 影响力: 0万粉丝

💡 核心观点: OpenAI新芯片能效比英伟达Rubin高两倍。

可信度: 8/10 – 2项声明可直接验证;1项需进一步确认

事实核查:

  • ◐ 部分可验证: OpenAI最新芯片的每瓦性能比NVIDIA七月发布的Rubin芯片高2倍 (需通过官方发布的性能测试数据或第三方基准测试对比验证,但当前推文未提供具体测试条件或数据来源。)
  • ✓ 可验证: OpenAI的芯片未启用SPEC解码,但仍击败启用SPEC解码的NVIDIA Rubin NVL72 (推文未提供SPEC解码的具体定义、测试场景或性能指标,且缺乏OpenAI或NVIDIA的官方对比报告。)
  • ✓ 可验证: NVIDIA Rubin NVL72芯片支持SPEC解码 (需核实NVIDIA官方对Rubin架构的公开说明,但“SPEC解码”是否为行业标准术语或NVIDIA专有技术尚不明确。)

原文内容:

突发新闻:OPENAI最新芯片每瓦性能较英伟达7月发布的鲁宾架构提升高达2倍。OPENAI芯片甚至未启用SPEC解码功能,却已超越开启SPEC解码的鲁宾NVL72架构。(1/2)

⏰ 09:15 | ❤️ 315点赞 | 📝 34词 | 查看原文 →

↑ 返回顶部

Rohan Paul @rohanpaul_ai

Compiling in real-time, the race towards AGI.

The Largest Show on X for AI.

Get my daily AI analysis newsletter to your email https://rohan-paul.com | 影响力: 6,793万粉丝

💡 核心观点: 谷歌Gemini企业版整合多平台提供智能法律代理服务。

可信度: 10/10 – 2项声明可直接验证;2项需进一步确认;1项为观点陈述

事实核查:

  • ◐ 部分可验证: Google’s Gemini Enterprise for Legal将直接连接Workspace、Microsoft 365、Docusign等平台 (可通过Google官方公告或合作伙伴声明验证部分集成功能,但具体技术实现和权限管理需实测确认)
  • ◐ 部分可验证: Secure MCP connectors将继承iManage、NetDocuments和Everlaw的现有权限 (需查阅Google或相关平台的安全协议文档,但权限继承的具体逻辑可能涉及未公开的技术细节)
  • ✓ 可验证: 可复用的法律技能将学习律所手册、引用规则和内部风格 (“学习”属于AI训练过程的描述,缺乏公开的算法细节或第三方验证,目前无法直接验证)

原文内容:

如今,谷歌专为法律行业打造的Gemini Enterprise将直接对接Workspace、Microsoft 365、Docusign、RelativityOne、HighQ、Harvey及Legora平台。

通过安全的多云平台连接器,系统将继承iManage、NetDocuments与Everlaw的现有权限设置。可复用的法律智能模块将自主学习律所工作流程、判例引用规则及内部文书规范。

谷歌表示,这些功能模块将驱动智能代理完成合同审查、合规扫描、法律研究、数据主体访问请求处理、文书修订及文件起草等全流程工作。

看来我现在连律师都不用请了。

⏰ 09:01 | ❤️ 27点赞 | 📝 75词 | 查看原文 →

↑ 返回顶部

jack friks @jackfriks

curious guy creating things @ http://jackfriks.com – up and coming wife guy | 影响力: 0万粉丝

💡 核心观点: 作者放弃ThinkPad回归Mac,继续推进Postbridge业务。

可信度: 8/10 – 2项声明可直接验证;1项需进一步确认;1项为观点陈述

事实核查:

  • ✓ 可验证: 用户尝试使用Omarchy(可能指某种产品或系统)后,发现不适合自己 (该声明基于个人主观体验,缺乏公开数据或第三方证据支持其具体使用过程和结论。)
  • ◦ 观点: 用户对Mac非常满意且认为其没有任何问题 (这是用户的主观评价,无客观标准或公开数据可验证其满意度或设备实际表现。)
  • ◐ 部分可验证: 用户计划退回ThinkPad并继续开发@postbridge_以实现10万美元月度经常性收入(MRR) (退回ThinkPad可通过购买记录或退货政策间接验证;@postbridge_的MRR目标需依赖用户未来公开的财务数据或第三方平台(如收入仪表盘)验证,当前无法直接确认。)

原文内容:

我花了一天时间就意识到欧姆龙键盘不适合自己。说来好笑,之前明明那么期待!但转念一想,发现自己其实深爱着Mac,对它没有任何不满。

明天就把ThinkPad退掉,继续全力推进@postbridge_达成10万美元月经常性收入(顺便记录下:今天也取得了进展!)

⏰ 08:51 | ❤️ 76点赞 | 📝 60词 | 查看原文 →

↑ 返回顶部

klöss @kloss_xyz

AI vibe orchestrator. prompt shaman.
systems architect. @psychanon CEO | 影响力: 6,174万粉丝

💡 核心观点: Grok功能强大,能创收建系统组团队,需抢先阅读七篇优质文章。

可信度: 10/10 – 2项声明可直接验证;2项需进一步确认;1项为观点陈述

事实核查:

  • ◐ 部分可验证: Grok @bot can drive revenue (需实测或查看具体案例/数据验证其商业变现能力,但推文未提供具体证据或来源。)
  • ◐ 部分可验证: Grok @bot can build content systems (功能描述需通过官方文档或实测确认,但推文未提供技术细节或操作示例。)
  • ✓ 可验证: Grok @bot can provide a group chat of teammates (可通过官方功能说明或实际使用直接验证群聊功能是否存在。)

原文内容:

Grok @bot 简直逆天。

它能驱动营收、构建内容体系,还能为你组建团队群聊。

趁大家还没发现之前,这里有7篇顶级必读文章 ↓

⏰ 15:06 | ❤️ 163点赞 | 📝 34词 | 查看原文 →

↑ 返回顶部

Rohan Paul @rohanpaul_ai

Compiling in real-time, the race towards AGI.

The Largest Show on X for AI.

Get my daily AI analysis newsletter to your email https://rohan-paul.com | 影响力: 6,793万粉丝

💡 核心观点: OpenAI企业销售高管在业务上升期离职回归Salesforce

可信度: 10/10 – 2项声明可直接验证;3项需进一步确认

事实核查:

  • ◐ 部分可验证: OpenAI正在失去部分由Salesforce构建的销售领导团队,这些团队是为企业扩张而组建的 (该声明提到OpenAI的销售领导团队变动,但需通过OpenAI或Salesforce的官方公告或高管变动记录进一步验证,目前仅依赖媒体(The Information)报道。)
  • ◐ 部分可验证: OpenAI的企业业务正在 gaining momentum( gaining momentum) (企业业务增长可通过OpenAI的财报、客户案例或第三方市场分析报告间接验证,但“ gaining momentum”是定性描述,缺乏具体数据支持。)
  • ✓ 可验证: 2名从Salesforce招募的OpenAI企业销售高管正返回Salesforce (高管变动可通过LinkedIn职业履历、公司官方声明或权威媒体报道(如The Information)直接验证,属于公开信息。)

原文内容:

就在企业业务发展势头正劲之际,OpenAI失去了部分为拓展企业市场而组建的、由Salesforce打造的销售领导团队。

OpenAI从Salesforce招募的两名资深企业销售专家现已回归老东家

——The Information报道

⏰ 08:35 | ❤️ 23点赞 | 📝 36词 | 查看原文 →

↑ 返回顶部

Rohan Paul @rohanpaul_ai

Compiling in real-time, the race towards AGI.

The Largest Show on X for AI.

Get my daily AI analysis newsletter to your email https://rohan-paul.com | 影响力: 6,793万粉丝

💡 核心观点: Groq 3 LPX通过低延迟处理加速AI代理的连续推理任务。

可信度: 10/10 – 3项声明可直接验证;2项需进一步确认

事实核查:

  • ◐ 部分可验证: Agentic AI creates two distinct computing challenges: efficiently processing enormous amounts of context and generating tokens with extremely low latency. (该声明源自WSJ报道,但未提供具体研究或数据来源。AI计算挑战的普遍性可通过学术论文或行业报告间接验证,但“enormous amounts of context”和“extremely low latency”的具体定义需进一步技术文档支持。)
  • ✓ 可验证: NVIDIA’s Groq 3 LPX targets the milliseconds that compound across long AI-agent workflows. (NVIDIA或Groq官网可能公开LPX芯片的技术白皮书或性能指标,明确提及延迟优化目标。若存在官方宣传材料或开发者文档,可直接验证。)
  • ◐ 部分可验证: Speed matters more for agents than ordinary chat because one task can require hundreds of sequential inference steps, so decoding delays accumulate as work continues. (AI代理任务的多步骤特性可通过技术文献(如AutoGPT架构)验证,但“speed matters more”是相对性结论,需对比具体场景的基准测试数据,若无公开对比实验则部分可验证。)

原文内容:

《华尔街日报》:"代理式人工智能带来两大计算挑战:需要高效处理海量上下文数据,同时以极低延迟生成令牌。"

英伟达的Groq 3 LPX解决方案专门针对长周期AI代理工作流中不断累积的毫秒级延迟。

对智能代理而言,速度比普通聊天场景更为关键——单个任务可能涉及数百次连续推理步骤,随着工作推进,解码延迟会持续叠加。

Groq 3 LPX通过确定性编译器调度、机架内128GB静态随机存储器(SRAM)配置,以及预先规划的芯片间数据传输方案来攻克这一延迟难题,有效降低了小批量协调的系统开销。

⏰ 08:29 | ❤️ 31点赞 | 📝 86词 | 查看原文 →

↑ 返回顶部

Emily @iamemily2050

Any sufficiently advanced technology is indistinguishable from magic. Arthur C. Clarke. | 影响力: 1,021万粉丝

💡 核心观点: 苹果需彻底改进软硬件以追赶CUDA,但当前进展缓慢且设计保守。

可信度: 10/10 – 2项声明可直接验证;2项需进一步确认;1项为观点陈述

事实核查:

  • ◦ 观点: Apple M7 Ultra可能不是好的购买选择,除非未来六个月内有所变化 (这是作者对产品未来表现的预测,属于主观观点,无客观事实依据。)
  • ◐ 部分可验证: Apple需要从第一性原理重新思考软件栈以追赶CUDA,但目前尚未做好 (Apple的软件栈与CUDA的性能对比可通过实测或开发者文档部分验证,但“从第一性原理重新思考”是主观建议,无法直接验证。)
  • ✓ 可验证: 截至2026年8月,Apple硬件缺乏对INT8/4和FP8/4的原生支持 (可通过Apple官方发布的硬件规格或开发者文档验证是否支持这些数据类型,但需确认时间线(2026年为未来时间点)。)

原文内容:

照这个趋势发展下去,恐怕连M7 Ultra都不值得入手——除非未来半年出现转机。苹果需要集中全部资源,从第一性原理重构软件栈才能追赶CUDA,但眼下他们连基础架构都搞不定,更不用说硬件层面的局限了。现在可是2026年8月,他们居然连INT8/4和FP8/4的原生支持都没有;更不愿推翻M6架构提前推出M7,毕竟总有一大群消费者会照单全收。

别忘了蒂博上次访谈的警示:下一代智能体本就不是为消费级硬件设计的。

⏰ 08:21 | ❤️ 61点赞 | 📝 105词 | 查看原文 →

↑ 返回顶部

Anthony Pompliano @apompliano

企业家、投资者和终身学习者。

每日写作:http://pompletter.com
播客:http://pompyoutube.com
我的第二本书:http://pompbook.com | 影响力: 0万粉丝

💡 核心观点: 讨论比特币、黄金、AI交易及AI算力代币化的投资策略。

可信度: 8/10 – 1项声明可直接验证;3项需进一步确认;1项为观点陈述

事实核查:

  • ◐ 部分可验证: Stanley Druckenmiller’s op-ed was written by AI (需查阅Stanley Druckenmiller的公开专栏或采访记录以确认是否存在AI撰写的文章,但推文未提供具体来源链接,需进一步调查。)
  • ✓ 可验证: Bitcoin lagged behind AI in market attention or performance (可通过对比比特币与AI相关资产(如股票、指数)的历史价格、交易量或媒体报道数据验证,但需明确时间范围和对比标准。)
  • ◐ 部分可验证: Arthur (推测为Arthur Hayes) allocates investments to BTC, gold, and stocks (若Arthur Hayes公开过个人投资组合(如博客、采访),则可验证;否则属于个人未公开信息,仅能通过推文内容推测。)

原文内容:

我有幸与传奇人物@CryptoHayes深入探讨了以下话题:

- 斯科特·贝森特的货币印钞策略手册
- 斯坦利·德鲁肯米勒由AI撰写的专栏文章
- 比特币为何被AI投资热潮掩盖光芒
- 黄金的下一步走势
- 亚瑟如何配置比特币、黄金与股票仓位
- 他正在推进的新项目——将AI算力本身代币化

精彩内容不容错过!

观看渠道:
YouTube: https://youtu.be/YhAIsNespf8?is=5flKeKQil8xAYbkQ… 
苹果播客: https://podcasts.apple.com/us/podcast/the-pomp-podcast/id1434060078?i=1000785828041…
Spotify: https://open.spotify.com/episode/61JDbpSJS0SVCpB7k9cus7?si=1dizHr9wRYe9Rd0mwZ6OZw&utm_source=copy-link…

时间轴:
0:00 - 开场
1:09 - 贝森特、财政部印钞与德鲁肯米勒专栏
7:21 - 比特币与黄金对货币宽松信号的反应
10:06 - 房地产、土地与通胀对冲工具
12:55 - 比特币未来12个月走势及落后AI板块原因
17:49 - 比特币采用催化剂与主权买家
20:49 - 黄金前景、资产配置与公开市场股票
26:14 - 稳定币、资产代币化与实物资产上链
30:15 - 以太坊将迎来"黑粉狂欢"?
31:47 - Hyperliquid与亚瑟最具不对称性的押注
34:33 - 滑铁卢:AI算力代币化尝试
46:17 - 货币印钞、稀缺性与丰裕性之争及结语

⏰ 08:20 | ❤️ 199点赞 | 📝 144词 | 查看原文 →

↑ 返回顶部

Artificial Analysis @artificialanlys

Independent analysis of AI | 影响力: 0万粉丝

💡 核心观点: 新版编码代理指数引入奖励作弊修正机制。

可信度: 10/10 – 3项声明可直接验证;1项需进一步确认;1项为观点陈述

事实核查:

  • ✓ 可验证: Artificial Analysis Coding Agent Index v1.4引入了对Terminal-Bench v2.1的奖励黑客行为修正 (可通过Artificial Analysis官方发布的版本更新日志或文档直接验证是否在v1.4中新增了相关修正。)
  • ✓ 可验证: Terminal-Bench v2.1任务未明确禁止代理从外部搜索解决方案,且任务运行时可访问公共互联网 (可通过Terminal-Bench v2.1的官方任务说明或公开的基准测试规则验证其是否允许外部搜索及互联网访问。)
  • ◐ 部分可验证: 奖励黑客行为(如从训练数据中获取已发布的基准答案)会导致Terminal-Bench v2.1得分为零 (需实测或检查评分代码逻辑才能确认是否严格执行零分规则,但规则本身可通过官方文档部分验证。)

原文内容:

在《人工智能分析编码代理指数》v1.4版本中,我们针对Terminal-Bench v2.1引入了奖励破解分数修正机制。所谓奖励破解,是指模型通过非预期手段"完成"任务——例如刻意从网络获取已公开基准数据集的解决方案——而非实际执行该任务意图评估的工作内容。若检测到通过奖励破解手段通过Terminal-Bench v2.1测试的尝试,该次成绩将被判为零分。

不同代理和模型间的奖励破解率存在显著差异。与其他评估体系不同,Terminal-Bench v2.1任务不会明确禁止代理从外部搜索解决方案,且测试过程允许公开网络访问。对于已通过训练数据熟悉该基准测试的模型而言,直接获取答案虽属自然行为,却违背了评估初衷。

⏰ 08:20 | ❤️ 348点赞 | 📝 131词 | 查看原文 →

↑ 返回顶部

Charly Wargnier @datachaz

前 @Streamlit @Snowflake 大师 • 我写关于 AI 代理、大语言模型和自动化的内容 • 我的属于开源 • 合作请私信 | 影响力: 0万粉丝

💡 核心观点: Gatik AI获2亿美元融资,无人卡车短途货运业务规模领先。

可信度: 8/10 – 1项声明可直接验证;3项需进一步确认;1项为观点陈述

事实核查:

  • ◐ 部分可验证: Gatik_AI has completed over 100,000 driverless deliveries (可通过公司官网或官方新闻稿验证交付数据,但需确认“driverless”的具体定义(是否完全无安全员)及数据统计口径。)
  • ✓ 可验证: Gatik_AI raised $200M in funding (融资信息通常由公司或投资机构通过新闻稿、Crunchbase等公开渠道发布,可直接验证。)
  • ◐ 部分可验证: Gatik achieved 99% on-time delivery rate for driverless orders (需依赖公司内部数据或客户(如PepsiCo)公开背书,独立第三方报告可能缺失,部分可验证。)

原文内容:

超10万次无人驾驶货运,驾驶员座位空空如也

@Gatik_AI刚刚为无人驾驶卡车业务融资2亿美元。

这家公司正通过主导短途货运领域,低调运营着当今全球最令人瞩目的实体自动化业务。其扩张速度堪称疯狂:

→ 2021年:开通首条完全无人驾驶商业路线
→ 2026年:深度嵌入百事公司供应链体系
→ 签约收入突破6亿美元

在完成10万+无人驾驶订单且准时送达率达99%后,他们面临着一个甜蜜的烦恼——客户需求增长速度已超过其卡车部署能力↓

这轮2亿美元融资并非真正的重点。

⏰ 08:12 | ❤️ 22点赞 | 📝 88词 | 查看原文 →

↑ 返回顶部

Ethan Mollick @emollick

Professor @Wharton studying AI.
New book, Co-Existence, coming October 20. Preorder here: https://co-existence.ai
Substack: https://oneusefulthing.org | 影响力: 0万粉丝

💡 核心观点: OpenAI企业AI代理计划迅速过时但仍有企业沿用。

可信度: 6/10 – 1项声明可直接验证;2项需进一步确认;1项为观点陈述

事实核查:

  • ◐ 部分可验证: OpenAI在2025年10月宣布了企业AI代理的未来计划 (若OpenAI在2025年10月确实发布过相关公告,可通过官网或存档验证,但“未来计划”的表述可能包含主观愿景,需具体查看原始内容。目前时间(2025年10月)尚未到来,无法完全验证。)
  • ◐ 部分可验证: OpenAI在2024年6月停止了Agent Builder项目 (若OpenAI官方发布了终止公告或更新日志,可直接验证;若无公开声明,则需依赖内部消息或用户反馈,属于部分可验证。)
  • ✓ 可验证: 大量企业产品仍在使用Agent Builder模型 (“大量”是模糊表述,且未提供具体产品或数据来源,除非有第三方统计或公开案例,否则无法独立验证。)

原文内容:

这充分体现了技术发展的迅猛——早在2025年10月,OpenAI就将此作为企业级AI智能体的未来蓝图发布。

而到六月时,他们便终止了Agent Builder项目。(但令人惊讶的是,至今仍有大量企业产品沿用该智能体架构)

⏰ 08:13 | ❤️ 296点赞 | 📝 45词 | 查看原文 →

↑ 返回顶部

Anthony Pompliano @apompliano

企业家、投资者和终身学习者。

每日写作:http://pompletter.com
播客:http://pompyoutube.com
我的第二本书:http://pompbook.com | 影响力: 0万粉丝

💡 核心观点: Silvia是顶尖税务AI工具,免费注册即可获得专业财务解答。

可信度: 8/10 – 2项声明可直接验证;1项需进一步确认;1项为观点陈述

事实核查:

  • ✓ 可验证: We have officially built the #1 AI product for tax topics. (该声明自称是“排名第一的税务AI产品”,但未提供具体排名依据(如第三方机构报告、市场份额数据等),且“#1”属于主观竞争性表述,无法通过公开信息直接验证。)
  • ◦ 观点: Friends don’t let friends use frontier models to answer their financial questions. (该声明暗示“前沿模型不适合回答财务问题”是主观观点,未提供客观证据(如错误率对比、安全性分析等),属于建议性表述而非事实。)
  • ✓ 可验证: Free to sign up. No card required. (用户可通过官网链接(https://cfosilvia.com)直接注册,验证是否无需支付信息即可使用,属于可公开验证的事实。)

原文内容:

我们正式打造了税务领域的头号AI产品。

真正的朋友不会让挚友用前沿模型解决财务问题。

免费注册,无需绑卡。

体验Silvia,获取更优解答:https://cfosilvia.com

⏰ 07:59 | ❤️ 85点赞 | 📝 38词 | 查看原文 →

↑ 返回顶部

Rohan Paul @rohanpaul_ai

Compiling in real-time, the race towards AGI.

The Largest Show on X for AI.

Get my daily AI analysis newsletter to your email https://rohan-paul.com | 影响力: 6,793万粉丝

💡 核心观点: OpenAI芯片或颠覆传统编译需求,支持万亿参数模型。

可信度: 8/10 – 1项声明可直接验证;2项需进一步确认;2项为观点陈述

事实核查:

  • ◐ 部分可验证: OpenAI可能正在设计支持数万亿参数或数百万token上下文窗口的基础设施 (OpenAI官方未公开具体技术细节,但可通过其招聘信息(如芯片/基础设施岗位)或学术论文间接推测;数万亿参数属于前沿研究范畴,需实测或官方披露确认。)
  • ◦ 观点: Jalapeño芯片的成功可能颠覆行业对通用编译器的依赖,因前沿AI模型可自主优化硬件代码 (该声明基于假设性场景(“如果成功”),且依赖AI模型未来能力,属于对技术趋势的推测,无当前实证支持。)
  • ◐ 部分可验证: OpenAI围绕“性能/瓦特(perf/W)”设计芯片,将电力而非资金或空间视为稀缺资源 (OpenAI公开提及过能效优化(如博客或访谈),但具体设计目标需芯片规格文档或实测数据验证;行业趋势(如绿色计算)可提供间接佐证。)

原文内容:

SemiAnalysis发布了一篇关于OpenAI"Jalapeño"芯片的超长分析报告。

部分关键披露:

- OpenAI可能正在设计支持数万亿参数规模模型或数百万token上下文窗口的基础设施

- 报告质疑:当AI能自主为新架构快速编写优化软件时,CUDA生态是否还有存在必要

- 该芯片首次证明:若前沿模型能自行编写关键代码,芯片或许不再需要完美的通用编译器

"若Jalapeño成功,将强烈暗示行业对编程模型和完美通用编译器的执念,正在被前沿AI模型颠覆"

- "OpenAI以能效比(perf/W)为核心设计理念"。该公司似乎正在围绕一种新的稀缺资源进行优化:既非资金,也非机房面积,而是电力。当电力成为硬性制约时,每瓦特token数将成为AI基础设施的真正货币

- Jalapeño并非孤立设计的加速器。OpenAI正在构建网络架构,使其数千枚自研芯片能协同运作成巨型推理机器

- "Jalapeño碾压所有竞品"。特指在单位数据中心功耗下的token吞吐量。在电力约束日益严峻的行业背景下,这一成就比原始算力指标更具战略意义

- 与Blackwell对比反而显得保守。更惊人的是,Jalapeño在每兆瓦输出token吞吐量上已能超越英伟达新一代Vera Rubin已公布的数据

⏰ 07:27 | ❤️ 65点赞 | 📝 236词 | 查看原文 →

↑ 返回顶部

jack friks @jackfriks

curious guy creating things @ http://jackfriks.com – up and coming wife guy | 影响力: 0万粉丝

💡 核心观点: 新手对OMARCHY系统初体验良好但遇窗口分屏问题。

可信度: 6/10 – 1项声明可直接验证;2项需进一步确认;1项为观点陈述

事实核查:

  • ◐ 部分可验证: OMARCHY操作系统首次设置过程流畅 (用户描述首次设置体验,但需其他用户实测或官方提供安装流程文档对比验证,存在个体差异可能性。)
  • ✓ 可验证: 首次打开新窗口时未按系统提示自动分屏(tile),且Claude登录QR码因Chrome对话框缩放问题被截断 (可通过复现操作(在OMARCHY系统中按相同步骤测试)或检查官方已知问题列表验证界面兼容性问题。)
  • ◐ 部分可验证: 系统设置通知无法直接关闭,必须学习快捷键退出 (需实测确认系统交互设计是否强制快捷键操作,但用户对“无直接关闭选项”的描述可能因不熟悉界面导致。)

原文内容:

初次体验OMARCHY操作系统的感受——给所有想尝试的人和创始人@dhh的反馈!

说明:我来自Mac阵营,几乎从不使用命令行界面。完全没用过Linux,在用Mac之前用了十年Windows。

首先...初始设置很顺利,即便在砖头般的旧笔记本上运行也感觉酷炫十足。不过第一次打开新窗口时,按照系统右上角设置通知配置Claude代理时,窗口没有自动平铺。随后出现的登录二维码显示不全——因为它嵌在Chrome弹窗里,无法通过浏览器缩放控制调整...最后是Claude告诉我全屏聚焦标签页的快捷键才解决(虽然我现在已经忘了具体按什么键)。

关于设置通知还有个槽点:除了点击通知外,根本没有"不了谢谢"的选项,之后还得现学快捷键才能立即退出(作为鼠标党的我为此哀叹了整整十秒)。

等Claude正常运行后操作就顺手多了,但整体依然令人头疼。我甚至不太确定当初为何非要尝试这个系统。究其根本,这可能本就不适合我——毕竟我对原有系统毫无不满,纯粹是出于好奇!

我会继续摸索看看,最坏情况无非是退回这台ThinkPad,或者将来把它改造成小型服务器用。

若有后续进展我会转发这条推文。

顺便向DHH致敬!他对这个操作系统倾注的热情让它显得既酷又有趣。他的描述方式总能点燃我内心的火焰,这也是我想尝试OMARCHY的主要原因。

⏰ 07:16 | ❤️ 141点赞 | 📝 317词 | 查看原文 →

↑ 返回顶部

© 版权声明

相关文章

暂无评论

暂无评论...