【AI 英文奏折】2026年09月25日
共收录 20 篇深度内容
📋 今日内容速览
快速浏览,点击感兴趣的推文查看详细分析
- Chubby♨️: Opus 5.5表现卓越引发热议,用户期待Fable 5.5。
- Chubby♨️: 小米MiMo-V2.6-Pro开源模型性能接近GPT-5.6且成本更低。
- AshutoshShrivastava: Opus 5.5模型快速构建复杂Minecraft风格游戏令人惊叹。
- Freda Duan: 亚马逊代理商务可能削弱广告收入,长期价值下降但物流开放存机遇。
- Santiago Valdarrama: AI营销视频制作高效低价,颠覆传统耗时费钱模式。
- levelsio: Starlink卫星网络高效可靠,正逐渐在欧洲普及。
- Rohan Paul: 代理记忆错误导致权限误判,验证和跟踪可避免未授权操作。
- Artificial Analysis: GPT-6与Claude Opus领跑科研AI基准测试。
- Chubby♨️: Anthropic拟赋予创始人多数投票权以强化控制。
- Meng To: Opus 5.5通过持续优化实现高细节真实度。
- SemiAnalysis: 开源CLI工具测试GPU集群性能,代理编码施压显著。
- Rohan Paul: 五大超级扩展商未来承诺总额激增至2.8万亿美元。
- Marc Lou: 抓住趋势的创始人能获得最大经济回报。
- Rohan Paul: 代理需运行时安全检查而非仅安装前扫描以防范恶意技能。
- Rohan Paul: 大语言模型内部推理过程可分离监控且具独特模式。
- Anthony Pompliano: 讨论股市、比特币新高及预算失衡背后的经济政治因素。
- Charly Wargnier: PixVerse R2注重实时调整和创意探索的工作流程。
- Suchen Zang: 台词仅为文学目的创作,无深层含义,不适感属读者问题。
- Amira Zairi: 分享粉彩漫画角色设计技巧,包含多视角草图与表情刻画。
- Aakash Gupta: Meta VR眼镜通过外置计算组件实现100克超轻设计。
📖 详细内容
Chubby♨️ @kimmonismus
Tech Analyst & Content Creator. Editor-in-Chief @getsuperintel – Community of 300k+ in total: https://linktr.ee/kimmonismus // [email protected] | 影响力: 0万粉丝
💡 核心观点: Opus 5.5表现卓越引发热议,用户期待Fable 5.5。
可信度: 6/10 – 1项声明可直接验证;2项需进一步确认;1项为观点陈述
事实核查:
- ◦ 观点: Opus 5.5 是用户用过的最好的模型,具有好品味、速度快、聪明且精准 (该声明基于个人主观体验(如“最好”“好品味”等),缺乏客观标准或公开数据支持,无法通过第三方验证。)
- ◐ 部分可验证: 用户因 Fable 5.5 的发布而重新回归 Anthropic(此前已完全切换到 Codex) (用户的行为(切换模型)需依赖其个人确认,但 Anthropic 和 Codex 的模型迭代信息可通过官方渠道部分验证。)
- ◐ 部分可验证: X(原推特)上突然涌现大量关于 Opus 5.5 的正面讨论,称其品味好且 OpenAI 需追赶 (可通过社交平台搜索相关话题验证讨论趋势,但“品味好”等评价仍属主观观点,且“一天改变一切”存在夸张可能。)
原文内容:
天哪,我爱上了 Opus 5.5。它是我用过的最好的模型,品味这么好,速度相对快,聪明,而且终于精准而不是啰嗦。 尽管 Opus 5.5 这么棒,我还是对 Fable 5.5 感到无比兴奋。在完全切换到 Codex 之后,我现在又得回到 Anthropic 了。 哦,对了,顺便说一句。氛围变化得太疯狂了。 现在我在 X 上读到的全是关于 Opus 品味多棒以及 OpenAI 绝对得赶上的帖子。 一天就改变了这一切。
⏰ 11:10 | ❤️ 32点赞 | 📝 123字 | 查看原文 →
Chubby♨️ @kimmonismus
Tech Analyst & Content Creator. Editor-in-Chief @getsuperintel – Community of 300k+ in total: https://linktr.ee/kimmonismus // [email protected] | 影响力: 0万粉丝
💡 核心观点: 小米MiMo-V2.6-Pro开源模型性能接近GPT-5.6且成本更低。
可信度: 10/10 – 2项声明可直接验证;2项需进一步确认;1项为观点陈述
事实核查:
- ◐ 部分可验证: 小米的 MiMo-V2.6-Pro 在 Artificial Analysis Intelligence Index 上领先于所有开源权重模型,得分为 46 分,仅次于 GPT-5.6 Sol (max) 的 47 分。 (需查看 Artificial Analysis Intelligence Index 或 AA Benchmarks 的官方排名数据,确认 MiMo-V2.6-Pro 的具体得分及对比模型。若相关榜单未公开或未提供详细方法论,则无法完全验证。)
- ◐ 部分可验证: MiMo-V2.6-Pro 的成本为每项 Intelligence Index 任务 $0.13,对比 GPT-5.6 Sol (max) 的 $1.99。 (需核实小米官方 API 定价及 GPT-5.6 Sol (max) 的公开定价(若存在)。若“加权平均计算”方式未公开或涉及非标准任务定义,则可能无法直接验证。)
- ✓ 可验证: MiMo-V2.6-Pro 支持文本、图像、视频和音频处理,并拥有 1M-token 的上下文窗口。 (可通过小米官方技术文档或 GitHub 发布的模型权重及技术报告直接验证功能参数。)
原文内容:
小米的 MiMo-V2.6-Pro 真的让我印象深刻。它现在在 Artificial Analysis Intelligence Index 上领先于所有开源权重模型。 46 分,仅次于 GPT-5.6 Sol (max) 的 47 分,在 AA Benchmarks 中。成本差距要大得多:按加权平均计算,每项 Intelligence Index 任务 $0.13 对比 $1.99。 Pro 版本能处理文本、图像、视频和音频,拥有 1M-token 的上下文窗口。小米将 API 定价保持与 V2.5 相同。 模型权重采用 MIT 许可发布。小米还与技术报告一起发布了训练环境和 RL 代码,让研究人员能够更深入地审视模型背后的工作。 这简直就是开源 AI 的定义。恭喜这次发布!
⏰ 23:00 | ❤️ 417点赞 | 📝 154字 | 查看原文 →
AshutoshShrivastava @ai_for_success
Post about latest AI news, tools, tutorials and memes. | 影响力: 0万粉丝
💡 核心观点: Opus 5.5模型快速构建复杂Minecraft风格游戏令人惊叹。
可信度: 9/10 – 2项声明可直接验证;2项需进一步确认
事实核查:
- ◐ 部分可验证: 使用 Opus 5.5 耗时约16小时完成了一个项目 (需依赖用户提供的时间记录或项目日志验证,但若无具体时间戳或第三方工具记录,仅能通过用户自述确认。)
- ◐ 部分可验证: 为儿子构建了一款 Minecraft 风格的游戏 (可通过展示游戏代码、演示视频或截图部分验证,但“Minecraft风格”的描述主观性较强,且未提供公开可访问的成品或源码。)
- ✓ 可验证: 这是迄今为止编码的最复杂的项目 (复杂性是主观判断,缺乏客观标准(如代码量、架构难度等公开数据),且对比用户过往项目需其主动披露。)
原文内容:
大约 16 小时使用 Opus 5.5 完成,现在它已经准备好了。 我完全无语了,这款模型有多么不可思议以及它能做到什么。以下是我为儿子构建的 Minecraft 风格游戏的一个小预览。这是迄今为止我 vibe 编码的最复杂的项目。更多细节即将公布..
⏰ 04:11 | ❤️ 86点赞 | 📝 86字 | 查看原文 →
Freda Duan @fredaduan
No investment advice. https://robonomics.substack.com | 影响力: 441万粉丝
💡 核心观点: 亚马逊代理商务可能削弱广告收入,长期价值下降但物流开放存机遇。
可信度: 10/10 – 2项声明可直接验证;2项需进一步确认;1项为观点陈述
事实核查:
- ◐ 部分可验证: 广告收入占亚马逊运营利润的50% (亚马逊的广告收入数据可在其财报中找到,但“占运营利润50%”需结合第三方分析或内部拆分数据验证,可能存在估算偏差。)
- ✓ 可验证: 亚马逊的500亿美元营销支出为大型平台提供“不公平优势” (亚马逊的营销支出金额可通过财报或公开财务披露直接验证,但“不公平优势”属于主观推论。)
- ◦ 观点: 代理商务下广告支出和抽成率将趋于融合,广告行业可能“消失” (这是对商业模式演变的预测,缺乏实证依据,属于作者主观判断。)
原文内容:
基本同意。 1/ 代理商务对 $AMZN 的影响 广告收入(1000亿美元收入,或估计占运营利润的50%):真正的去中介化风险。 GMV:取决于情况。如果 $AMZN 真正做到“更便宜、更快、更好”,一个客观的代理应该会将更多 GMV 发送到 $AMZN。但我个人怀疑在代理世界中 $AMZN 的 GMV 份额会显著增长。只需看看 $AMZN 今天扔出的 500 亿美元营销支出——大型平台拥有“不公平优势”,因为它们能负担更高的 CAC。 长期价值/客户所有权:如果 $AMZN 失去漏斗顶部,其内在价值应该会下降。你可能仍然能获得交易和买家信息,但你会失去浏览行为、再营销、交叉销售机会,最终失去客户关系。 潜在上行:$AMZN 可以向其他商家开放其一流的物流骨干 = 新收入来源(它已经在小范围做这件事)。 在我看来,风险更偏向下行:漏斗顶部 → 基础设施层。 2/ 广告行业会发生什么 在代理商务下,广告支出和抽成率——人们历史上认为这是不同的商业模式——将趋于融合。 在一个完全代理化的世界中,广告作为行业理论上可能“消失”。但这并不意味着广告资金(美国约3000亿美元)会消失。卖家仍然需要(并且想要)为分发支付数字税。无论是以广告形式还是抽成率形式出现,这在很大程度上只是语义上的区别。 以 OTA($BKNG $EXPE)为例。假设它们一半的预订和流量是直接的,另一半是间接的,主要通过 $Google。对于间接部分,这些公司基本收支平衡,因为它们支付给 $Google 的高 CPC。直接部分的抽成率约为15%。因此,即使成本以广告形式支付,OTA 支付给 Google 的等效抽成率实际上约为15%。 因此,一个代理收取2%、5%,或最终10%+的 GMV 并不一定引入新成本。它可能只是将现有的获取成本从 CPC 重新包装成 CPA / 抽成率。而且 @Muse 的代理很可能从低价起步。 3/ 无论如何都成立的(代理世界前后): A. 拥有漏斗顶部的客户意图 = 定价权。失去直接流量意味着损失远不止即时交易。 B. 商务获胜公式(始终)= 更便宜、更快、更好。 ++ 更详细的版本:https://robonomics.substack.com/p/agentic-commerce-deep-dive-ii?r=3hcp4&utm_campaign=post-expanded-share&utm_medium=web…
⏰ 09:58 | ❤️ 37点赞 | 📝 609字 | 查看原文 →
Santiago Valdarrama @svpino
计算机科学家。我在 https://ml.school 教授硬核人工智能/机器学习工程。YouTube:https://youtube.com/@underfitted | 影响力: 0万粉丝
💡 核心观点: AI营销视频制作高效低价,颠覆传统耗时费钱模式。
可信度: 10/10 – 2项声明可直接验证;2项需进一步确认;1项为观点陈述
事实核查:
- ◦ 观点: 创建营销视频是一个已解决的问题 (该声明属于主观判断,缺乏客观标准定义“已解决”,且未提供具体行业基准或数据支持。)
- ◐ 部分可验证: 生成营销视频过去需花费数千美元并耗时数周,现在仅需几分钱和几分钟 (可通过对比传统视频制作(如外包报价、制作周期)与当前AI工具(如Synthesia、Pictory等)的公开定价和案例验证成本与时间差异,但具体数值可能因项目复杂度而异。)
- ✓ 可验证: 标记修复功能允许在视频任意位置标记并通过提示修改 (该功能描述可通过AI视频工具(如Runway ML等)的官方演示或文档直接验证,部分平台明确宣传类似编辑功能。)
原文内容:
创建营销视频是一个已解决的问题。 老实说,我无法想象还有哪个创意领域能让我们节省这么多时间和金钱。 生成像这样的东西过去要花费数千美元并耗时数周。 现在,只需几分钱和几分钟。 最好的部分是:他们的标记修复功能,你可以在视频的任何地方标记,然后用一个提示进行更改。
⏰ 21:25 | ❤️ 580点赞 | 📝 117字 | 查看原文 →
levelsio @levelsio
http://PhotoAI.com $89K/m
http://Vibej.am $44K/m
http://InteriorAI.com $27K/m
http://levelsio.com @X $17K/m
http://Nomads.com $16K/m
http://Pieter.com
http://Hotelist.com
http://levels.io
http://levels.vc | 影响力: 3,163万粉丝
💡 核心观点: Starlink卫星网络高效可靠,正逐渐在欧洲普及。
可信度: 10/10 – 2项声明可直接验证;3项需进一步确认
事实核查:
- ◐ 部分可验证: Starlink Mini 在葡萄牙里斯本为朋友提供网络,替代了故障两个多月的 NOS ISP (用户声称的 NOS 服务故障可通过葡萄牙当地用户反馈或 NOS 官方公告部分验证,但具体个案(如朋友住址与故障时长)需用户提供进一步证据(如账单或客服记录)。Starlink 的功能性可通过官方性能数据间接支持,但实际体验依赖具体环境。)
- ◐ 部分可验证: Starlink 的延迟约为10ms,与光纤相当甚至更好 (Starlink 官方宣称低延迟(20-50ms),但实际延迟受地理位置和网络负载影响。用户声称的10ms接近最优情况,需实测对比,普通光纤延迟通常为5-30ms,因此部分可验证但存在个体差异。)
- ◐ 部分可验证: Starlink 在欧洲的采用率显著上升,但晚于美国 (Starlink 全球用户数据可通过公司财报或第三方报告验证地区增长趋势,但“显著存在感”是主观描述,缺乏量化标准。欧洲与美国对比需具体市场份额数据支持。)
原文内容:
有点儿轶事性质,但现在我有两个朋友用 @Starlink(如果算上我自己就是三个了) 我把我的 Starlink Mini 借给了 @mick__net,因为他的 葡萄牙 ISP @NOS 已经(而且现在还是!)停机两个多月了,而他就住在里斯本 NOS 总部500米的地方 没人能修好,客服没用,甚至取消他的套餐都很难 总之 Starlink Mini 立刻让他恢复了网络,救了他的命,因为他得工作,现在他自己订购了一个,把我的还了回来,我接着用它在希腊旅行,他现在成了 Starlink 的拥趸 今天我的另一个朋友 @cso_notes 在 罗马尼亚也搞了一个! 欧洲的采用总是比美国晚一点儿,但我认为 Starlink 现在开始有了显著的存在感 我告诉很多人关于 Starlink,他们还是对卫星互联网持怀疑态度,总说延迟问题,他们以为延迟是1秒,但其实更像是10ms(1/100秒),和普通光纤网络一样甚至更好 自从用了 Starlink,我从来没有遇到过这么少的网络问题,它从没断过,一直就是好用,客服通过聊天,效果真的很好 我绝对讨厌得拨打电话号码,等候30分钟或更久,然后浪费一整天在这种事情上,这在葡萄牙 ISP(以及所有葡萄牙企业)中是常态 所以有 Starlink 对我来说真是天赐之物,它就是好用!
⏰ 07:31 | ❤️ 122点赞 | 📝 366字 | 查看原文 →
Rohan Paul @rohanpaul_ai
Compiling in real-time, the race towards AGI.
The Largest Show on X for AI.
Get my daily AI analysis newsletter to your email https://rohan-paul.com | 影响力: 6,793万粉丝
💡 核心观点: 代理记忆错误导致权限误判,验证和跟踪可避免未授权操作。
可信度: 10/10 – 2项声明可直接验证;2项需进一步确认;1项为观点陈述
事实核查:
- ◐ 部分可验证: 在长期运行的代理中,被撤销或缩小的权限可能会被错误地记住,成为执行者的“真相”版本 (可通过论文实验数据(如arxiv.org/abs/2609.01836)验证权限记忆错误的现象,但具体实现环境和测试条件需进一步确认)
- ✓ 可验证: 在类型化增量内存测试中,虚假权限出现在高达50.2%的未授权请求中 (论文中明确提供了实验数据(50.2%),可通过公开的论文链接直接验证)
- ✓ 可验证: 一旦虚假权限存在,执行者在98.6%的匹配试验中会据此采取行动 (论文中明确提及该数据(98.6%),可通过原文直接验证)
原文内容:
一个代理可以做出完全一致的授权决策,但如果它的记忆已经重写了谁被允许做什么,它仍然可能是错误的。 本文研究了长期运行的代理中这种失败情况,其中权限、撤销和范围变更被压缩到持久内存中。 被撤销或缩小的权限可能会被错误地记住,而这种错误的记忆就成了执行者的“真相”版本。 在本文的类型化增量内存测试中,虚假权限出现在高达 50.2% 的未授权请求中。一旦这种虚假权限存在,执行者在 98.6% 的匹配试验中都会根据它采取行动。 仅将记忆更改为确切的授权状态,就可以将这些未授权操作降至 0%。这表明,在这些情况下,内存而非执行者是主要的失败点。 修复方法是在将权限写入内存之前验证它们,保留每个权限的来源,并使用确定性状态更新来跟踪授予、变更和撤销。 – arxiv.org/abs/2609.01836 标题:“代理内存是内生授权洗钱的表面”
⏰ 21:01 | ❤️ 37点赞 | 📝 294字 | 查看原文 →
Artificial Analysis @artificialanlys
Independent analysis of AI | 影响力: 0万粉丝
💡 核心观点: GPT-6与Claude Opus领跑科研AI基准测试。
可信度: 10/10 – 3项声明可直接验证;2项需进一步确认
事实核查:
- ◐ 部分可验证: GPT-6 Astra(max)和 Claude Opus 5.5(xhigh)在 Terminal-Bench-Science 0.1 排行榜中分别以 63% 和 62% 的成绩位居榜首 (需通过 Terminal-Bench-Science 0.1 的官方发布渠道(如官网或论文)验证具体得分和排名,但若该基准测试未公开完整数据或方法,则无法完全独立验证。)
- ✓ 可验证: Terminal-Bench-Science 0.1 包含 70 个专家精选任务,涵盖生命科学、物理科学等五个领域 (可通过官方发布的基准文档或研究论文验证任务数量、领域分布及设计细节(如沙盒环境、评分标准)。)
- ◐ 部分可验证: 开源模型 GLM-5.3(max)和 DeepSeek V4.1 Flash(max)得分分别为 10% 和 9%,落后领先模型超过 50 分 (需依赖 Terminal-Bench-Science 的公开测试结果,但若模型版本、测试配置未完全透明(如“max”参数定义),则部分细节可能无法验证。)
原文内容:
今天我们推出了 Terminal-Bench-Science 0.1 的排行榜,这是一个针对科学研究工作的代理基准测试。GPT-6 Astra(max)和 Claude Opus 5.5(xhigh)目前位居榜首,成绩分别为 63% 和 62% Terminal-Bench-Science 0.1 于 2026 年 8 月发布,由 @StevenDillmann 和斯坦福大学的研究人员与 @terminalbench 团队以及全球开源科学贡献者社区共同构建。它包含 70 个专家精选的任务,这些任务基于五个领域的真实研究:生命科学(19 个)、物理科学(17 个)、数学科学(17 个)、工程科学(9 个)和地球科学(8 个)。 与 Terminal-Bench 类似,每个任务都会将代理置于沙盒环境中,提供任务所需的数据、工具和指令,代理从头到尾运行任务。自动化测试会对每个任务的通过/失败进行评分,我们报告的是 3 次尝试中平均的 pass@1 得分。 关键要点: ➤ 只有两个模型得分超过 50%:GPT-6 Astra(max)为 63%,Claude Opus 5.5 为 62%(xhigh)和 59%(max)。最近的发布取得了重大进步,但即使是顶级模型 GPT-6 Astra 也有很大的提升空间 ➤ 对于大多数领先模型来说,生命科学是得分最低的领域,尽管每个领域的得分因任务数量(8 到 19 个)而较为波动。Claude Opus 5.5(xhigh)通过了 71% 的数学科学任务,但只有 46% 的生命科学任务 ➤ 最好的开源权重模型 GLM-5.3(max)得分为 10%,DeepSeek V4.1 Flash(max)得分为 9%,落后于领先者超过 50 分
⏰ 07:30 | ❤️ 455点赞 | 📝 344字 | 查看原文 →
Chubby♨️ @kimmonismus
Tech Analyst & Content Creator. Editor-in-Chief @getsuperintel – Community of 300k+ in total: https://linktr.ee/kimmonismus // [email protected] | 影响力: 0万粉丝
💡 核心观点: Anthropic拟赋予创始人多数投票权以强化控制。
可信度: 7/10 – 1项声明可直接验证;3项需进一步确认
事实核查:
- ◐ 部分可验证: Anthropic 计划在 IPO 前将其七位联合创始人赋予多数投票控制权(50.1%)。 (该信息源自媒体(The Information)报道,但需通过Anthropic官方文件(如招股书或公司公告)直接确认。)
- ◐ 部分可验证: 拟议的股份结构为“Palantir式”,要求至少三位创始人保留最低数量的股份以维持投票权。 (需对比Palantir的股权结构(公开可查)和Anthropic的官方披露,但后者目前依赖媒体报道。)
- ✓ 可验证: Dario Amodei拥有Anthropic约2%的股份,新股份仅增加投票权而非经济所有权。 (股份比例和股权结构调整细节通常属于公司内部数据,除非官方披露否则无法独立验证。)
原文内容:
据报道,Anthropic 计划在 IPO 前将其七位联合创始人赋予多数投票控制权,这将赋予他们更大的权力。 The Information 报道称,拟议的 Palantir 式股份结构将赋予他们 50.1% 的投票权,用于大多数公司事务,只要至少三位创始人保留最低数量的股份。 据报道,Dario Amodei 拥有 Anthropic 约 2% 的股份。新股份将增加投票权,而不会增加额外的经济所有权。
⏰ 07:26 | ❤️ 246点赞 | 📝 114字 | 查看原文 →
Meng To @mengto
Founder at @designcodeio and http://aura.build. I teach designers code and developers design.
Screen recorder: http://dreamcut.ai | 影响力: 0万粉丝
💡 核心观点: Opus 5.5通过持续优化实现高细节真实度。
可信度: 6/10 – 1项声明可直接验证;2项需进一步确认;1项为观点陈述
事实核查:
- ◐ 部分可验证: Opus 5.5 用代码塑造了这艘船的每一个部分,包括龙、船帆和建筑。 (可通过实时站点(http://ship.mengto.here.now)查看生成内容,但需技术手段(如代码分析或模型输出日志)确认是否完全由Opus 5.5生成,普通用户无法直接验证代码层面的细节。)
- ✓ 可验证: 我让Opus对场景的每一个部分打分并改进,直到得分至少达到10分中的8分。 (评分标准和改进过程依赖推文作者的主观描述,未公开具体评分逻辑、交互记录或模型内部数据,无法独立验证。)
- ◦ 观点: Opus 5.5达到了其他模型无法企及的细节和真实度水平。 (此为作者的主观评价,缺乏与其他模型的客观对比数据(如基准测试或第三方评估),属于个人观点。)
原文内容:
Opus 5.5 用代码塑造了这艘船的每一个部分,包括龙、船帆和建筑。 我不能再说它品味差了。但它仍然需要引导,所以我尝试了一种新的提示方式。 实时站点:http://ship.mengto.here.now 我让 Opus 对场景的每一个部分打分:船、水、景观、建筑,以及它们的各个组成部分。然后我让它不断改进每个部分,直到得分至少达到 10 分中的 8 分,这取决于我的令牌和时间预算。 关键是让它尽可能长时间地工作。它工作得越久,效果就越好,直到达到需要我进行修正的点。对我来说,Opus 5.5 达到了其他模型无法企及的细节和真实度水平。
⏰ 22:02 | ❤️ 714点赞 | 📝 189字 | 查看原文 →
SemiAnalysis @semianalysis_
In-depth research on semiconductors, AI infra & hardware | 影响力: 0万粉丝
💡 核心观点: 开源CLI工具测试GPU集群性能,代理编码施压显著。
可信度: 6/10 – 1项声明可直接验证;2项需进一步确认;1项为观点陈述
事实核查:
- ◐ 部分可验证: SemiAnalysis 在其评级的集群上运行代理式编码,并配备一个开源的 CLI(cmax) (可通过检查 SemiAnalysis 的公开资料或 GitHub 等平台验证是否存在开源的 cmax CLI,但“代理式编码”的具体实现和测试细节可能未完全公开,需进一步确认。)
- ✓ 可验证: 代理式编码对 GPU 集群造成很大压力,且工作负载与其他系统不同 (该声明涉及具体测试结果和性能压力数据,但未提供公开的基准测试报告或第三方验证,无法直接验证其真实性。)
- ◐ 部分可验证: cmax CLI 是代理的前端,代理会调试 CLI 的问题并分析原因 (可通过开源代码(如 cmax CLI 的 GitHub 仓库)验证其功能设计,但代理的调试逻辑和内部机制可能未完全公开,需依赖文档或实际测试。)
原文内容:
代理式编码给 GPU 集群带来了一种供应商们正努力应对的压力。SemiAnalysis 无论如何都会在其评级的集群上运行它,并配备一个开源的 CLI。 “我们的大量 ClusterMAX 测试,都是以我们的 CLI cmax 作为开端。它是开源的。请随意在你的托管集群上试用它。” “我们确实使用代理式编码来测试所有这些集群,而且工作负载非常不同。这个工作负载对这些系统造成了很大的压力。” “这就是为什么我们将 cmax CLI 作为前端,而代理只是围绕它的一个包装。如果 cmax CLI 遇到任何问题,代理会对其进行调试并了解发生了什么。”
⏰ 07:00 | ❤️ 27点赞 | 📝 186字 | 查看原文 →
Rohan Paul @rohanpaul_ai
Compiling in real-time, the race towards AGI.
The Largest Show on X for AI.
Get my daily AI analysis newsletter to your email https://rohan-paul.com | 影响力: 6,793万粉丝
💡 核心观点: 五大超级扩展商未来承诺总额激增至2.8万亿美元。
可信度: 7/10 – 1项声明可直接验证;3项需进一步确认
事实核查:
- ◐ 部分可验证: 穆迪表示,五大超级扩展商的未来承诺总额约为2.8万亿美元 (需查阅穆迪官方报告或公开声明确认具体数据来源和计算范围,但“超级扩展商”定义可能模糊,需进一步核实。)
- ◐ 部分可验证: 未来承诺总额从2023年的约3500亿美元增长到现在的约2.8万亿美元 (需对比穆迪历年报告或行业数据验证增长率,但时间跨度(“现在”未明确)和统计口径可能影响直接验证。)
- ✓ 可验证: 2.8万亿美元包括超过1万亿美元的尚未开始的数据中心租赁 (数据中心租赁承诺通常涉及未公开的长期商业合同,企业或穆迪可能未披露具体细分数据。)
原文内容:
穆迪表示,五大超级扩展商的未来承诺总额约为2.8万亿美元。 这些是合并的未来租赁承诺、采购承诺和担保,从2023年的约3500亿美元增长到现在的约2.8万亿美元。 当前的2.8万亿美元包括超过1万亿美元的尚未开始的数据中心租赁、约1.57万亿美元的采购承诺,以及约1370亿美元的担保。
⏰ 06:50 | ❤️ 38点赞 | 📝 107字 | 查看原文 →
Marc Lou @marclou
http://TrustMRR.com $44K/m
http://DataFa.st $26K/m
http://SHlPORDIE.com $13K/m
http://CodeFa.st $6K/m
http://ShipFa.st $4K/m
http://IndiePa.ge $1K/m
+29 http://marclou.com | 影响力: 1,236万粉丝
💡 核心观点: 抓住趋势的创始人能获得最大经济回报。
可信度: 6/10 – 1项声明可直接验证;1项需进一步确认;2项为观点陈述
事实核查:
- ◐ 部分可验证: 每次出现新的潮流科技,新的包装初创公司就会在 http://TrustMRR.com 上涌现 (可通过访问 TrustMRR.com 网站查看是否有新潮流科技相关的包装初创公司注册或涌现,但“每次”这一绝对化表述需要长期观察数据验证,且“潮流科技”定义模糊。)
- ✓ 可验证: OpenClaw 是其中最大的一波浪潮之一 (缺乏“最大浪潮”的量化标准(如公司数量、融资规模等),且未提供公开数据或第三方来源支持这一比较性结论。)
- ◦ 观点: 最早抓住趋势的创始人获得的经济回报最多 (属于主观推断,未提供具体案例或数据(如创始人收益对比)。即使存在个别案例,也无法证明普适性。)
原文内容:
每次出现新的潮流科技,新的包装初创公司就会在 http://TrustMRR.com 上涌现。 OpenClaw 是其中最大的一波浪潮之一。 现在是 Jev。 我注意到,最早抓住趋势的创始人获得的经济回报最多。 如果你不知道要构建什么,就滚动浏览 𝕏 并基于趋势构建!
⏰ 21:27 | ❤️ 358点赞 | 📝 85字 | 查看原文 →
Rohan Paul @rohanpaul_ai
Compiling in real-time, the race towards AGI.
The Largest Show on X for AI.
Get my daily AI analysis newsletter to your email https://rohan-paul.com | 影响力: 6,793万粉丝
💡 核心观点: 代理需运行时安全检查而非仅安装前扫描以防范恶意技能。
可信度: 6/10 – 1项声明可直接验证;2项需进一步确认;1项为观点陈述
事实核查:
- ◐ 部分可验证: 恶意代理技能在安装时看似安全,但在实际任务中才会变得危险 (可通过论文中的实验设计(如对比安装时扫描与运行时攻击的差异)部分验证,但需依赖论文数据的可信度,且实际环境可能更复杂。)
- ✓ 可验证: SkillSonar 将熟悉攻击类型的攻击成功率从 48.2% 降至 10.4%,未见风险家族的成功率从 60.6% 降至 11.5% (论文中提供了具体实验数据(GLM-5 测试结果),可通过 arXiv 链接(arxiv.org/abs/2609.01487)查阅原始研究方法和数据。)
- ◐ 部分可验证: 仅安装安全技能效果较弱,必须明确要求代理在行动前咨询它 (论文可能对比了不同防护策略的效果,但具体结论需结合实验设置判断,实际应用效果可能因场景而异。)
原文内容:
恶意代理技能在安装时看似安全,但在实际任务中才会变得危险,因此本文认为代理需要运行时安全检查,而不仅仅是安装前的扫描。 问题是时机:一个恶意技能可以等到代理访问有用文件、工具、凭证或外部服务时,才将其推向超出用户实际请求的范围。 本文提出了 SkillSonar,这是一个安全技能,它在代理工作时检查敏感操作,并决定是否允许它们、缩小范围、重新规划,或先询问用户。 在 GLM-5 上,它将熟悉攻击类型的攻击成功率从 48.2% 降至 10.4%,将未见风险家族的成功率从 60.6% 降至 11.5%。 一个关键结果:仅仅安装安全技能效果要弱得多。 必须明确告诉代理在行动前咨询它。 总体而言,本文认为在安装前扫描技能,在执行期间检查其操作,同时在底层保留硬性保护,如权限和沙箱。 – arxiv.org/abs/2609.01487 标题:"Defense-as-Skill: Evolving Runtime Guard Skill for Skill-Augmented Agents"
⏰ 19:58 | ❤️ 45点赞 | 📝 266字 | 查看原文 →
Rohan Paul @rohanpaul_ai
Compiling in real-time, the race towards AGI.
The Largest Show on X for AI.
Get my daily AI analysis newsletter to your email https://rohan-paul.com | 影响力: 6,793万粉丝
💡 核心观点: 大语言模型内部推理过程可分离监控且具独特模式。
可信度: 10/10 – 3项声明可直接验证;2项需进一步确认
事实核查:
- ◐ 部分可验证: 大语言模型的推理过程在生成词汇之外具有一种内部结构,这为从模型内部监控推理过程开辟了一条可能的途径。 (可通过论文(arXiv链接)中的实验方法和数据部分验证,但需依赖研究者对模型内部结构的解读,可能存在主观性。)
- ✓ 可验证: 研究人员追踪了8种常见的操作(如提取事实、演绎等),每种操作会产生独特的内部模式,且这些模式在中层中最为清晰。 (论文中应包含具体的实验设计、操作分类及模式分析数据,可通过公开论文直接验证。)
- ◐ 部分可验证: 模型可以在不一定正确完成推理的情况下,表征它正在尝试的推理类型(如错误的计算仍携带正确操作签名)。 (需通过论文中的错误案例分析验证,但“操作签名”的定义和识别可能依赖研究者的主观判断。)
原文内容:
这篇论文发现,大语言模型的推理过程在生成词汇之外具有一种内部结构,这为从模型内部监控推理过程开辟了一条可能的途径。 大语言模型试图做什么以及它是否正确地做到了这一点,似乎在内部是可以分离的。 研究人员追踪了8种常见的操作,包括提取事实、分解、回忆、演绎、代数和计算。 每种操作都会产生一种独特的内部模式,而这些模式在中层中最为清晰。 即使是完全相同的标记,在模型内部看起来也因其所从事的推理任务而有所不同。 上下文也会塑造这些状态。 当阻止访问前30个标记时,下一个推理操作的信号就会减弱。 最重要的是,一个错误的计算或演绎仍然可能携带正确的操作签名。 模型可以在不一定正确完成该推理的情况下,表征它正在尝试的推理类型。 – arxiv.org/abs/2609.04753 标题:“思想链表面之下的机制解释:大语言模型中推理操作的解读”
⏰ 18:52 | ❤️ 66点赞 | 📝 304字 | 查看原文 →
Anthony Pompliano @apompliano
企业家、投资者和终身学习者。
每日写作:http://pompletter.com
播客:http://pompyoutube.com
我的第二本书:http://pompbook.com | 影响力: 0万粉丝
💡 核心观点: 讨论股市、比特币新高及预算失衡背后的经济政治因素。
可信度: 1/10 – 基于事实核查结果综合评估
事实核查:
- ✗ 无法验证: 斯科特·贝森特是否在对债券市场虚张声势
- ✗ 无法验证: 验证状态:partially verifiable
- ✗ 无法验证: 说明:** 可通过分析斯科特·贝森特公开的言论、市场行为或债券市场数据(如美联储报告、彭博终端等)部分验证其策略真实性,但需结合专业金融分析,无法直接通过单一来源完全确认。
原文内容:
我与@DariusDale42展开对谈,深入探讨了斯科特·贝森特是否在债券市场故弄玄虚、股市屡创新高的内在逻辑,以及平衡预算为何难以实现等议题。 我们还剖析了K型经济分化、人工智能浪潮、比特币动态,以及美国政治格局的重构。 YouTube: https://youtube.com/watch?v=Z7xDFOs76uY&t=1s… Spotify: https://open.spotify.com/episode/7riH0bY6P7tEQBaZ10E3g7?si=qDIElqzMT1yJ4dUGdHtFKQ… Apple: https://podcasts.apple.com/us/podcast/bitcoin-stocks-are-going-higher-the-money-printer-is/id1434060078?i=1000791524184… 时间轴: 0:00 - 开场白 0:47 - 斯科特·贝森特的债券市场博弈术 7:34 - 德鲁肯米勒专栏与贝森特战略手册的关联 13:13 - 股市与比特币逼近历史峰值的底层逻辑 16:42 - 预算平衡困局及其连锁反应 24:30 - 住房市场代际鸿沟与锁定效应 28:02 - 财政紧缩、经济增长还是货币放水? 32:12 - 人工智能与比特币如何重塑竞争格局 36:15 - 社会流动性及邻里攀比效应 39:00 - 美国政治洗牌与未来图景 49:45 - 权力博弈、政治生态与发展路径
⏰ 05:14 | ❤️ 151点赞 | 📝 221字 | 查看原文 →
Charly Wargnier @datachaz
前 @Streamlit @Snowflake 大师 • 我写关于 AI 代理、大语言模型和自动化的内容 • 我的属于开源 • 合作请私信 | 影响力: 0万粉丝
💡 核心观点: PixVerse R2注重实时调整和创意探索的工作流程。
可信度: 8/10 – 1项声明可直接验证;3项需进一步确认;1项为观点陈述
事实核查:
- ◐ 部分可验证: PixVerse R2允许用户在生成的世界中行走后再决定是否构建游戏 (需实测工具或查看官方演示视频确认交互流程,但无直接公开文档说明具体功能实现。)
- ◐ 部分可验证: PixVerse R2支持重复输入以观察世界的动态响应 (功能描述较具体,但需实际测试工具或官方用例展示才能完全验证其实现方式。)
- ◐ 部分可验证: 用户可在Gallery影片中选择路径或输入方向以实时生成下一场景 (类似生成式AI的交互功能,需依赖官方演示或用户实测验证,目前推文未提供操作示例。)
原文内容:
暂且忘掉那些关于成品的炒作 PixVerse R2最有趣的部分在于其工作流程: 探索一个想法,尝试某些内容,然后在世界仍在运行时进行调整。 → 在确定游戏构建前,先漫步于生成的世界中 → 重复输入指令,观察世界的反馈 → 在Gallery影片中选择路径或输入方向,实时观看下一段内容的生成 它并非一个完整的游戏引擎,也无需如此。 对于构思、预视化和原型制作而言,这种实时循环已让人感受到与等待离线渲染截然不同的体验 ↓
⏰ 05:10 | ❤️ 23点赞 | 📝 97词 | 查看原文 →
Suchen Zang @suchenzang
Always hungry for intelligence. | 影响力: 1,373万粉丝
💡 核心观点: 台词仅为文学目的创作,无深层含义,不适感属读者问题。
可信度: 6/10 – 1项声明可直接验证;1项需进一步确认;1项为观点陈述
事实核查:
- ✓ 可验证: 这句惊悚台词纯粹是为了解决一个文学问题 (该声明涉及作者的创作意图,属于主观动机描述,除非作者明确公开创作背景或提供第三方佐证,否则无法客观验证。)
- ◐ 部分可验证: 台词是为“文学”目的而写,仅用于完成“文学”任务 (若推文上下文或关联作品能体现明确的文学性任务(如写作练习、课程作业等),可能部分验证;但“文学目的”本身是主观表述,需依赖作者解释。)
- ◦ 观点: 成年人若对儿童虐待内容感到不适是其个人问题 (这是对读者反应的主观评价,无客观标准,属于个人观点而非事实陈述。)
原文内容:
这句惊悚台词纯粹是为了解决一个文学问题!这里没什么可看的。它是为了“文学”目的而写的,用来完成一个“文学”任务,仅此而已。没有更多含义。 如果你作为一个成年人读到这种儿童对儿童的虐待内容感到不舒服,那是你的问题!
⏰ 04:49 | ❤️ 39点赞 | 📝 93字 | 查看原文 →
Amira Zairi @azed_ai
AI Educator & Creator | Ambassador @Adobe | Partner with leading brands | Collab → [email protected] | 影响力: 0万粉丝
💡 核心观点: 分享粉彩漫画角色设计技巧,包含多视角草图与表情刻画。
可信度: 8/10 – 2项声明可直接验证;1项需进一步确认;1项为观点陈述
事实核查:
- ✓ 可验证: 推文提供了一份粉彩漫画角色设计的提示模板 (推文明确列出了具体的设计要求(如工具、风格、元素等),内容可直接通过推文原文验证,无需外部信息。)
- ◐ 部分可验证: 该提示模板可用于生成漫画角色设计作品 (模板的实用性需通过实际创作验证,但推文鼓励用户尝试并分享成果,部分验证需依赖用户反馈或示例作品。)
- ◦ 观点: 提示模板强调“高对比度、漫画角色设计美学”等主观风格要求 (“美学”和风格描述是主观判断,无客观标准,属于个人或社群偏好的观点陈述。)
原文内容:
提示分享:粉彩漫画角色研究 提示: 一张[主体]的角色设计草图,包含多个全身视角、头部研究、富有表现力的面部变化、手势姿势,用铅笔和圆珠笔绘制,锐利的笔触线条,选择性柔和粉彩点缀,可见的结构标记,高对比度,漫画角色设计美学,干净的白色背景 试试看并分享你的作品
⏰ 19:00 | ❤️ 92点赞 | 📝 112字 | 查看原文 →
Aakash Gupta @aakashgupta
http://product-growth.com https://aibyaakash.com http://landpmjob.com http://youtube.com/@growproduct | 影响力: 0万粉丝
💡 核心观点: Meta VR眼镜通过外置计算组件实现100克超轻设计。
可信度: 8/10 – 1项声明可直接验证;2项需进一步确认;2项为观点陈述
事实核查:
- ✓ 可验证: Meta的新型VR眼镜仅重100克,因为里面没有任何计算组件(无芯片、电池、跟踪协处理器)。 (可通过Meta官方产品规格或发布会信息直接验证重量和内部组件设计,但需确认是否有独立第三方拆解报告支持。)
- ◐ 部分可验证: 所有计算组件存在于用户口袋里的一个圆盘中,通过光纤电缆连接,光纤可传输120Hz双5K显示屏所需的高带宽数据。 (官方可能公布连接方式与带宽参数,但光纤的实际性能(如弯曲耐受性、延迟)需实测或技术白皮书验证。)
- ◐ 部分可验证: 苹果Vision Pro头显因保留M2和R1芯片而重超600克,重量成为主要抱怨;Meta通过完全移除计算组件实现轻量化。 (Vision Pro重量和芯片配置可通过苹果官网验证,但“主要抱怨”需依赖用户评测统计;Meta的减重对比需官方数据支持。)
原文内容:
Meta 的新型 VR 眼镜仅重 100 克,因为里面没有任何计算组件。没有芯片,没有电池,甚至没有跟踪协处理器。所有这些都存在于你口袋里的一个圆盘中,通过光纤电缆连接。 这一决定就是整个产品。 苹果在 Vision Pro 上只走了一半路。他们将电池移到外部包中,但仍将 M2 和 R1 芯片留在你的脸上,头显重量最终超过 600 克。重量成为评论中最常见的抱怨。Meta 走完了剩下的路程,完全切除了计算机。 一旦硅片离开框架,物理学的其他一切都随之瓦解。你的眼睛附近没有任何东西产生热量,因此无需风扇,仅靠镁合金外壳就能处理散热。没有电池意味着鼻子没有配重。剩下的只有传感器、两个微型 OLED 面板和薄饼镜头。100 克对比 Quest 3 的 515 克。 光纤连接线是人们会忽略的部分。以 120Hz 驱动双 5K 显示屏需要比细铜线能处理的更多带宽。光纤通过一根像鞋带一样弯曲的纤维传输这些数据。 这是一个真正的权衡取舍,Meta 故意选择了它。视野比 Quest 窄。他们赌的是,人们更想要一个影院和一个工作空间,而不是外围沉浸感。 Vision Pro 是一台你戴在身上的计算机。Meta VR 眼镜是一块你戴在身上的显示器。计算机回到了你的口袋里,自 2007 年以来它一直住在那儿。
⏰ 13:58 | ❤️ 269点赞 | 📝 393字 | 查看原文 →