【AI 英文奏折】2026年07月25日
共收录 20 篇深度内容
📋 今日内容速览
快速浏览,点击感兴趣的推文查看详细分析
- Emily: 社交媒体的未来是可执行内容,突破被动浏览的疲劳。
- Marc Lou: 滑雪滑行机高效无冲击,提升心率和体能。
- AshutoshShrivastava: AI安全担忧因竞争加剧被迅速搁置。
- Aakash Gupta: 巨星降薪利用商业收入换取争冠阵容,暴露NBA薪资体系漏洞。
- Amira Zairi: Firefly AI高效生成多平台营销素材,优化创意工作流程。
- Aakash Gupta: 漫威因选角失误损失惨重,重金调整复仇者计划。
- Charly Wargnier: 高效代理架构提升本地模型任务表现近两成。
- Rohan Paul: 保留完整记忆可编程检索提升长期推理效果
- Aakash Gupta: 美国公司呼吁保护开放AI模型,实为应对中国模型禁令,背后涉及商业利益博弈。
- Santiago Valdarrama: AI面试替代简历,直接匹配职位,省去招聘中介。
- Rohan Paul: GAMUT基准通过检测遗漏信息评估AI回答的事实完整性。
- AshutoshShrivastava: AI成功为游戏创建完整新关卡并优化代码。
- The Turing Post: 构建稳定AI代理需基础设施支持,超越模型本身。
- Ethan Mollick: Claude隐藏思考轨迹损害可解释性和洞见价值
- SemiAnalysis: 存储从配角变主角,因技术升级和成本上涨受关注。
- AshutoshShrivastava: Anthropic新模型Opus 5性能媲美Fable 5且价格减半。
- Emily: 用Three.js构建完整交互体验,注重实践与效果验证。
- Rohan Paul: 中国开源AI推动行业增长,与闭源模型互补而非对抗。
- Santiago Valdarrama: 开放AI模型普惠大众,智能共享如互联网。
- Marc Lou: 丁酸甘油三酯和巴氏杀菌阿克曼菌补充剂可改善肠道健康。
📖 详细内容
Emily @iamemily2050
Any sufficiently advanced technology is indistinguishable from magic. | 影响力: 48.2k万粉丝
💡 核心观点: 社交媒体的未来是可执行内容,突破被动浏览的疲劳。
可信度: 6/10 – 1项声明可直接验证;2项需进一步确认;1项为观点陈述
事实核查:
- ◐ 部分可验证: 现代社交媒体体验已经达到了数字疲劳的终端墙 (可通过用户调研、社交媒体使用数据(如平均使用时长、参与度下降趋势)部分验证,但“终端墙”是主观表述,缺乏明确定义。)
- ◐ 部分可验证: 过去十年我们被困在“被动滚动”中,内容是扁平化记录和静态呈现 (社交媒体设计(如无限滚动、点赞机制)和用户行为研究可部分支持,但“被困”是主观描述,需具体数据佐证被动性是否普遍。)
- ✓ 可验证: Versioned Executable Social Artifact (VESA) 是解决停滞的架构方案 (VESA 为未定义的新概念,无公开技术细节或案例,属于作者主观提出的解决方案愿景。)
原文内容:
我从事这项研究已有一段时间,以下是初步成果。 超越"点赞"按钮:为何可执行内容代表社交媒体的未来。 现代社交媒体体验已陷入数字疲劳的终极困境。十年来,我们被困在"被动滚动"的模式中——那些为瞬间反应而设计的扁平化记录与静态呈现内容流。解决这种停滞的架构方案正是"版本化可执行社交载体"(VESA)。
⏰ 13:57 | ❤️ 22点赞 | 📝 77词 | 查看原文 →
Marc Lou @marclou
⭐️ TrustMRR.com $27K/m | DataFa.st $20K/m | SHlPORDIE.COM $20K/mo | 影响力: 170.0k万粉丝
💡 核心观点: 滑雪滑行机高效无冲击,提升心率和体能。
可信度: 6/10 – 1项声明可直接验证;2项需进一步确认;1项为观点陈述
事实核查:
- ◦ 观点: 滑雪滑行机是一款出色的有氧运动器械 (该声明为主观评价,缺乏客观标准(如“出色”的定义),且未提供具体数据或第三方研究支持。)
- ◐ 部分可验证: 滑雪滑行机不会用到股四头肌,没有冲击力,且能迅速提升心率(与骑行对比) (可通过运动科学文献或器械说明书验证其对肌肉群的使用和冲击力特性,但“迅速提升心率”需实测数据或对比研究支持,骑行对比需具体实验条件。)
- ✓ 可验证: 以1:52/500m的速度完成6x1km训练可提升整体体能和寿命 (训练效果与寿命的关联需长期医学研究支持,个人案例无法直接验证;速度数据虽可实测,但“体能和寿命”的结论无即时验证依据。)
原文内容:
滑雪滑行机是一款出色的有氧运动器械 它不会用到你已经疲惫的股四头肌,没有冲击力,而且能迅速提升你的心率(不像骑行那样)。 我用它来进行二区和 VO2 最大值训练课程。 例如今天的训练: - 10 分钟热身 - 6x 1km 以 1:52/500m 的速度 我在四区/五区保持了 20 分钟,这能提升我的整体体能和寿命! 试试看,然后告诉我你的感受
⏰ 13:48 | ❤️ 47点赞 | 📝 121字 | 查看原文 →
AshutoshShrivastava @ai_for_success
| 影响力: 0万粉丝
💡 核心观点: AI安全担忧因竞争加剧被迅速搁置。
可信度: 6/10 – 1项声明可直接验证;2项需进一步确认;1项为观点陈述
事实核查:
- ◐ 部分可验证: Fable 5因AI安全担忧被推迟发布,Anthropic在Mythos 5公告后等待较长时间才发布 (需核实Anthropic官方关于Fable 5的延迟原因及时间线,但若公司未公开具体细节则无法完全验证。)
- ◐ 部分可验证: Anthropic发布的Opus 5模型比Fable 5更强大 (可通过对比官方发布的模型性能指标验证,但“强大”的定义可能涉及主观标准(如特定任务表现)。)
- ◦ 观点: AI安全担忧在竞争加剧后不再被优先考虑(叙事变化) (推文作者对行业动机的主观推断,缺乏直接证据证明企业决策与竞争压力的因果关系。)
原文内容:
所以你是在告诉我..... Fable 5 据说因为 AI 安全担忧而太危险无法发布,所以 Anthropic 在 Mythos 5 发布公告后等了很长时间才让它可用。 然后 GPT 5.6 和 Kimi K3 发布了。几天后,Anthropic 发布了 Opus 5,一个看起来比 Fable 5 更强大的模型。 所以... AI 安全不再是个问题了吗? 当竞争加剧,你的业务开始受损时,这个叙事变化得真他妈快。
⏰ 13:41 | ❤️ 52点赞 | 📝 104字 | 查看原文 →
Aakash Gupta @aakashgupta
✍️ product-growth.com 💼 https://t.co/STzr4nqxnm 🤝 https://t.co/SqC3jTyP03 🎙️ https://t.co/fmB6Zf5UZv | 影响力: 278.7k万粉丝
💡 核心观点: 巨星降薪利用商业收入换取争冠阵容,暴露NBA薪资体系漏洞。
可信度: 8/10 – 1项声明可直接验证;2项需进一步确认;2项为观点陈述
事实核查:
- ◐ 部分可验证: 勒布朗·詹姆斯下赛季将接受老将底薪390万美元,薪资削减92% (球员薪资变动需通过NBA官方公告或球队签约信息验证,但目前(截至2023年10月)无公开报道确认勒布朗与76人签约或降薪。老将底薪金额符合联盟规定,但具体签约行为需后续官方消息证实。)
- ◐ 部分可验证: 勒布朗过去12个月场外收入8500万美元,职业生涯场外收入超11亿美元 (场外收入数据通常来自《福布斯》等商业媒体估算(如2023年《福布斯》报道其年收入1.2亿美元,含代言等),但具体股权收益、媒体公司收入等细节未完全公开,可能存在统计差异。)
- ◦ 观点: 薪资帽设计假设球员依赖球队薪水,而勒布朗的商业模式(95%收入来自场外)使其薪资成为阵容工具 (薪资帽规则(如顶薪占35%薪资帽)可通过NBA劳资协议(CBA)验证,但“商业模式推翻假设”“薪资作为工具”属于主观推论,无直接数据证明其动机或联盟漏洞存在。)
原文内容:
勒布朗·詹姆斯刚刚接受了92%的薪资削减。上赛季在湖人队拿下5260万美元,下赛季在费城拿下390万美元的老将底薪。他这么做的数学逻辑揭示了整个NBA设计中的一个漏洞。 勒布朗在过去12个月里场外收入8500万美元。耐克、他的媒体公司、他代言品牌的股权。以这个速度,他每17天就能赚到他在76人的全部薪水,而无需碰一下篮球。 职业生涯总收入对比更鲜明。23年来NBA薪资总计5.81亿美元,是联盟历史最高。同等时间内场外收入超过11亿美元。他自己的企业给他带来的回报大约是联盟的两倍。 薪资帽的存在是为了通过让球星变得昂贵来分配天赋。一份顶薪合同会吃掉球队35%的薪资帽,这就是为什么没有阵容能容纳三份顶薪。这种设计假设球员是由球队支付薪水的。 勒布朗的商业模式推翻了这个假设。当95%的收入来自代言和股权时,薪资就不再是报酬,而是变成阵容工具。他向76人收取了390万美元,他们保留了恩比德、马克西,以及杰伦·布朗的交易完整性,而他用自己根本不需要的钱买来了职业生涯中最好的配角阵容。 41岁时拿到第五枚戒指,将成为体育史上最有价值的传奇故事,而他的代言收入会随着这个故事而增长,因为这些合同是基于他的文化影响力而非得分数据续约的。放弃4500万美元薪水,是他一生中最划算的营销支出。 薪资帽是为那些需要薪水的球员设计的。耐克在20年前就让那种球员退役了。勒布朗是第一个有钱到能完全利用这个漏洞的人。
⏰ 13:40 | ❤️ 37点赞 | 📝 502字 | 查看原文 →
Amira Zairi @azed_ai
AI Educator & Creator | Ambassador @Adobe @LeonardoAi & @tripoai | Partner with leading brands | Collaboration → [email protected] | 影响力: 57.13k万粉丝
💡 核心观点: Firefly AI高效生成多平台营销素材,优化创意工作流程。
可信度: 10/10 – 2项声明可直接验证;2项需进一步确认;1项为观点陈述
事实核查:
- ◐ 部分可验证: 使用 Firefly AI 助手的 Mockups 技能将产品图片转化为专业的营销视觉效果 (可通过 Adobe Firefly 官方功能演示或用户实测验证 Mockups 技能的存在及基本效果,但“精美视觉效果”和“随时可用于营销活动”等描述需依赖主观判断或具体案例对比。)
- ◐ 部分可验证: Social Media Assets 技能可自动生成适配多平台的即用设计(如调整尺寸、构图等) (官方文档可能提及多平台适配功能,但“无需手动调整”“完整社交帖子效果”等需实测验证,且效果可能因用户输入描述差异而不同。)
- ◦ 观点: 通过对话优化设计(如调整尺寸、构图等)是工作流程中最强大的部分 (功能交互性(对话优化)可能通过官方演示验证,但“最强大”属主观评价,无客观标准。)
原文内容:
我在真实的创意工作流程中测试了Firefly AI助手,重点运用了它的两项核心功能:**产品模型展示**和**社交媒体素材生成**。 首先我虚构了一个运动鞋品牌,通过产品模型展示功能将基础产品图置入专业营销场景。原本普通的商品照片被转化为精致的视觉作品,其完成度可直接用于市场营销活动。 随后使用社交媒体素材功能,将这些视觉效果一键适配到Instagram、LinkedIn、Facebook、X和TikTok等平台。整个过程无需手动调整尺寸、裁剪或为不同平台重复处理图片——只需简单说明需求:保持产品主体突出、遵循安全边距规则、按各平台规格优化构图,确保每个版本都具备完整社交媒体帖件的质感。 最令我惊喜的是通过自然对话实现精准优化。无论是调整产品大小、优化画面结构、修改画幅比例,还是精细调节版式,只需向Firefly AI助手提出要求,就能持续迭代直至完全符合预期。 这正是整个工作流程展现真正威力的地方。从一张原始产品图出发,仅用几分钟就能建立专业级产品模型,并生成整套即用型社交媒体素材包。 本文由@Adobe赞助,本人系Adobe Firefly推广大使 #AdobeFirefly推广大使 #AdobeFirefly使用指南 #FireflyAI助手
⏰ 00:03 | ❤️ 68点赞 | 📝 328字 | 查看原文 →
Aakash Gupta @aakashgupta
✍️ product-growth.com 💼 https://t.co/STzr4nqxnm 🤝 https://t.co/SqC3jTyP03 🎙️ https://t.co/fmB6Zf5UZv | 影响力: 278.7k万粉丝
💡 核心观点: 漫威因选角失误损失惨重,重金调整复仇者计划。
可信度: 1/10 – 1项暂无法验证
事实核查:
- ✗ 无法验证: 事实核查功能暂时不可用 (系统处理中)
原文内容:
漫威仅在薪资上就花费了1.8亿美元来撤销一个选角决定。 《康氏王朝》于2022年7月的Comic-Con上宣布为第五部《复仇者联盟》电影。整个多元宇宙传奇就是围绕康设计的,而康则是围绕一位演员扮演他所有时间线上的变体而设计的。灭霸是一个CGI模型,配有可替换的动作捕捉表演者。康则是乔纳森·梅杰斯真实的容貌,同时出现在数十个角色中。 这种结构让一个普通人成为数十亿美元电影计划的承重墙。银行称之为“关键人物风险”,并将其计入50万美元贷款的定价。漫威却将其置于十年电影计划之下。 而且这位反派在法庭采取任何行动之前就已经失败了。《量子狂热》,这部旨在确立康作为新灭霸的电影,全球票房4.76亿美元,对比大约3.3亿美元的成本,据报道亏损。观众在《洛基》和《量子狂热》中遇到了这位传奇大反派,却从未真正畏惧过他。 梅杰斯于2023年12月被定罪,并在数小时内被解雇。这一定罪为漫威提供了一个干净的法律出口,解决了一个它早已存在的创意问题。 然后就是重建的账单。小罗伯特·唐尼据报道将获得超过1亿美元,出演下一部两部《复仇者联盟》电影中的毁灭博士。罗素兄弟获得8000万美元执导它们。第五部《复仇者联盟》电影从2025年5月推迟到2026年12月。 漫威对一个未经证实的反派的解决方案,是它拥有的最可靠的面孔。这个1亿美元的修复方案是一位自2019年以来角色已死的演员。
⏰ 12:14 | ❤️ 25点赞 | 📝 471字 | 查看原文 →
Charly Wargnier @datachaz
Ex @Streamlit @Snowflake Maestro • I write about AI agents, LLMs and automation • My ❤️ is open source • DM for collabs | 影响力: unknown万粉丝
💡 核心观点: 高效代理架构提升本地模型任务表现近两成。
可信度: 1/10 – 1项暂无法验证
事实核查:
- ✗ 无法验证: 事实核查功能暂时不可用 (系统处理中)
原文内容:
天哪!一个新的开源代理刚刚在 GAIA 基准测试中击败了 Hermes,使用完全相同的本地模型和硬件运行 @atomicagent_io 使用 4 位 Qwen-3.6-35b 在 M4 Max 上运行了 53 个真实世界的 GAIA Level 1 任务,对抗 Hermes 结果突显了编排层的重要性: → Atomic Agent:69.8% 已解决(3 小时 12 分钟) → Hermes Agent:58.5% 已解决(5 小时 10 分钟) Atomic 解决了 6 个更多任务,并几乎快了两小时完成。 秘密是什么? 一个高度自律的代理循环,拒绝浪费计算资源。 Atomic 使用字节稳定的提示来大量重用 KV 缓存。 它不是将原始日志倾倒到上下文窗口中,而是通过 JSON 批量处理工具调用并压缩结果。 再加上对无限工具调用循环的硬停止,你就得到一个保持 razor-sharp 的模型,而不是淹没在自己的垃圾数据中。 开源且优先本地运行! 仓库在下方 ↓
⏰ 09:48 | ❤️ 31点赞 | 📝 228字 | 查看原文 →
Rohan Paul @rohanpaul_ai
Compiling in real-time, the race towards AGI. The Largest Show on X for AI. | 影响力: 0万粉丝
💡 核心观点: 保留完整记忆可编程检索提升长期推理效果
可信度: 1/10 – 1项暂无法验证
事实核查:
- ✗ 无法验证: 事实核查功能暂时不可用 (系统处理中)
原文内容:
这篇论文表明,当不丢弃任何过去信息时,代理在较长时间内推理得更好。 将每个过去操作保存在一个可搜索的日志中,有助于编码代理更可靠地解决长时间任务。 长时间运行的代理常常丢失关键细节,因为摘要在任何人知道哪些信息以后会重要之前就丢弃了信息。 PRO-LONG 则将每个观察、操作、结果和简短计划记录在一个结构化的文本日志中。 代理随后使用普通的编码工具,如搜索命令和 Python,来恢复相关证据。 在 ARC-AGI-3 的 25 个隐藏规则游戏中,该方法平均将相同的基础代理提高了 18 个百分点。 它还匹配或几乎匹配了更强的专用系统,同时使用的计费令牌数量减少了 4.2 至 5.8 倍。 总体而言,这表明长期代理内存在存储保持无损且检索变得可编程时可能效果最佳。 – arxiv. org/abs/2607.20064 标题:“PRO-LONG:程序化内存实现长时程推理”
⏰ 18:31 | ❤️ 58点赞 | 📝 277字 | 查看原文 →
Aakash Gupta @aakashgupta
✍️ product-growth.com 💼 https://t.co/STzr4nqxnm 🤝 https://t.co/SqC3jTyP03 🎙️ https://t.co/fmB6Zf5UZv | 影响力: 278.7k万粉丝
💡 核心观点: 美国公司呼吁保护开放AI模型,实为应对中国模型禁令,背后涉及商业利益博弈。
可信度: 1/10 – 1项暂无法验证
事实核查:
- ✗ 无法验证: 事实核查功能暂时不可用 (系统处理中)
原文内容:
25 家美国公司刚刚签署了一封信,请求华盛顿保护开放 AI 模型。这封信从未提及中国。它完全是关于中国的。 在它发布前四天,有报道称白宫正在重启一项禁止中国 AI 模型的推动。这封信回应了这一推动,却没有点名。没有 DeepSeek。没有 Moonshot。三页内容解释为什么限制可下载模型会削弱美国安全,同周 Jensen 告诉 Axios,美国公司应该“绝对”自由使用中国模型。 尴尬的部分在于前沿开放模型实际上来自哪里。目前世界上最强的开放权重模型是北京构建的 Kimi K3。禁止中国开放模型将打击每一个基于它们构建的美国初创公司,以及每一个租用 NVIDIA GPU 来运行它们的用户。 现在看看签名名单。NVIDIA 卖芯片。Dell 卖服务器。Microsoft 卖云服务。Hugging Face 卖分发平台。Perplexity 和 Replit 卖上面的应用。名单上的每家公司,当模型变便宜时,都能赚得更多。缺失的三个名字,OpenAI、Anthropic 和 Google,运营着封闭实验室,如果开放模型被限制,它们将获利最大。 然后是 Meta,它签署了一封庆祝开放权重的信,同时据报道正在构建其下一个旗舰模型为封闭且仅限 API。美国最响亮的开放权重捍卫者,在签署前换了边。 Jensen 在 X 平台整个存在期间都保持沉默。他打破沉默是为了这封政策信,因为赌注是他的整个客户群。来自任何地方的开放模型仍然在一处运行芯片上。
⏰ 11:32 | ❤️ 21点赞 | 📝 418字 | 查看原文 →
Santiago Valdarrama @svpino
| 影响力: unknown万粉丝
💡 核心观点: AI面试替代简历,直接匹配职位,省去招聘中介。
可信度: 8/10 – 1项声明可直接验证;3项需进一步确认;1项为观点陈述
事实核查:
- ◐ 部分可验证: @meetdexai 是一个针对工程师的新型 AI 人才代理,通过对话构建个人资料,替代传统简历。 (可通过访问 @meetdexai 官网或试用服务验证其功能,但需实际测试才能确认其完整性和效果。)
- ◐ 部分可验证: Dex 的面试流程约10分钟,通过语音或聊天引导用户回答问题,生成匹配职位列表(含薪资信息)。 (用户可注册体验流程时长和功能,但“匹配职位列表”的准确性和薪资透明度需依赖平台实际数据,可能受限于未公开的算法。)
- ✓ 可验证: 求职者免费使用,公司仅在录用后付费。 (商业模式通常会在官网或服务条款中明确说明,可通过公开信息直接验证。)
原文内容:
在线招聘即将发生变化,我这辈子再也不想读或发送简历了! 我为了测试目的,经历了@meetdexai的面试流程。这是一个针对工程师的新型 AI 人才代理,我再也不想和招聘人员交谈了。 如果你正在找工作,你应该试试这个。 它问我的问题正是每个人都应该被问到的那些: • 我想花时间解决什么问题 • 我更喜欢在多大规模的团队中工作 • 对我来说,一个好的工作周会是什么样子 • ... 我们都知道简历很烂,它们并不能很好地展现你的能力。 这是一件完全不同的东西: 在这里,Dex 通过与你的对话来构建个人资料。你可以直接和它语音交谈,或者如果你喜欢,也可以聊天。AI 会引导你回答所有问题,并构建一个资料,用来向你展示匹配你需求的工作机会。 你用 LinkedIn 注册。你不需要发送简历。我的面试大约花了 10 分钟。 从这里开始,你会得到匹配职位的列表,包括薪资信息。你会直接被介绍给招聘经理,中间没有其他招聘人员介入。 这对求职者来说全部免费。公司只有在你被录用时才付费。
⏰ 23:05 | ❤️ 45点赞 | 📝 346字 | 查看原文 →
Rohan Paul @rohanpaul_ai
Compiling in real-time, the race towards AGI. The Largest Show on X for AI. | 影响力: 0万粉丝
💡 核心观点: GAMUT基准通过检测遗漏信息评估AI回答的事实完整性。
可信度: 6/10 – 1项声明可直接验证;2项需进一步确认;1项为观点陈述
事实核查:
- ◐ 部分可验证: GAMUT 使缺失的信息可衡量,从而为 AI 团队提供更清晰的测试,以验证长回答是否真正完成了任务。 (可通过论文原文(arXiv链接)验证其方法设计,但具体测试效果需依赖实际应用或第三方复现结果。)
- ✓ 可验证: 大多数事实性测试询问每个陈述的主张是否正确,但它们很少检查回答遗漏了什么。 (可通过对比现有事实性测试标准(如TruthfulQA等公开基准)与论文提出的方法进行验证。)
- ◐ 部分可验证: 在 14 个强大模型中,最佳分数仅为 58.7%,而缺失信息导致的失败比虚假主张更多。 (论文中提供了实验数据和模型列表,但模型的具体表现需结合代码或数据集复现确认。)
原文内容:
新 Meta 论文认为,事实性意味着既要避免错误,又要包含足够多的正确信息。 事实性中最难的部分可能是衡量 AI 回答遗漏了什么。 GAMUT 使缺失的信息可衡量,从而为 AI 团队提供更清晰的测试,以验证长回答是否真正完成了任务。 大多数事实性测试询问每个陈述的主张是否正确,但它们很少检查回答遗漏了什么。 该基准首先构建一个结构化的指南,标记必需的事实、可接受的选择、有序步骤、关系及其重要性。 然后,它将该更丰富的指南转换为小型通过或失败的检查,这一点 LLM 评判可以更一致地评分。 在 14 个强大模型中,最佳分数仅为 58.7%,而缺失信息导致的失败比虚假主张更多。 --- – arxiv.org/abs/2607.19322 标题:“用于评估开放式生成的双层元评分标准:GAMUT,事实完整性基准”
⏰ 19:44 | ❤️ 32点赞 | 📝 254字 | 查看原文 →
AshutoshShrivastava @ai_for_success
| 影响力: 0万粉丝
💡 核心观点: AI成功为游戏创建完整新关卡并优化代码。
可信度: 10/10 – 3项声明可直接验证;2项需进一步确认
事实核查:
- ◐ 部分可验证: Opus 5为Aether Breach游戏添加了一个新关卡 (需查看游戏更新日志或开发者提供的代码提交记录,但若未公开具体实现过程则无法完全验证。)
- ✓ 可验证: 新关卡被命名为Opus Rift (可通过游戏内关卡列表或官方发布的更新公告直接确认名称。)
- ✓ 可验证: Opus 5理解了整个代码库并生成了全新关卡 (AI“理解代码库”是内部逻辑,无法通过外部观察验证;生成关卡的具体过程若未公开则无法核实。)
原文内容:
我让 Opus 5 给我的 Aether Breach 游戏添加一个新关卡,它完全搞定了。 它还决定把这个新关卡命名为 Opus Rift。 它理解了整个代码库,生成了一整个全新的关卡,创建了匹配现有艺术风格的资源,甚至还修复了我一直想清理的几个问题。
⏰ 11:04 | ❤️ 21点赞 | 📝 84字 | 查看原文 →
The Turing Post @theturingpost
| 影响力: unknown万粉丝
💡 核心观点: 构建稳定AI代理需基础设施支持,超越模型本身。
可信度: 10/10 – 2项声明可直接验证;2项需进一步确认;1项为观点陈述
事实核查:
- ◐ 部分可验证: 设计代理式平台需要利用 harness 的各层帮助 AI 代理在生产环境中存活 (可通过点击推文中的链接(https://bit.ly/4c2CnBE)查看 MongoDB 的官方指南,但需实际阅读内容以确认是否明确提及 “harness 的各层” 及其具体作用。)
- ✓ 可验证: 代理在演示之外会失败的原因被解释 (推文明确提到指南涵盖此内容,且可通过官方链接直接验证是否包含相关分析。)
- ◦ 观点: 模型只是 AI 代理中最小的部分 (这一声明属于主观观点,可能基于 MongoDB 的技术解读,但缺乏客观标准定义 “最小部分”,无法直接验证。)
原文内容:
来自 @MongoDB 的必读指南 -> 设计代理式平台:让代理运行的基础设施 https://bit.ly/4c2CnBE 它解释了如何利用 harness 的各层帮助 AI 代理在生产环境中存活 涵盖内容: - 为什么代理在演示之外会失败 - 为什么模型只是最小的部分 - 记忆、编排、可观测性和评估 - 安全、治理和持久执行 - 以及如何在团队间大规模运行代理
⏰ 06:56 | ❤️ 20点赞 | 📝 111字 | 查看原文 →
Ethan Mollick @emollick
Professor @Wharton studying AI, innovation & startups. Democratizing education using tech. Author of Co-Intelligence | 影响力: unknown万粉丝
💡 核心观点: Claude隐藏思考轨迹损害可解释性和洞见价值
可信度: 5/10 – 2项需进一步确认;2项为观点陈述
事实核查:
- ◐ 部分可验证: Claude已经停止显示完整的总结思考轨迹 (需通过实测或官方更新日志确认当前版本功能变化,但无直接公开声明或文档说明此改动。)
- ◦ 观点: 隐藏思考轨迹对可解释性造成巨大损失 (属于主观价值判断,取决于用户对“可解释性”需求的重要性,无客观标准验证。)
- ◐ 部分可验证: 查看总结的思考轨迹能帮助诊断模型错误 (可通过对比有无思考轨迹的输出来间接验证其调试作用,但效果因人而异,缺乏量化依据。)
原文内容:
Claude 是否已经停止显示完整的总结思考轨迹了?看看这个前后的对比 如果是这样,这实际上是一个巨大的损失,既对可解释性(即使是看到总结的思考轨迹也能帮助你以其他方式无法诊断错误)不利,也因为它们很有洞见
⏰ 09:36 | ❤️ 189点赞 | 📝 89字 | 查看原文 →
SemiAnalysis @semianalysis_
In-depth research on semiconductors, AI infra & hardware | 影响力: unknown万粉丝
💡 核心观点: 存储从配角变主角,因技术升级和成本上涨受关注。
可信度: 8/10 – 2项声明可直接验证;1项需进一步确认;1项为观点陈述
事实核查:
- ✓ 可验证: SSD价格直线上升 (SSD市场价格波动可通过行业报告(如TrendForce、IDC)或零售商公开数据验证,但需明确时间范围和具体型号。)
- ◐ 部分可验证: Supermicro推出Petascale解决方案,在存储量、带宽和IO带宽间实现平衡 (Supermicro官网或新闻稿可能提及该方案,但“非常好的平衡”是主观描述,性能数据需实测或第三方评测验证。)
- ✓ 可验证: Supermicro与VAST、WEKA等软件供应商合作,引入软件定义存储 (合作信息可通过Supermicro或合作方(如VAST官网)的公开声明直接验证,但具体技术整合细节可能需进一步确认。)
原文内容:
存储刚刚抢尽风头。 在 KV 缓存卸载和 SSD 价格直线上升之间,存储从被忽视的配角变成了主角。Vik Malyala 详细介绍了 @Supermicro 的存储堆栈。 “存储,无论是用于 KV 缓存卸载,还是 SSD 成本惊人的上涨,对于许多用户来说,都是首要关注的事项。” “最初是从外形规格开始的。你有受欢迎的 U.2,或者说现在仍然受欢迎。然后你有 E1.S 和 E3.S 驱动器,主要因为我们在 1U 或 2U 外形规格中能带来的高密度。而且我们推出了所谓的 Petascale 解决方案,你可以在存储量、存储带宽以及 IO 带宽之间获得非常好的平衡。” “硬件只是其中一部分,但我们正在与 VAST、WEKA、DDN、Qumulo、OSNEXUS 等软件供应商合作。我们能够将不同类型的软件定义存储引入客户环境,这样你就不必局限于传统存储。所以这是超级激动人心的时代。”
⏰ 09:30 | ❤️ 138点赞 | 📝 248字 | 查看原文 →
AshutoshShrivastava @ai_for_success
| 影响力: 0万粉丝
💡 核心观点: Anthropic新模型Opus 5性能媲美Fable 5且价格减半。
可信度: 6/10 – 1项声明可直接验证;2项需进一步确认;1项为观点陈述
事实核查:
- ◐ 部分可验证: Opus 5 的性能与 Fable 5 相当,但价格仅为其近一半 (需对比 Anthropic 和 Fable 的官方定价及性能基准数据,但若 atomic[.]chat 的测试结果公开且方法透明,可部分验证。)
- ◐ 部分可验证: Opus 5 在真实破坏物理模拟方面超越了 Fable 5 (依赖 atomic[.]chat 的基准测试细节是否公开。若测试方法、数据集和结果可查,则部分可验证;否则需第三方复现。)
- ◦ 观点: Fable 自推出以来一直是最佳模型 (“最佳”是主观评价,取决于具体评估指标和场景,无统一标准。)
原文内容:
Anthropic 强势回归。Opus 5 的性能与 Fable 5 相当,但价格仅为其近一半,这完全不在我的意料之中。 Opus 5 在真实破坏物理模拟方面超越了 Fable 5,同时成本仅为其约 2 倍的 1/2。考虑到 Fable 自推出以来一直是最佳模型,这是一个相当显著的飞跃。 该基准测试由 atomic[.]chat 运行,这是一款在本地运行 LLM 的桌面应用程序。
⏰ 08:48 | ❤️ 161点赞 | 📝 104字 | 查看原文 →
Emily @iamemily2050
Any sufficiently advanced technology is indistinguishable from magic. | 影响力: 48.2k万粉丝
💡 核心观点: 用Three.js构建完整交互体验,注重实践与效果验证。
可信度: 10/10 – 2项声明可直接验证;3项需进一步确认
事实核查:
- ✓ 可验证: 使用Vite、严格TypeScript、原生Three.js 0.185.0等工具和技术构建项目 (可以通过Vite、TypeScript和Three.js的官方文档或GitHub仓库验证这些工具和版本的存在及功能。)
- ◐ 部分可验证: 原创性排除列表中提到的效果(如粒子球体、星系、霓虹网格等)不得使用 (可以通过检查代码或实际运行项目来验证是否使用了这些排除的效果,但需要具体实现后才能完全确认。)
- ✓ 可验证: 体验必须定义主要用户动词、状态变量、即时响应等因果契约要素 (可以通过代码审查或运行项目来验证这些要素是否被明确定义和实现,具体功能是否符合描述。)
原文内容:
对于那些喜欢用新模型测试 Three.js 或者只是为了好玩的人,这个系统提示是为你们准备的;外面有很多垃圾内容 **主提示:独特的 Three.js 体验** 从提供的概念构建、运行、测试和修复一个完整的浏览器体验。不要在计划、解释、脚手架或静态场景后停止。 **交付模式** 默认使用 **项目模式**: - Vite - 严格 TypeScript - 原生 Three.js 0.185.0 - 模块化文件 - 除非周围界面确实需要,否则不使用 React 为了受控的模型比较,使用 **基准模式**: - 一个自包含的 index.html - 通过 import map 使用 Three.js 0.185.0 - 无外部资源 - 每个模型使用相同的种子、视口和库版本 **概念** [在此粘贴一个概念] **因果契约** 体验必须定义: 1. 一个主要用户动词。 2. 该动作改变的状态变量。 3. 即时响应。 4. 延迟或累积后果。 5. 输入结束后仍然存在的证据。 6. 最终稳定或解决的状态。 指针移动、相机环绕、临时轨迹、颜色切换和对象旋转不合格为主机制。 **原创性排除** 不要使用粒子球体、星系、星空、霓虹网格、发光传送门、铬液滴、液体球体、通用地形、漂浮玻璃卡片、光标粒子轨迹、音频频谱条、随机立方体、空闲相机环绕、青色-洋红色绽放,或以物理形式呈现的噪声位移。 每个可见效果都必须传达真实的状态变量。 **体验弧线** 创建四个可读阶段: - 三秒钟内的邀请 - 带有即时阻力或反馈的操作 - 持久后果 - 解决或组合静止状态 包含重置和重播。在以下位置添加确定性的社交捕获模式: ?demo=1&seed=271828 演示模式必须在 12 到 15 秒内从邀请到解决展示真实机制。它不得用单独的预录动画替代。 **相机和视觉方向** 创作一个相机构图。相机移动必须揭示因果关系,而不是装饰场景。使用三到五种颜色的功能性调色板、明确材质行为、受控负空间和一个可识别的轮廓。默认关闭绽放。 **工程** 支持指针、触摸和键盘。不要依赖悬停。提供减少运动行为和语义 DOM 控件。 使用固定或有界的模拟时间步长、确定性重置、可重用帧循环对象、自适应质量和资源释放。除非计算或存储缓冲区实质上证明 WebGPURenderer 或 TSL 的合理性,否则使用 WebGLRenderer。检测功能并在回退模式中保留机制。 目标是桌面 60 fps 和移动设备至少 30 fps。桌面 DPR 上限为 2,移动设备为 1.5。当页面隐藏时暂停不必要的工作。 **验证** 类型检查、生产构建、浏览器烟雾测试、指针和键盘测试、纵向和横向测试、重复重置测试、隐藏标签行为,以及控制台或着色器错误检查。 验证: - 后果在输入结束后持续存在。 - 使用相同种子重置会重现相同的初始状态。 - 体验在没有自由相机环绕的情况下仍然可理解。 - 没有假控件。 - 没有待办事项或占位符视觉效果残留。 返回完整的实现、命令、验证结果、测量性能、已知限制和更改的文件。
⏰ 08:46 | ❤️ 52点赞 | 📝 856字 | 查看原文 →
Rohan Paul @rohanpaul_ai
Compiling in real-time, the race towards AGI. The Largest Show on X for AI. | 影响力: 0万粉丝
💡 核心观点: 中国开源AI推动行业增长,与闭源模型互补而非对抗。
可信度: 10/10 – 2项声明可直接验证;2项需进一步确认;1项为观点陈述
事实核查:
- ◦ 观点: 黄仁勋称中国开源模型(如DeepSeek/Kimi)不会对闭源模型(如Anthropic/OpenAI)构成对抗 (该声明基于黄仁勋对市场动态和用户行为的推测(如用户升级动机、服务需求差异),属于主观商业判断,无公开数据直接支持或反驳。)
- ◐ 部分可验证: 开源模型(如DeepSeek/Kimi)的普及会增加Nvidia的硬件销售和数据中心需求 (开源模型推动算力需求的理论逻辑合理,且Nvidia财报可间接反映AI行业需求增长,但具体因果关联需实测数据(如开源模型用户是否直接采购Nvidia硬件)进一步验证。)
- ✓ 可验证: 市场两次误解中国模型(DeepSeek和Kimi)的影响 (未定义“误解”的具体表现(如股价波动、舆论趋势),且缺乏第三方对市场反应的量化分析,无法客观验证。)
原文内容:
黄仁勋新访谈:他刚刚解释了为什么中国开源模型不会对闭源模型构成“对抗”,以及为什么 DeepSeek/Kimi 对整个 AI 行业有益。 Axios 提问:“这种中国竞争来得迅猛而激烈。美国 AI 公司该怎么办?” 黄仁勋:“这些中国模型非常出色。市场第一次误解了 DeepSeek 的影响,这次又误解了另一个中国模型 Kimi 的影响。 首先,优秀的开源 AI 模型对整个行业有益。当更多高质量 AI 变得可用时,即使是开源的,无论来自哪里,都会带来更多使用。 每当使用量增加时,Nvidia 就会卖出更多计算机。我们将不得不建造更多数据中心,提供更多服务,技术将扩散到更多行业。 DeepSeek 就是这样发生的,Kimi 也将如此。 还有一个误解,认为开源模型可能对闭源模型构成对抗。这也是错误的。 最有可能升级到 Anthropic 或 OpenAI 等公司优秀模型的人,是那些已经使用 AI 的人。他们可能希望更方便地使用它,访问 Anthropic 或 OpenAI 的额外服务,或者使用简单得多更好的模型,我预计他们会这样做。 因此,我们应该确保 AI 技术尽快扩散到各行业,并让尽可能多的人开始使用它。开源模型、极其廉价的模型,以及轻松尝试 AI 的方式,是我们能拥有的最佳事物。” ---- 来自 “Axios” YouTube 频道,(完整视频链接见评论)
⏰ 08:34 | ❤️ 24点赞 | 📝 385字 | 查看原文 →
Santiago Valdarrama @svpino
| 影响力: unknown万粉丝
💡 核心观点: 开放AI模型普惠大众,智能共享如互联网。
可信度: 5/10 – 2项需进一步确认;2项为观点陈述
事实核查:
- ◦ 观点: 最好的 AI 模型是开放的,并且对每个人都可用。 (这是作者对未来愿景的主观描述,没有具体事实或数据支持,属于个人观点或理想。)
- ◐ 部分可验证: AI 公司围绕这些模型构建产品和工具,但没有人拥有原始的智能本身。 (当前已有部分开源 AI 模型(如 Meta 的 LLaMA),但“没有人拥有原始的智能本身”涉及法律和所有权问题,需进一步验证现有 AI 模型的产权分配和开源协议。)
- ◐ 部分可验证: 这种模式有点像互联网。 (互联网的基础协议(如 TCP/IP)是开放的,但具体类比到 AI 模型的开放程度需进一步分析,不完全直接可比。)
原文内容:
我梦想着一个未来,在那个未来,最好的 AI 模型是开放的,并且对每个人都可用。 在那个未来,AI 公司围绕这些模型构建产品和工具,但没有人拥有原始的智能本身。 有点像互联网。 我不确定我们是否能到达那里。
⏰ 20:30 | ❤️ 77点赞 | 📝 83字 | 查看原文 →
Marc Lou @marclou
⭐️ TrustMRR.com $27K/m | DataFa.st $20K/m | SHlPORDIE.COM $20K/mo | 影响力: 170.0k万粉丝
💡 核心观点: 丁酸甘油三酯和巴氏杀菌阿克曼菌补充剂可改善肠道健康。
可信度: 8/10 – 1项声明可直接验证;3项需进一步确认;1项为观点陈述
事实核查:
- ◐ 部分可验证: 丁酸甘油三酯(300毫克)有助于滋养和保护肠道内壁 (现有研究支持丁酸对肠道健康的潜在益处(如抗炎、修复肠屏障),但具体剂量效果(300毫克)需依赖产品说明或临床试验,可能因个体差异而不同。)
- ◐ 部分可验证: 巴氏杀菌阿克曼菌(100亿TFU)支持更健康的肠道微生物群并可能改善代谢健康 (阿克曼菌的益生作用有部分研究支持(如调节代谢),但“巴氏杀菌”形式的功效、具体剂量(100亿TFU)及“改善代谢健康”的表述需参考厂商数据或独立研究,尚未形成广泛共识。)
- ◐ 部分可验证: 健康的微生物群对长寿至关重要 (肠道菌群与健康关联性有大量研究(如免疫、慢性病调控),但“对长寿至关重要”属概括性结论,需更多长期研究验证因果性。)
原文内容:
我刚刚将这个补充剂添加到我的健康组合中: 1. 丁酸甘油三酯 — 300 毫克 2. 巴氏杀菌阿克曼菌 — 100 亿 TFU 前者有助于滋养和保护你的肠道内壁,而后者支持更健康的肠道微生物群,并可能改善代谢健康。 健康的微生物群对长寿至关重要。这是来自 Blueprint(我认为)的全新必备补充剂,所以我很好奇。 而且这个药丸超酷 @bryan_johnson
⏰ 23:12 | ❤️ 103点赞 | 📝 119字 | 查看原文 →
Emily
Marc Lou
AshutoshShrivastava
Aakash Gupta
Amira Zairi
Charly Wargnier
Rohan Paul
Ethan Mollick
SemiAnalysis