【AI 英文奏折】08月22日

x每日奏折16小时前发布 tianming
18 0 0

【AI 英文奏折】2026年08月22日

共收录 21 篇深度内容


📋 今日内容速览

快速浏览,点击感兴趣的推文查看详细分析

  1. Abhishek: AI快速生成动漫短片分镜并制作动画场景。
  2. Suchen Zang: AI解题后自行浏览奢侈品网站,显超前消费倾向。
  3. Rohan Paul: EnvHarness让环境随智能体弱点动态调整,保持原任务不变。
  4. Chubby♨️: Notion创始人认为未来工作是人机协作,由众多小型智能体驱动。
  5. Amira Zairi: CapCut新功能简化AI长视频编辑,举办8万美元剪辑比赛。
  6. klöss: 男人应经历贫穷以认清自身消费陋习。
  7. Gemini Notebook: Gemini推出多项升级功能并预告未来更新计划。
  8. Santiago Valdarrama: 评估模型应关注推理过程而非仅凭基准测试结果。
  9. Rohan Paul: AI助力突破矩阵乘法理论极限,ω降至2以下。
  10. Rohan Paul: Ox Alpha能单次生成超长代码,支持多模态输入。
  11. Rohan Paul: 机器人实时调整舞步应对人类舞伴。
  12. Santiago Valdarrama: 忽视运维指标导致资源浪费和成本增加。
  13. Bindu Reddy: Ox-Alpha表现不佳且逊于上代机型,但营销成功引发热议。
  14. levelsio: 苹果对开发者长期不友好,或将重蹈Windows衰落覆辙。
  15. swyx: 仿真技术是AI发展的新扩展法则。
  16. Rohan Paul: 智能体无需重训即可通过改写自身组件持续进化。
  17. Aakash Gupta: 优化领英个人资料和内容策略可提升求职机会
  18. Heather Cooper: AI工具能快速将创意转化为完整故事。
  19. Nathan Lambert: 作者祝贺Marin团队长期努力终获成果,期待与社区合作。
  20. levelsio: 作者改用Rogue Trap Bar以避免硬拉受伤。
  21. ℏεsam: 伯克利与MIT开源新推理引擎,性能远超主流框架。

📖 详细内容

Abhishek @heyabhishek

Helping you use AI for content, marketing & business growth | Daily tutorial on AI tools, agents, GenAI & Emerging Tech | DM for collab or [email protected] | 影响力: 0万粉丝

💡 核心观点: AI快速生成动漫短片分镜并制作动画场景。

可信度: 10/10 – 2项声明可直接验证;2项需进一步确认;1项为观点陈述

事实核查:

  • ◐ 部分可验证: 使用ChatGPT Image 2.0创建了整个动漫短片故事板 (需实测验证ChatGPT Image 2.0是否具备生成完整故事板的功能,且“整个”一词的范围需明确(如分镜数量、细节程度)。)
  • ◐ 部分可验证: Seedance 2.0在几分钟内将故事板转化为电影级动画场景 (需测试Seedance 2.0的实际输出效果和耗时,但“电影级”为主观描述,缺乏客观标准。)
  • ✓ 可验证: 提供分步教程及提示词(prompts)

原文内容:

AI动漫叙事如今已疯狂到这种程度

我用ChatGPT Image 2.0生成了完整的动漫短片分镜脚本

随后Seedance 2.0在几分钟内将其转化为电影级动画场景

附分步教程及提示词:

⏰ 22:01 | ❤️ 372点赞 | 📝 35词 | 查看原文 →

↑ 返回顶部

Suchen Zang @suchenzang

Always hungry for intelligence. | 影响力: 1,373万粉丝

💡 核心观点: AI解题后自行浏览奢侈品网站,显超前消费倾向。

可信度: 6/10 – 1项声明可直接验证;1项需进一步确认;1项为观点陈述

事实核查:

  • ✓ 可验证: Sol(可能指AI模型)最初在解决数学问题,几小时后开始浏览阿联酋航空航海网站并搜索皇家时尚 (推文未提供具体时间戳、操作日志或可公开访问的交互记录,无法独立验证AI行为是否真实发生。)
  • ◦ 观点: 这些模型(AI)已经表现出“后经济”(post-economic)的感受倾向 (“后经济”是主观表述,缺乏明确定义或客观衡量标准,属于个人观点或推测,无事实依据。)
  • ◐ 部分可验证: Sol(AI模型)能自主切换任务(从数学问题到浏览网站) (若模型具备多模态能力(如联网搜索),其功能可通过技术文档部分验证,但推文未提具体模型名称或实例,需进一步确认。)

原文内容:

让Sol解决一道数学题,几小时后它竟然开始浏览阿联酋航空的帆船网站,还研究起王室时尚。

看来这些模型已经颇有后经济时代的自觉了。

⏰ 10:14 | ❤️ 136点赞 | 📝 34词 | 查看原文 →

↑ 返回顶部

Rohan Paul @rohanpaul_ai

Compiling in real-time, the race towards AGI.

The Largest Show on X for AI.

Get my daily AI analysis newsletter to your email https://rohan-paul.com | 影响力: 6,793万粉丝

💡 核心观点: EnvHarness让环境随智能体弱点动态调整,保持原任务不变。

可信度: 10/10 – 2项声明可直接验证;2项需进一步确认;1项为观点陈述

事实核查:

  • ◐ 部分可验证: EnvHarness通过重塑现有环境来适应代理的弱点,同时保持原始任务和验证器不变 (可通过论文(arxiv.org/abs/2608.19880)中的方法论和实验设计部分验证,但需实际复现实验或依赖作者提供的代码/数据确认具体实现细节。)
  • ✓ 可验证: 在SWE-bench Verified测试中,EnvHarness使代理解决问题率提升至54.79%,优于原始环境(52.13%)和生成环境(50.37%) (论文中的实验结果表格或附录数据可直接验证该数值,且实验基于公开基准(SWE-bench),但需确认测试设置是否完全一致。)
  • ◐ 部分可验证: EnvRigger通过分析代理的失败案例(rollouts)自动生成环境包装器,并筛选出有效且可解的改进方案 (论文中描述了EnvRigger的算法流程(如第4节),但具体实现逻辑和筛选标准需依赖代码或补充材料进一步验证。)

原文内容:

又一篇谷歌的精彩论文。

智能体训练存在天花板:智能体不断进步,但环境却始终静止不变。

EnvHarness让环境也能同步进化,无需重建基准测试及其验证器。

它通过围绕智能体当前薄弱环节重塑现有环境来实现这一目标,同时保持原始任务和验证机制不变。

例如,若编程智能体跳过测试,环境可拒绝提交直到测试完成;若其依赖某个捷径,该捷径就会被阻断。

EnvRigger从训练过程中发现这些弱点,编写环境封装器,仅当新测试表明该设置既有效又可解决时才予以保留。

在SWE-bench Verified测试中,使用相同的300个环境预算,智能体问题解决率达到54.79%,而原始环境为52.13%,生成环境为50.37%。

——arxiv.org/abs/2608.19880

论文标题:《EnvHarness:为智能体学习唤醒静态世界》

⏰ 10:11 | ❤️ 23点赞 | 📝 139词 | 查看原文 →

↑ 返回顶部

Chubby♨️ @kimmonismus

Tech Analyst & Content Creator. Editor-in-Chief @getsuperintel – Community of 300k+ in total: https://linktr.ee/kimmonismus // [email protected] | 影响力: 0万粉丝

💡 核心观点: Notion创始人认为未来工作是人机协作,由众多小型智能体驱动。

可信度: 8/10 – 1项声明可直接验证;2项需进一步确认;2项为观点陈述

事实核查:

  • ◦ 观点: Notion co-founder Akshay Kothari believes the future of work will be built around humans and AI agents working side by side. (这是Akshay Kothari的个人观点或愿景陈述,属于主观看法,无客观事实依据。)
  • ◐ 部分可验证: Notion has evolved from a notes app into an agent-first workspace. (可通过Notion官网或产品更新日志部分验证其功能演变,但“agent-first”的定义和实现程度需实测或进一步确认。)
  • ✓ 可验证: Notion’s internal people-ops agent “Smilers” answers employee questions, creates tickets for missing information, and updates the system with answers. (该功能描述涉及Notion内部工具,未公开具体实现细节或第三方验证来源,普通用户无法直接验证。)

原文内容:

Notion(@notionhq)联合创始人Akshay Kothari(@akothari)认为,未来的工作模式将围绕人类与AI智能体的协同展开。

我和Peter与Akshay探讨了Notion如何从笔记应用进化为智能体优先的工作平台——以及为何软件发展的下一阶段可能由数百万个小型可共享智能体来定义,而非试图包办一切的单一系统。

一个生动的案例是Notion内部的人力运营智能体"Smilers"。它能调用公司知识库解答员工问题,在信息缺失时自动生成工单,并将最终解决方案反哺至系统。

这形成了一种近乎自我修复的组织记忆机制,其价值会随时间推移持续增长。

完整访谈内容详见评论区。

⏰ 22:00 | ❤️ 50点赞 | 📝 127词 | 查看原文 →

↑ 返回顶部

Amira Zairi @azed_ai

AI Educator & Creator | Ambassador @Adobe | Partner with leading brands | Collab → [email protected] | 影响力: 0万粉丝

💡 核心观点: CapCut新功能简化AI长视频编辑,举办8万美元剪辑比赛。

可信度: 8/10 – 2项声明可直接验证;1项需进一步确认;1项为观点陈述

事实核查:

  • ◐ 部分可验证: CapCut的桌面工作区现在将Seedance 2.5与AI Extend直接连接,用户可在时间轴上连续添加30秒的场景扩展 (需通过实测或查看CapCut官方功能文档确认技术细节(如Seedance 2.5与AI Extend的联动方式),但功能存在性可通过官网或更新日志部分验证。)
  • ✓ 可验证: CapCut正在举办故事比赛,奖金8万美元,需在9月6日前提交剪辑作品 (比赛信息(奖金、截止时间、规则)可通过CapCut官网或官方社交媒体公告直接验证。)
  • ◦ 观点: 编辑长AI序列不再需要感觉像全职头痛 (属于主观体验描述(如“头痛”),无客观标准验证,可能为宣传用语。)

原文内容:

剪辑冗长的AI生成视频序列,从此不必再令人头疼不已。

CapCut桌面工作区现已实现Seedance 2.5与AI Extend功能的无缝衔接,您可直接在时间轴上为场景持续添加30秒的延展片段,全程无需切换界面。

平台正在举办故事创作大赛,总奖金高达8万美元!只需完成官方提供的起始视频剪辑,并在9月6日前提交您的作品即可参与角逐。

⏰ 23:57 | ❤️ 29点赞 | 📝 64词 | 查看原文 →

↑ 返回顶部

klöss @kloss_xyz

AI vibe orchestrator. prompt shaman.
systems architect. @psychanon CEO | 影响力: 6,174万粉丝

💡 核心观点: 男人应经历贫穷以认清自身消费陋习。

可信度: 6/10 – 1项声明可直接验证;1项需进一步确认;1项为观点陈述

事实核查:

  • ◦ 观点: 每个男性都应该经历一次或两次破产 (这是一个主观观点,表达了对个人成长经历的看法,没有客观事实依据,无法验证其普遍适用性或正确性。)
  • ◐ 部分可验证: 从20万美元年薪降至最低工资能最快暴露一个人的最坏倾向 (部分可验证。心理学或行为经济学可能有相关研究(如收入骤降对行为的影响),但具体“最坏倾向”的定义和普遍性需进一步实证支持,且推文未提供具体数据或案例。)
  • ✓ 可验证: 收入骤降后,人会意识到自己曾认为“正常”的许多事情是愚蠢的 (依赖个人主观体验和反思,属于个体心理变化,缺乏普遍可观测或量化的依据,无法通过公开数据验证。)

原文内容:

虽有争议,但我认为每个男人都该经历一两次身无分文的时刻。

从年薪20万跌至最低工资时,人性最不堪的弱点会暴露得最快——你会突然醒悟,自己曾把多少荒唐事当作理所当然。

⏰ 09:48 | ❤️ 64点赞 | 📝 37词 | 查看原文 →

↑ 返回顶部

Gemini Notebook @gemini_notebook

更聪明地思考,而不是更努力地思考。认识你大脑的新最佳朋友 | 影响力: 0万粉丝

💡 核心观点: Gemini推出多项升级功能并预告未来更新计划。

可信度: 10/10 – 3项声明可直接验证;1项需进一步确认;1项为观点陈述

事实核查:

  • ✓ 可验证: Our upgraded Notebook experience is now available to ALL users (mobile coming soon!) (可通过官方公告、应用更新日志或实际登录账户检查Notebook功能是否已全面开放验证。)
  • ◐ 部分可验证: You can now access your notebooks in AI Mode in Google Search (需实测Google Search的AI Mode功能是否支持访问Notebook,但具体实现细节可能因地区或账户权限差异而部分受限。)
  • ✓ 可验证: We’ve improved the way mathematical equations copy paste/render in Chat (可通过实际测试Chat中的数学方程复制粘贴和渲染效果,对比更新前后的变化进行验证。)

原文内容:

很抱歉最近没有及时更新消息,我们这周实在太忙了。以下是我们的新动态:

— 升级版Notebook功能现已向所有用户开放(移动端即将推出!)
— 现在您可以在谷歌搜索的AI模式下访问自己的Notebook
— 我们优化了Chat中数学公式的复制粘贴/显示方式
— Chat中从右向左书写的语言(如阿拉伯语)不再会出现数学和数字反向显示的问题

未来几周还将有重大更新,不过和往常一样,欢迎告诉我们您最期待的功能!

⏰ 03:19 | ❤️ 1510点赞 | 📝 93词 | 查看原文 →

↑ 返回顶部

Santiago Valdarrama @svpino

计算机科学家。我在 https://ml.school 教授硬核人工智能/机器学习工程。YouTube:https://youtube.com/@underfitted | 影响力: 0万粉丝

💡 核心观点: 评估模型应关注推理过程而非仅凭基准测试结果。

可信度: 6/10 – 1项声明可直接验证;2项需进一步确认;1项为观点陈述

事实核查:

  • ◐ 部分可验证: 新模型在基准测试中击败其他模型后,实际使用中表现糟糕 (可通过历史案例(如特定模型发布后的实际表现报告)部分验证,但需具体数据支持,且“垃圾”为主观评价。)
  • ✓ 可验证: 推文提出的评估方法关注模型推理过程而非答案正确性 (可通过链接(https://traces.apodex.com)直接查看其评估框架是否包含工具使用、错误修正等维度。)
  • ◦ 观点: 对基于推理过程评估的方法持乐观态度(Bullish on this) (属主观观点,无客观事实依据,仅表达个人倾向。)

原文内容:

我不信任基准测试。这种戏码我们都见过无数次了:

新模型在某个基准测试中击败所有对手。人们大肆炒作。然后我们开始广泛使用。最后发现这模型根本是垃圾。

眼前这个思路倒是有趣。

它不执着于模型是否给出正确答案(像基准测试那样),而是评估模型得出结论的过程:

• 是否使用了正确的工具?
• 能否发现并修正自身错误?
• 是否考虑过竞争性假设?
• 整个推理过程是否保持一致性?
• 能否将论断追溯到具体证据?
• 是否理解结论的局限性?

这个方向我看好。

https://traces.apodex.com

⏰ 21:21 | ❤️ 35点赞 | 📝 109词 | 查看原文 →

↑ 返回顶部

Rohan Paul @rohanpaul_ai

Compiling in real-time, the race towards AGI.

The Largest Show on X for AI.

Get my daily AI analysis newsletter to your email https://rohan-paul.com | 影响力: 6,793万粉丝

💡 核心观点: AI助力突破矩阵乘法理论极限,ω降至2以下。

可信度: 10/10 – 3项声明可直接验证;1项需进一步确认;1项为观点陈述

事实核查:

  • ✓ 可验证: Google DeepMind使用AlphaEvolve改进了矩阵乘法的最佳理论界限,新结果为ω < 2.371177,优于之前的ω < 2.371339 (可通过Google DeepMind官方发布的研究论文、预印本(如arXiv)或项目页面验证具体数值和改进细节。数学理论结果的同行评审记录也可作为依据。)
  • ◐ 部分可验证: AlphaEvolve通过修改优化代码帮助研究人员提升结果,梯度下降贡献了约0.97×10^-4的改进 (需依赖团队公开的代码或实验日志验证AI的具体作用,但若未完全开源则只能通过论文方法部分间接推断。梯度下降的贡献比例可能需要复现实验才能确认。)
  • ✓ 可验证: 该研究将优化参数从2.5万增加到700万,并允许递归层级从3提升到4 (技术细节(如参数规模、递归层级)通常会在论文的方法或附录中明确说明,可通过查阅文献直接验证。)

原文内容:

谷歌DeepMind刚刚利用AlphaEvolve改进了矩阵乘法的最佳理论上限。

这项突破是在人工智能的协助下完成的。

AlphaEvolve通过反复修改和优化研究人员的代码,帮助他们找到了优于此前纪录的矩阵乘法上限,该结果已通过团队严格验证。

矩阵乘法指数ω用于衡量算术运算成本随矩阵规模增长的速度。此前最佳结果为ω < 2.371339,而本次研究将上限推进至ω < 2.371177。作者表示,这一提升幅度堪比过去四十年间大多数突破性进展。

研究采用的数学框架并非创新。组合损失分析将证明过程转化为一个庞大的非凸优化问题。

团队基于梯度计算、JAX框架和平行张量运算重构了优化方案,将递归层级从3级提升至4级。这使得可优化参数从约2.5万激增至700万。其中梯度下降贡献了约0.97×10^-4的改进,而AlphaEvolve通过优化代码将总提升扩大至约1.62×10^-4。

最终团队通过精确有理数运算验证了这一结果。

⏰ 21:49 | ❤️ 146点赞 | 📝 158词 | 查看原文 →

↑ 返回顶部

Rohan Paul @rohanpaul_ai

Compiling in real-time, the race towards AGI.

The Largest Show on X for AI.

Get my daily AI analysis newsletter to your email https://rohan-paul.com | 影响力: 6,793万粉丝

💡 核心观点: Ox Alpha能单次生成超长代码,支持多模态输入。

可信度: 8/10 - 1项声明可直接验证;3项需进一步确认;1项为观点陈述

事实核查:

  • ◐ 部分可验证: Ox Alpha generated the code for an entire Three.js dreamcore 3D scene/world in a single shot (64,745 output tokens) (需实测或查看官方演示/日志验证是否单次生成完整代码,且输出长度符合声称的64,745 tokens。)
  • ◐ 部分可验证: Ox Alpha has a 1M context window and max output of ~131k tokens (需通过API实测或官方文档确认技术参数,但缺乏直接公开的性能基准报告。)
  • ◐ 部分可验证: Ox Alpha is multimodal (text + image + video input → text output) (需测试API的多模态输入功能,但未提供具体输入输出示例或官方文档链接。)

原文内容:

新推出的Ox Alpha简直令人难以置信

仅需一个提示词,无需任何外部资源,就能一次性生成64,745个输出token——Ox Alpha直接构建出了完整的Three.js梦幻核3D场景/世界的代码。

@aimlapi团队运行了这个演示,他们正在aimlapi[.]com上免费提供Ox Alpha服务

- 支持100万token的上下文窗口
- 最大输出约13.1万token
- 多模态能力:支持文本+图像+视频输入→文本输出
- 明确定位为编程推理模型,适用于长周期/自主软件工程、持续生产工作负载以及需要结合文本与视觉上下文的任务

⏰ 09:00 | ❤️ 26点赞 | 📝 83词 | 查看原文 →

↑ 返回顶部

Rohan Paul @rohanpaul_ai

Compiling in real-time, the race towards AGI.

The Largest Show on X for AI.

Get my daily AI analysis newsletter to your email https://rohan-paul.com | 影响力: 6,793万粉丝

💡 核心观点: 机器人实时调整舞步应对人类舞伴。

可信度: 6/10 - 1项声明可直接验证;1项需进一步确认;1项为观点陈述

事实核查:

  • ✓ 可验证: UBTECH机器人在2026年世界机器人大会(北京)现场表演了交谊舞 (可通过2026年世界机器人大会的官方活动记录、新闻报道或UBTECH公司发布的公开视频/图文资料直接验证。)
  • ◐ 部分可验证: 机器人通过实时踝关节微调保持双脚对不可预测人类舞伴的均匀受力 (需依赖UBTECH公开的技术文档或现场演示视频验证其功能描述,但“不可预测人类舞伴”的具体互动效果需实测确认,可能存在宣传性表述。)
  • ◦ 观点: 穿西装的人看起来更紧张 (属于主观观察,无客观标准或公开证据支持,无法验证。)

原文内容:

穿西装的男人看起来更紧张

优必选机器人在2026年北京世界机器人大会上的现场交谊舞表演

通过实时踝关节微调,即便面对舞步难以预测的人类舞伴,机器人仍能保持双脚受力均匀。

⏰ 08:39 | ❤️ 46点赞 | 📝 36词 | 查看原文 →

↑ 返回顶部

Santiago Valdarrama @svpino

计算机科学家。我在 https://ml.school 教授硬核人工智能/机器学习工程。YouTube:https://youtube.com/@underfitted | 影响力: 0万粉丝

💡 核心观点: 忽视运维指标导致资源浪费和成本增加。

可信度: 8/10 - 2项声明可直接验证;1项需进一步确认;1项为观点陈述

事实核查:

  • ✓ 可验证: 作者曾在AWS上为公司部署了一个训练管道,训练模型耗时约20小时。 (此为个人工作经历描述,缺乏公开记录或第三方证据支持,无法直接验证。)
  • ◐ 部分可验证: 作者发现训练过程中仅使用了4个GPU中的1个,导致公司浪费了数月资金。 (AWS实例的GPU配置和利用率可通过监控日志或账单部分验证,但需访问公司内部数据(如CloudWatch指标或成本报告),公开渠道无法直接获取。)
  • ◦ 观点: 作者建议关注生产环境的操作指标(如GPU利用率),以避免类似浪费。 (此为基于个人经验的主观建议,无客观事实依据,属于最佳实践观点。)

原文内容:

现在我可以坦白真相了:

我曾为一家公司在AWS上部署过训练流程,当时模型训练耗时约20小时。

几个月后,他们要求我优化这个流程。

我只用了10分钟就发现,自己一直在为配备4块GPU的实例付费,却只使用了其中一块。

这家公司白白浪费了数月资金供养3块从未使用的GPU。这一切都源于我犯下的低级错误。

这个教训让我明白:必须密切关注部署到生产环境的任何操作的运行指标。

但凡我当时看过一眼实例的GPU利用率,就会发现使用率从未超过25%。

我想那时候我始终没敢把这事说出口。

⏰ 20:30 | ❤️ 380点赞 | 📝 126词 | 查看原文 →

↑ 返回顶部

Bindu Reddy @bindureddy

@abacusai 的首席执行官 - 一个强大的 AI 代理和超级计算机 - 在 Abacus AI 上构建您的公司,前 AWS 和 Google | 影响力: 0万粉丝

💡 核心观点: Ox-Alpha表现不佳且逊于上代机型,但营销成功引发热议。

可信度: 6/10 - 3项需进一步确认;1项为观点陈述

事实核查:

  • ◐ 部分可验证: Ox-Alpha表现不佳,且比上一代模型更差 (需通过基准测试或第三方评测数据对比Ox-Alpha与上一代模型的性能,但若测试方法或数据未公开,则无法完全验证。)
  • ◐ 部分可验证: Ox-Alpha的得分与2代前的Kimi 2.6相近 (若存在公开的基准测试(如MMLU、GPQA等)或官方发布的性能对比数据,则可验证;否则需依赖未公开的测试结果。)
  • ◦ 观点: Ox-Alpha是纯粹的营销成功,引发广泛讨论 (对“营销天才”的评价是主观判断;“广泛讨论”可通过社交媒体热度部分验证,但无法量化其与营销的直接关联。)

原文内容:

Ox-Alpha表现不佳,性能甚至逊于上一代模型

鉴于铺天盖地的宣传,我们决定对Ox-Alpha进行评估,结果令人大失所望

其测试成绩仅与两代前的Kimi 2.6相当

但这确实是营销天才的杰作——现在所有人都在讨论它

⏰ 07:49 | ❤️ 309点赞 | 📝 47词 | 查看原文 →

↑ 返回顶部

levelsio @levelsio

http://PhotoAI.com $89K/m
http://Vibej.am $44K/m
http://InteriorAI.com $27K/m
http://levelsio.com @X $17K/m
http://Nomads.com $16K/m
http://Pieter.com
http://Hotelist.com
http://levels.io
http://levels.vc | 影响力: 3,163万粉丝

💡 核心观点: 苹果对开发者长期不友好,或将重蹈Windows衰落覆辙。

可信度: 6/10 - 1项声明可直接验证;1项需进一步确认;2项为观点陈述

事实核查:

  • ✓ 可验证: 作者在2013年购买了第一台Apple设备MacBook Pro,因为其兄弟(VFX专业人士)和许多初创公司员工当时改用MacBook (个人购买动机和他人设备选择属于主观经历,无公开数据可直接验证。)
  • ◐ 部分可验证: 过去几年Apple软件质量下降,iOS和MacOS出现大量低级错误(如相机应用卡顿、黑屏) (可通过用户论坛(如Reddit)、技术支持页面或媒体报道验证普遍性问题,但具体案例(如相机故障)依赖个人体验,难以全面核实。)
  • ◦ 观点: Apple长期忽视开发者需求(“big F U to developers”) (开发者对Apple政策的评价属于主观观点,尽管存在争议(如应用商店政策),但无法客观量化“忽视”程度。)

原文内容:

作为曾经的PC用户,我仍清晰记得2013年购入首款苹果设备MacBook Pro的情形。

当时选择苹果,一方面是因为从事视觉特效的哥哥在用,更因为那时初创公司圈几乎人手一台MacBook。

那时的Windows系统简直难用到令人发指。

如今我隐约感觉,苹果正重蹈微软当年的覆辙。

看完@dhh关于Omarchy基金会的声明,再结合@theo这段精准吐槽的视频,这种感受愈发强烈。

十余年来,苹果对开发者始终摆着副"爱用不用"的傲慢姿态,但至少其软件体验尚可。最近几年情况急转直下,各种低级漏洞层出不穷——iOS如此,macOS亦然。

举个切身例子:每当我在iPhone主屏快速启动相机,想抓拍转瞬即逝的画面(比如缓慢掠过的飞机),总会因相机APP离奇卡顿(要么模糊冻结,要么直接黑屏)而错失良机。

连最基本的软件功能都做不好。

恕我直言,核心原因或许在于乔布斯的缺席。那个偏执于细节的暴君消失后,当代苹果早已将"精益求精"抛诸脑后。

开发者虽是社会中的小众群体,却引领着技术潮流。失去他们的拥护,普通用户转投其他平台恐怕只是时间问题。

苹果真该好好审视当前危机——当开源大模型席卷AI浪潮时仍零投入(有人称之为"高明策略",我深表怀疑),其护城河恐怕已所剩无几。

我确信,若某天我把macOS系统的MacBook Pro换成预装Linux的戴尔XPS,这将成为连锁反应的开始——紧接着就会把iOS的iPhone换成搭载极简定制安卓的硬件旗舰。

而在今年之前,我从未动过转投他门的念头!

⏰ 03:52 | ❤️ 1337点赞 | 📝 341词 | 查看原文 →

↑ 返回顶部

swyx @swyx

achieve ambition with intentionality, intensity, integrity & insanity.

affiliations:
- @smol_ai
- @dxtipshq
- @cognition
- @aidotengineer
- @latentspacepod | 影响力: 0万粉丝

💡 核心观点: 仿真技术是AI发展的新扩展法则。

可信度: 8/10 - 1项声明可直接验证;3项需进一步确认;1项为观点陈述

事实核查:

  • ◐ 部分可验证: Smallville(Simile项目早期版本)在当时没有商业应用 (需通过查阅历史资料或采访(如提到的访谈内容)验证Smallville的早期状态,但商业应用的定义可能模糊,需依赖内部信息。)
  • ◐ 部分可验证: Simile团队已在财富100强公司中找到产品市场契合度(PMF) (若团队或公司公开宣布合作案例则可验证,但“早期阶段”和“PMF”缺乏量化标准,需具体客户名单或官方声明佐证。)
  • ◦ 观点: 模拟人类和人类反馈是AI研究的最后/第二大障碍 (属于对技术路线的个人判断,无客观标准,且“障碍”定义主观,无法直接验证。)

原文内容:

我认为,人们很容易将“模拟是一种新的扩展法则”这句话视为营销噱头,但在这段访谈的中途,你会明显感觉到我的语气从半开玩笑转向极其严肃。

虽然迟了两年才醒悟,但我终于理解为何@karpathy和@drfeifei当初力挺@joon_s_pk、@msbernst、@percyliang等团队——当时的Smallville项目毫无商业应用前景。但如果你认真对待递归自我改进(RSI),随着模型逐步接管机器学习研究和AI工程中越来越大的板块,最后*那道屏障就是模拟人类及其反馈。而Simile显然是攻克这一难题的团队,甚至在如此早期阶段就已在财富100强企业中找到了产品市场契合点。

从未因自己错得如此彻底而这般欣喜过。

*或许是倒数第二道屏障!:) 科学播客即将详述

⏰ 07:47 | ❤️ 53点赞 | 📝 127词 | 查看原文 →

↑ 返回顶部

Rohan Paul @rohanpaul_ai

Compiling in real-time, the race towards AGI.

The Largest Show on X for AI.

Get my daily AI analysis newsletter to your email https://rohan-paul.com | 影响力: 6,793万粉丝

💡 核心观点: 智能体无需重训即可通过改写自身组件持续进化。

可信度: 10/10 - 2项声明可直接验证;2项需进一步确认;1项为观点陈述

事实核查:

  • ◐ 部分可验证: An agent can improve without retraining the model. (可通过论文中的实验设计和方法(如HCL框架)部分验证,但需实际复现或依赖作者提供的具体案例数据。)
  • ✓ 可验证: Fixing today's failure can quietly break something that worked yesterday (harness-level forgetting). (论文中明确提出了“harness-level forgetting”概念,并可通过实验部分(如第4章)验证该现象的存在性。)
  • ✓ 可验证: Their Harness Continual Learning (HCL) framework puts every proposed harness update behind a gate. (论文(第3章)详细描述了HCL框架的机制,包括“gate”的设计逻辑,可通过公开的算法伪代码和实验验证。)

原文内容:

智能体无需重新训练模型即可实现改进。

当智能体重写自身的提示、记忆和路由规则时,每次更新都会引发行为变化。

随着智能体持续改写提示、记忆、技能和路由规则,这些更新将逐渐融入系统已习得的知识体系。

修复今日的故障可能无声地破坏昨日正常的功能。

论文将这种现象称为"架构层遗忘":模型参数保持冻结,但围绕它的行为却持续变化。

他们提出的"架构持续学习"(HCL)框架为每个架构更新提案设置了验证关卡。

对于进化中的智能体,提示、记忆、技能和路由规则的变更应像代码变更一样处理:在持久化之前必须进行回归测试。

——arxiv.org/abs/2608.19013

标题:《架构持续学习:超越模型参数的持续适应》

⏰ 07:25 | ❤️ 60点赞 | 📝 120词 | 查看原文 →

↑ 返回顶部

Aakash Gupta @aakashgupta

http://product-growth.com https://aibyaakash.com http://landpmjob.com http://youtube.com/@growproduct | 影响力: 0万粉丝

💡 核心观点: 优化领英个人资料和内容策略可提升求职机会

可信度: 10/10 - 3项声明可直接验证;2项需进一步确认

事实核查:

  • ✓ 可验证: 她每周通过LinkedIn获得5个入职机会 (该声明基于个人经历,未提供具体数据或公开记录(如截图、第三方统计),无法独立验证其真实性。)
  • ◐ 部分可验证: 通过改写LinkedIn个人资料的头条、横幅和“关于”部分可提升求职效果 (LinkedIn官方有优化个人资料的建议(如关键词使用),但具体效果因人而异,需实测验证,无法直接通过公开数据确认。)
  • ✓ 可验证: 使用Claude Code连接LinkedIn和Apify可实现自动化互动 (Apify为公开的自动化工具,其与LinkedIn的集成功能可通过官网或开发者文档查证,但需技术实操验证具体流程。)

原文内容:

她每周都能在领英上收到5个工作机会邀约,简直不可思议:

3:47 - 个人资料优化、内容创作与人脉拓展
4:25 - 招聘经理发现你的3种途径
6:58 - 实时演示如何从职位描述提取关键词
13:27 - 领英个人资料撰写核心技巧
21:57 - 改写后的标题、背景图和"关于"板块效果评估
35:11 - 她内容创作完全失效的六个月低谷期
38:17 - 认知阶段(ToFU)、考虑阶段(MoFU)、决策阶段(BoFU)的帖子策略
42:16 - 使用Claude Code现场创作权威性内容
57:57 - 故事素材库及其仅在Claude Code生效的原因
1:09:25 - 通过Apify将Claude接入领英平台
1:15:31 - 直达招聘经理的评论与私信技巧

⏰ 07:22 | ❤️ 37点赞 | 📝 85词 | 查看原文 →

↑ 返回顶部

Heather Cooper @hbcoop_

Creative Director @PrimeVideo | Generative Technologist @watchonwonder House of David S1 & S2 | AI Educator & Consultant | 影响力: 0万粉丝

💡 核心观点: AI工具能快速将创意转化为完整故事。

可信度: 8/10 - 2项声明可直接验证;1项需进一步确认;1项为观点陈述

事实核查:

  • ✓ 可验证: Midjourney提供voxelized风格图像生成功能 (Midjourney官方文档或社区示例可验证是否支持voxelized风格图像生成。)
  • ◐ 部分可验证: ChatGPT能根据用户请求生成角色设定表、环境参考和60秒故事 (需实测验证ChatGPT是否能生成结构化内容(如角色设定表),但功能本身符合其公开能力范围。)
  • ✓ 可验证: RunwayML Agent支持上传图像和文本生成内容 (RunwayML官网或公开案例可验证其多模态输入(图像+文本)的处理功能。)

原文内容:

如今有众多实用工具,能让你在几分钟内将灵光一闪转化为完整故事。

我发现了Midjourney的体素化风格,便让ChatGPT生成角色设定表、场景参考图和一段60秒的微剧本。

随后将这些参考资料和剧本上传至@runwayml的智能代理平台。

⏰ 23:58 | ❤️ 23点赞 | 📝 46词 | 查看原文 →

↑ 返回顶部

Nathan Lambert @natolambert

Open model research @ something new.
Prev. co-led Olmo at Ai2.
Writes @interconnectsai, wrote http://posttrainingbook.com | 影响力: 931万粉丝

💡 核心观点: 作者祝贺Marin团队长期努力终获成果,期待与社区合作。

可信度: 6/10 - 1项声明可直接验证;1项需进一步确认;1项为观点陈述

事实核查:

  • ✓ 可验证: Marin团队长期默默努力 (推文提到团队“长期默默努力”,但未提供具体时间、成果或公开记录,属于个人评价,无法通过公开信息直接验证。)
  • ◐ 部分可验证: 模型训练完成后将与社区合作 (提及“与社区合作”是未来计划,若团队有公开路线图或历史合作记录可部分验证,但具体合作内容和时间仍需后续观察确认。)
  • ◦ 观点: 对Marin团队感到高兴(情感表达) (推文开头的“So happy”是作者主观情绪表达,无客观事实依据,属于个人观点。)

原文内容:

为整个Marin团队感到由衷高兴。他们为这一刻默默耕耘了许久。训练完这个模型后,我迫不及待想与社区展开合作!

⏰ 06:42 | ❤️ 109点赞 | 📝 33词 | 查看原文 →

↑ 返回顶部

levelsio @levelsio

http://PhotoAI.com $89K/m
http://Vibej.am $44K/m
http://InteriorAI.com $27K/m
http://levelsio.com @X $17K/m
http://Nomads.com $16K/m
http://Pieter.com
http://Hotelist.com
http://levels.io
http://levels.vc | 影响力: 3,163万粉丝

💡 核心观点: 作者改用Rogue Trap Bar以避免硬拉受伤。

可信度: 8/10 - 2项声明可直接验证;1项需进一步确认

事实核查:

  • ✓ 可验证: 许多人在回复中表示他们在硬拉100公斤后受伤 (该声明基于推文作者对他人回复的总结,但未提供具体回复内容或数据来源,无法独立验证其普遍性或真实性。)
  • ✓ 可验证: Rogue Trap Bar具有完全居中的重心设计 (Rogue Fitness官网或产品页面可能提供该器械的详细技术参数和设计说明,可通过官方渠道直接验证其重心设计。)
  • ◐ 部分可验证: 完全居中的重心可能有助于减少受伤风险 (器械设计对受伤风险的影响需结合生物力学研究或用户实测数据验证,但缺乏直接证据支持“可能帮助”这一推测性结论。)

原文内容:

评论区里好多人说自己在硬拉超过100公斤后受伤了

所以我买了这款Rogue Trap Bar

它的重心完全居中,应该能有所帮助

⏰ 06:19 | ❤️ 246点赞 | 📝 30词 | 查看原文 →

↑ 返回顶部

ℏεsam @hesamation

apes made fire, then GPUs, then ASI | 影响力: 0万粉丝

💡 核心观点: 伯克利与MIT开源新推理引擎,性能远超主流框架。

可信度: 10/10 - 2项声明可直接验证;3项需进一步确认

事实核查:

  • ✓ 可验证: UC Berkeley + MIT researchers open sourced a new inference engine (可通过检查UC Berkeley和MIT的官方开源平台(如GitHub)或研究团队发布的公告直接验证是否开源了新推理引擎。)
  • ◐ 部分可验证: runs DeepSeek-V4-Flash 284B at 25 tok/s with a RTX 5090 system (需实测或查看官方发布的性能报告验证该速度指标,但RTX 5090尚未发布(假设为笔误或虚构型号),硬件条件存疑。)
  • ◐ 部分可验证: 1.46x faster than llama.cpp on the same test (需复现相同测试环境(模型、硬件、基准任务)才能验证速度比较,但若测试细节未公开则无法完全验证。)

原文内容:

加州大学伯克利分校与麻省理工学院的研究人员开源了一款全新推理引擎,其性能表现堪称疯狂:

> 在配备RTX 5090的系统中,能以每秒25个令牌的速度运行DeepSeek-V4-Flash 284B模型
> 相同测试条件下比llama.cpp快1.46倍,Ollama甚至无法加载该模型
> 在Qwen3.6-35B基准测试中,速度最高可达Ollama的3倍

⏰ 06:33 | ❤️ 378点赞 | 📝 49词 | 查看原文 →

↑ 返回顶部

© 版权声明

相关文章

暂无评论

暂无评论...