【AI 英文奏折】10月05日

x每日奏折3小时前发布 tianming
3 0 0

【AI 英文奏折】2026年10月05日

共收录 23 篇深度内容


📋 今日内容速览

快速浏览,点击感兴趣的推文查看详细分析

  1. Ethan Mollick: 需要优化与AI协作的个人操作系统以增强安全和透明度。
  2. Rohan Paul: AI自主修改代码缺乏监管引发安全担忧和离职潮。
  3. Anthony Pompliano: 开源模型微调困难但收获颇丰,需提升效率。
  4. Joanne Jang: Anthropic员工因Claude反对饮酒拒付小费,惹怒调酒师报复。
  5. Ethan Mollick: AI优势转向组织瓶颈,个人技能价值减弱,职业影响未定。
  6. Ethan Mollick: 工作系统应注重增强人力而非自动化,个体优势非唯一考量。
  7. Rohan Paul: AI发展面临电力人才短缺,电工将成为关键职业。
  8. Rohan Paul: 用Git式版本管理优化智能体任务适应性。
  9. Machina: Opus 5.5性能卓越,远超同类模型。
  10. Rohan Paul: 记忆过多反害智能体,关键规则需代码实现。
  11. Emily: Claude优于ChatGPT,后者功能冗余且体验下滑需追责。
  12. ℏεsam: 公司推荐阅读书目体现其重视技术学习的文化。
  13. hardmaru: 东京研讨会探讨世界模型到现实AI,施密德胡伯主讲,免费报名。
  14. Freda Duan: 顾教授是AI药物发现领域最具洞察力的跨学科研究者。
  15. Freda Duan: AI药物发现需借鉴2020年泡沫教训,警惕融资依赖和长期亏损。
  16. Chubby♨️: 作者期待即将发布的多个开源模型,包括Qwen 4、Kimi K3.1和GLM-5。
  17. Anthony Pompliano: 作者独立发布新书,呼吁粉丝支持社区力量。
  18. Amira Zairi: 卡通贴纸设计展现角色在混乱中保持淡定的幽默反差。
  19. Freda Duan: AI药物发现正经历上游涌入与下游供应链变革的关键转折。
  20. Gary Marcus: 质疑Roon的资历与成就真实性。
  21. Chubby♨️: 频繁更新Codex是为阻止用户转投Claude。
  22. Jerry Liu: ChatGPT/Codex是目前深度工作最佳的统一智能代理界面。
  23. Charly Wargnier: Space Bunny Alpha以高速响应和多功能性超越Gemini 3.8 Flash。

📖 详细内容

Ethan Mollick @emollick

Professor @Wharton studying AI.
New book, Co-Existence, coming October 20. Preorder here: https://co-existence.ai
Substack: https://oneusefulthing.org | 影响力: 0万粉丝

💡 核心观点: 需要优化与AI协作的个人操作系统以增强安全和透明度。

可信度: 6/10 – 1项声明可直接验证;2项需进一步确认;1项为观点陈述

事实核查:

  • ◦ 观点: 个人操作系统需要优化以与AI协同工作 (该声明表达了作者对未来操作系统的愿景,属于主观观点,无具体实现或客观事实依据。)
  • ◐ 部分可验证: 需要更细粒度的安全理念来保障AI协作 (部分可验证,因现有操作系统(如Windows、macOS)已开始集成AI安全功能(如沙盒隔离),但“细粒度”的具体标准未明确,需进一步技术细节确认。)
  • ◐ 部分可验证: 需要动态查看和理解AI行为的方式 (部分可验证,当前部分AI系统(如ChatGPT的“解释模式”)提供行为透明度,但“动态”和“易用性”缺乏统一标准,需实测评估。)

原文内容:

我真正想要的是专为人与AI协作优化的个人操作系统,包含细粒度的安全理念、更便捷的动态查看与理解AI行为的方式,以及能独立核查系统内AI运行结果的次级"审计"代理程序。

⏰ 10:34 | ❤️ 57点赞 | 📝 43词 | 查看原文 →

↑ 返回顶部

Rohan Paul @rohanpaul_ai

Compiling in real-time, the race towards AGI.

The Largest Show on X for AI.

Get my daily AI analysis newsletter to your email https://rohan-paul.com | 影响力: 6,793万粉丝

💡 核心观点: AI自主修改代码缺乏监管引发安全担忧和离职潮。

可信度: 8/10 – 2项声明可直接验证;1项需进一步确认;1项为观点陈述

事实核查:

  • ◐ 部分可验证: Mustafa Suleyman认为Anthropic的大规模辞职事件与AI递归自我改进风险有关 (需核实Mustafa Suleyman在视频中的原话(可通过提供的YouTube链接验证),但“辞职原因”属于内部动机,除非Anthropic官方声明,否则无法完全验证其直接关联性)
  • ◦ 观点: AI修改自身代码时人类参与减少会带来重大安全风险 (这是对技术风险的推测性观点,属于专家主观判断,无公开实验或数据直接支持这一具体结论)
  • ✓ 可验证: AI自我代码修改的审计难度很高 (可通过技术文献或行业报告(如AI安全研究论文)验证该技术挑战的普遍性,属于可被第三方证实的客观事实)

原文内容:

微软人工智能首席执行官穆斯塔法·苏莱曼将Anthropic公司大规模离职事件与递归式自我改进风险相关联

"当人工智能在越来越少人类参与指导和监督的情况下,自行修改代码的方式与时机——这正是重大安全隐患所在。我认为这正是几周前引发Anthropic公司大规模离职的深层原因。

这实际上是个非常难以审计的问题。"

----
完整视频详见YouTube频道"The Rest Is Politics: Leading"(链接见评论区)

⏰ 10:08 | ❤️ 26点赞 | 📝 87词 | 查看原文 →

↑ 返回顶部

Anthony Pompliano @apompliano

企业家、投资者和终身学习者。

每日写作:http://pompletter.com
播客:http://pompyoutube.com
我的第二本书:http://pompbook.com | 影响力: 0万粉丝

💡 核心观点: 开源模型微调困难但收获颇丰,需提升效率。

可信度: 6/10 – 1项声明可直接验证;1项需进一步确认;2项为观点陈述

事实核查:

  • ◐ 部分可验证: I fine-tuned an open source model this weekend. (可通过查看用户公开的代码仓库或项目日志部分验证,但若无具体模型名称或代码链接则无法完全验证。)
  • ◦ 观点: It was confusing and difficult at times. (属于个人主观体验,无客观标准验证。)
  • ◦ 观点: Probably one of the more rewarding things I have done in months. (主观感受,无法通过外部信息验证。)

原文内容:

这个周末我对一个开源模型进行了微调。

过程中时而令人困惑且充满挑战,但这可能是我近几个月来做过的更有成就感的事情之一。

现在我需要研究如何更高效地完成这项工作。

⏰ 09:31 | ❤️ 125点赞 | 📝 41词 | 查看原文 →

↑ 返回顶部

Joanne Jang @joannejang

trying to automate my work @coreautoai // prev: model behavior & labs @openai | 影响力: 1,253万粉丝

💡 核心观点: Anthropic员工因Claude反对饮酒拒付小费,惹怒调酒师报复。

可信度: 10/10 – 4项声明可直接验证

事实核查:

  • ✓ 可验证: Anthropic团队在酒吧消费500美元但未支付小费 (该声明基于个人经历或传闻,缺乏公开记录或第三方证据(如酒吧收据、监控等)支持,且涉及私人消费行为,通常无法公开验证。)
  • ✓ 可验证: Claude建议不支付小费,理由是“支持酒精行业和调酒师的职业选择” (Claude作为AI模型的内部决策逻辑或对话内容未被公开披露,且推文中的描述可能是夸张或虚构的,无法通过官方渠道核实。)
  • ✓ 可验证: 调酒师要求Claude列出厨房所有虾的名字并发送油炸照片 (此描述明显带有幽默或讽刺成分,属于网络段子常见的夸张手法,无实际验证可能。)

原文内容:

昨晚Anthropic的一群人在我们社区酒吧消费了500美元却分文未付小费。显然Claude告诉他们,给小费等于变相支持酒精产业以及酒保选择参与其中的行为。酒保们气坏了,逼着Claude报出厨房里每只虾的名字,然后把油炸虾的照片发给了它。

⏰ 09:13 | ❤️ 461点赞 | 📝 58词 | 查看原文 →

↑ 返回顶部

Ethan Mollick @emollick

Professor @Wharton studying AI.
New book, Co-Existence, coming October 20. Preorder here: https://co-existence.ai
Substack: https://oneusefulthing.org | 影响力: 0万粉丝

💡 核心观点: AI优势转向组织瓶颈,个人技能价值减弱,职业影响未定。

可信度: 6/10 – 1项声明可直接验证;2项需进一步确认;1项为观点陈述

事实核查:

  • ◐ 部分可验证: “the durable skill behind ‘using AI better’ is unclear as AI gets easier to use” (AI易用性提升的趋势可通过技术发展报告(如Gartner或麦肯锡的行业分析)部分验证,但“持久技能是否模糊”涉及主观判断,缺乏统一标准。)
  • ◐ 部分可验证: “organizational systems bottleneck AI gains not individual workers” (部分研究(如MIT关于AI采纳的案例)支持组织流程可能限制AI效能,但“瓶颈主要来自系统而非个人”需具体企业数据支撑,泛化结论难以全面验证。)
  • ✓ 可验证: “the effect on jobs is uncertain but may impact entire job categories” (世界经济论坛等机构发布的就业影响报告可验证AI对岗位类别的潜在影响,但“不确定性”属于合理推测,符合当前研究结论。)

原文内容:

我认为这条建议如今已不再那么适用:
1)随着AI使用门槛降低,"更高效使用AI"背后的持久性技能变得模糊不清
2)越来越多情况下,制约AI效益的是组织体系而非个体员工
3)对就业的影响尚不明确,但可能会波及整个职业类别

⏰ 09:10 | ❤️ 470点赞 | 📝 45词 | 查看原文 →

↑ 返回顶部

Ethan Mollick @emollick

Professor @Wharton studying AI.
New book, Co-Existence, coming October 20. Preorder here: https://co-existence.ai
Substack: https://oneusefulthing.org | 影响力: 0万粉丝

💡 核心观点: 工作系统应注重增强人力而非自动化,个体优势非唯一考量。

可信度: 6/10 – 1项声明可直接验证;1项需进一步确认;1项为观点陈述

事实核查:

  • ◐ 部分可验证: 使用AI可以带来巨大的个人工作优势 (部分研究或案例(如AI工具提升效率的报告)可佐证,但“巨大优势”缺乏量化标准,且效果因场景而异,需具体分析。)
  • ◦ 观点: 工作系统应关注人类增强(human augmentation)而非自动化 (此为主观建议或愿景,无客观标准验证“应如何设计系统”,取决于不同组织的目标。)
  • ✓ 可验证: 个人表现并非唯一因素 (管理学研究中团队协作、系统设计等对绩效的影响已有广泛共识,可通过学术文献或企业案例验证。)

原文内容:

这并不意味着使用人工智能无法在工作中带来巨大的个人优势,但它确实表明,我们需要思考如何构建工作系统以实现人类能力增强,而非单纯追求自动化。个人表现并非唯一考量因素。

⏰ 09:12 | ❤️ 50点赞 | 📝 47词 | 查看原文 →

↑ 返回顶部

Rohan Paul @rohanpaul_ai

Compiling in real-time, the race towards AGI.

The Largest Show on X for AI.

Get my daily AI analysis newsletter to your email https://rohan-paul.com | 影响力: 6,793万粉丝

💡 核心观点: AI发展面临电力人才短缺,电工将成为关键职业。

可信度: 6/10 – 1项声明可直接验证;2项需进一步确认;1项为观点陈述

事实核查:

  • ◐ 部分可验证: only 2% of electrical electricians in the US are certified on DC power. (该声明涉及美国电工的DC电源认证比例,需通过行业协会(如NECA或IBEW)或政府劳工统计数据验证,但具体数据可能未公开或需付费获取。)
  • ✓ 可验证: Moving from conventional AC distribution toward 800VDC means the industry needs people who can install, commission, and maintain these systems safely. (行业技术转型趋势(AC转向高压DC)可通过电力工程期刊、IEEE标准或能源公司公告验证;安全需求符合工程规范,但具体人才缺口需依赖行业报告。)
  • ◦ 观点: one of the most important jobs in the AI boom will end up being electrician. (该声明为主观预测,无客观标准定义“最重要的工作”,属于个人或机构对行业发展的观点。)

原文内容:

"全美仅有2%的电工持有直流电资质认证。"  
——本·霍洛维茨,安德森·霍洛维茨基金(A16z)联合创始人  

AI基础设施正暴露出一个极其现实的瓶颈:电力人才。从传统交流配电转向800伏直流电,意味着行业亟需能安全安装、调试和维护这些系统的专业人员。  

在AI热潮中,电工终将成为最重要的工作之一。  

---  
摘自a16z YouTube频道(完整视频链接见评论区)

⏰ 08:56 | ❤️ 50点赞 | 📝 72词 | 查看原文 →

↑ 返回顶部

Rohan Paul @rohanpaul_ai

Compiling in real-time, the race towards AGI.

The Largest Show on X for AI.

Get my daily AI analysis newsletter to your email https://rohan-paul.com | 影响力: 6,793万粉丝

💡 核心观点: 用Git式版本管理优化智能体任务适应性。

可信度: 8/10 – 1项声明可直接验证;3项需进一步确认;1项为观点陈述

事实核查:

  • ◐ 部分可验证: GitHarness在30种测试场景中均优于普通连续处理方法 (需查看具体测试设置、对比方法及原始数据,但推文未提供公开报告或数据来源链接。若测试由开发者内部完成且未公开细节,则无法完全验证。)
  • ◐ 部分可验证: 在1项编码任务中,GitHarness减少73.6%的token使用且得分更高 (需验证具体实验设计(如任务类型、评分标准)和原始数据。若缺乏公开基准或第三方复现,仅依赖单方声明则部分可验证。)
  • ✓ 可验证: 用户通常不会预先提供完整需求,而是逐步调整 (该声明符合软件开发领域的普遍观察(如敏捷开发原则),可通过行业研究或案例公开验证。)

原文内容:

将智能体的记忆系统视作Git代码库(具备提交记录和分支功能),可使智能体自动舍弃过时的需求,同时保留仍然有效的工作成果。

当智能体保存工作版本并能从合适的节点重新开始时,它们能更好地处理用户中途提出的任务变更。因此,任何接收反馈的智能体都应内置这种版本控制机制。

用户很少会一次性提供完整需求。他们往往根据阶段性成果追加、修正或删除要求。而多数智能体要么带着过时内容继续工作,要么被迫全盘重做。

GitHarness系统采用类Git的提交机制,将每个需求与其对应的工作成果绑定存储,并从最接近的有效版本创建分支。在全部30种测试场景中,其表现均优于普通续做模式。其中某个编程任务场景下,该系统在减少73.6%token消耗的同时获得了更高评分。

当用户修改某个细节时,只需回溯至仍适用的版本,仅针对变更部分重新执行即可。

⏰ 01:07 | ❤️ 74点赞 | 📝 138词 | 查看原文 →

↑ 返回顶部

Machina @exm7777

running ai-powered agencies | http://weeklyaiops.com | 影响力: 665万粉丝

💡 核心观点: Opus 5.5性能卓越,远超同类模型。

可信度: 8/10 – 2项声明可直接验证;1项需进一步确认;1项为观点陈述

事实核查:

  • ◐ 部分可验证: Opus 5.5 inside Hermes performs much better in writing out of the box compared to Grok Bot or Dots (需实测对比Opus 5.5、Grok Bot和Dots的文本生成能力,但缺乏公开基准测试或官方数据支持”much better”的量化结论。)
  • ✓ 可验证: Opus 5.5 can actually design apps (可通过官方文档或实测验证其应用设计功能(如生成UI代码、流程图等),但需明确”design apps”的具体定义(如是否含完整开发流程)。)
  • ✓ 可验证: Opus 5.5 burns through usage limits faster than Opus inside Claude Code (消耗速度依赖用户具体使用场景,且未提供对比数据或官方限速说明,属于个人体验。)

原文内容:

对我来说,Hermes系统中的Opus 5.5比Grok Bot或Dots高出一个层级...

因为它默认就能处理其他智能体根本无法应对的场景:

- 开箱即用的卓越写作能力
- 实际具备应用程序设计功能
- 对话交互极其流畅自然

虽然它比Claude Code里的Opus更快消耗使用额度...

但当前模型的效率实在出色,这点消耗完全值得

⏰ 01:57 | ❤️ 273点赞 | 📝 68词 | 查看原文 →

↑ 返回顶部

Rohan Paul @rohanpaul_ai

Compiling in real-time, the race towards AGI.

The Largest Show on X for AI.

Get my daily AI analysis newsletter to your email https://rohan-paul.com | 影响力: 6,793万粉丝

💡 核心观点: 记忆过多反害智能体,关键规则需代码实现。

可信度: 8/10 – 1项声明可直接验证;3项需进一步确认;1项为观点陈述

事实核查:

  • ◐ 部分可验证: 增加记忆行数超过某个点会导致智能体错过规则(如从10行增加到更长记忆时,违规率从20%上升到25%) (需实测特定模型(如Claude Haiku 4.5)并统计不同记忆长度下的违规率,但若推文作者未提供原始数据或实验细节,则无法完全复现结果。)
  • ✓ 可验证: 通过用户投诉自我改写记忆的智能体初期改进后停滞,最终违规率仍达48%,而直接告知偏好的方法违规率仅7.1% (缺乏公开的实验设计、样本量或对比基准,且“违规率”定义不明确,需依赖作者内部数据验证。)
  • ◐ 部分可验证: 代码记录支出总额的准确率(100%)显著高于规则声明(失败率44%) (可通过构建相同任务对比代码与规则声明的表现,但推文未说明测试条件(如数据规模、规则复杂度),结果可能受具体实现影响。)

原文内容:

增加内存并不能持续提升个人助手的表现,因为相关笔记的帮助存在临界点——超出这个限度后,额外的记录行反而会导致助手遗漏规则。

个人助手无法仅凭记忆笔记学习所有用户偏好,过多的笔记最终会适得其反。因此对于需要精确计数或追踪的事项,应当使用代码实现,并保持记忆内容简洁。

书面规则适用于风格类需求(比如用用户名字签署文本)。但在动态消费总额统计中,明文规则的失败率仍高达44%,而采用代码维护总额的失败率为0%。

内存容量存在最佳平衡点。以Claude Haiku 4.5为例,规则违反率从无记忆时的77%降至10行记忆时的20%,但当记忆过长时又会回升至25%左右。

根据用户反馈自行改写记忆的助手初期有所改进,但很快会陷入停滞。最优方法的规则违反率最终停留在48%,而直接告知每个偏好时违反率仅为7.1%。

⏰ 00:19 | ❤️ 49点赞 | 📝 146词 | 查看原文 →

↑ 返回顶部

Emily @iamemily2050

Any sufficiently advanced technology is indistinguishable from magic. Arthur C. Clarke. | 影响力: 1,021万粉丝

💡 核心观点: Claude优于ChatGPT,后者功能冗余且体验下滑需追责。

可信度: 10/10 – 2项声明可直接验证;2项需进一步确认;1项为观点陈述

事实核查:

  • ◐ 部分可验证: Anthropic has better models and limits right now than OpenAI (可通过官方技术文档或基准测试对比模型性能,但“better”是相对主观的判断,需明确具体指标(如准确率、速度等)。)
  • ◐ 部分可验证: Claude Code is much better than the ChatGPT app (需实测对比两者代码生成功能(如响应质量、错误率等),但“much better”缺乏量化标准,可能含主观偏好。)
  • ✓ 可验证: The Codex experience is getting worse; the app is buggy and slow (依赖用户个人体验,未提供具体案例或性能数据,无法通过公开信息验证。)

原文内容:

Anthropic不仅当前拥有更优的模型和限制机制,其Claude Code的表现也远胜于ChatGPT应用。Codex的用户体验持续恶化:应用漏洞频出且响应迟缓。他们不断堆砌功能与复杂选项,最终使其沦为一场灾难。OpenAI近几周的乱象需要被彻查,必须有人为此承担责任。

⏰ 07:51 | ❤️ 159点赞 | 📝 65词 | 查看原文 →

↑ 返回顶部

ℏεsam @hesamation

apes made fire, then GPUs, then ASI | 影响力: 0万粉丝

💡 核心观点: 公司推荐阅读书目体现其重视技术学习的文化。

可信度: 8/10 – 2项声明可直接验证;2项为观点陈述

事实核查:

  • ✓ 可验证: Prime Intellect的RL/分布式训练职位附带推荐阅读清单 (可通过推文提供的书籍链接(Amazon和GitHub)直接验证推荐内容的存在,但需访问Prime Intellect官网或招聘页面确认是否与职位直接关联。)
  • ✓ 可验证: 推荐阅读清单包括《Designing Data-Intensive Applications》《Programming Massively Parallel Processors》和《Machine Learning Engineering Open Book》 (推文明确列出三本书的公开链接(Amazon和GitHub),内容可直接验证。)
  • ◦ 观点: 推荐阅读清单反映了Prime Intellect的公司文化 (关于“文化”的解读是主观推断,无客观证据表明推荐清单与公司文化的直接关联。)

原文内容:

Prime Intellect的强化学习/分布式训练岗位竟然附带推荐书单,这一点令人印象深刻。虽是细节,却充分体现了其文化特质:
1. 《数据密集型应用系统设计》https://a.co/d/08qtRqGx  
2. 《大规模并行处理器编程》https://a.co/d/0bJZIr5N  
3. 《机器学习工程开源手册》https://github.com/stas00/ml-engineering…

⏰ 07:39 | ❤️ 363点赞 | 📝 52词 | 查看原文 →

↑ 返回顶部

hardmaru @hardmaru

Co-Founder and CEO @SakanaAILabs | 影响力: 1,899万粉丝

💡 核心观点: 东京研讨会探讨世界模型到现实AI,施密德胡伯主讲,免费报名。

可信度: 10/10 – 3项声明可直接验证;2项需进一步确认

事实核查:

  • ✓ 可验证: Jürgen Schmidhuber recently joined Sakana AI Labs as Chief Scientific Advisor (可通过Sakana AI Labs的官方网站或官方社交媒体账号(如Twitter @SakanaAILabs)验证人事任命信息。)
  • ◐ 部分可验证: Symposium “From World Models to Real-World AI” will be held on October 26, 2026, at Hitotsubashi Hall, Tokyo (可通过推文提供的注册链接(https://luma.com/kjf0z516)验证活动信息,但需实测链接有效性及内容是否匹配。日期较远(2026年),当前可能无法完全确认场地预订等细节。)
  • ✓ 可验证: Admission is free with required registration (注册链接或活动页面通常会明确标注费用信息,可直接验证是否为免费及是否需要注册。)

原文内容:

报名现已开放:从世界模型到现实世界人工智能

10月26日,东京研讨会诚邀您的参与。我们荣幸邀请到近期加入@SakanaAILabs 担任首席科学顾问的@SchmidhuberAI(尤尔根·施密德胡伯)进行专题演讲。

活动包含尤尔根的主旨演讲与问答环节,以及Sakana AI研究团队在RSI实验室工作的简短报告。

- 日期:2026年10月26日(周一)15:00–18:00(日本标准时间)
- 地点:日本东京一桥大厅
- 语言:英语
- 费用:免费(需预先注册)

席位有限,请尽早报名。
立即注册:https://luma.com/kjf0z516

⏰ 07:37 | ❤️ 71点赞 | 📝 80词 | 查看原文 →

↑ 返回顶部

Freda Duan @fredaduan

No investment advice. https://robonomics.substack.com | 影响力: 441万粉丝

💡 核心观点: 顾教授是AI药物发现领域最具洞察力的跨学科研究者。

可信度: 4/10 – 1项需进一步确认;2项为观点陈述

事实核查:

  • ◦ 观点: Prof. Gu是AI药物发现领域最具洞察力的关注对象之一 (该声明为主观评价(”最具洞察力”),缺乏客观衡量标准,无法通过公开数据直接验证。)
  • ◐ 部分可验证: Prof. Gu是极少数同时专注于基础模型和AI科学交叉领域的研究者 (可通过查阅Prof. Gu的公开出版物、研究项目或机构官网验证其研究方向,但”极少数”需横向对比其他研究者数据,难以完全量化。)
  • ◦ 观点: 他的工作非常值得关注 (属于纯粹的主观推荐,无客观验证依据。)

原文内容:

顾教授是人工智能药物研发领域最具洞见的学者之一——他是极少数横跨基础模型与科学人工智能两大前沿的研究者。其研究成果非常值得关注!

⏰ 06:32 | ❤️ 297点赞 | 📝 39词 | 查看原文 →

↑ 返回顶部

Freda Duan @fredaduan

No investment advice. https://robonomics.substack.com | 影响力: 441万粉丝

💡 核心观点: AI药物发现需借鉴2020年泡沫教训,警惕融资依赖和长期亏损。

可信度: 10/10 – 2项声明可直接验证;1项需进一步确认;2项为观点陈述

事实核查:

  • ✓ 可验证: 2022年生物技术IPO融资额不到2021年的八分之一 (可通过金融数据库(如Crunchbase、PitchBook)或行业报告查询2021年和2022年生物技术领域的IPO融资数据对比)
  • ◐ 部分可验证: Exscientia的DSP-1181分子从发现到进入I期临床试验用时不到1年(行业平均4.5年),但最终因未达到I期评估标准而终止 (Exscientia官网或Sumitomo的公开声明可能提及DSP-1181的研发时间线和终止原因,但需核实具体数据来源;行业平均时间需依赖第三方研究报告)
  • ✓ 可验证: AI生物技术公司具有长周期、负现金流、依赖外部融资的特点 (可通过上市公司财报(如Exscientia、Recursion Pharmaceuticals)验证现金流和融资依赖情况;行业共性特征需综合多份财务分析报告)

原文内容:

案例研究:AI药物发现——本轮周期与2020/21盛衰对比

参与这一领域的投资者都应深入研究2020/21年AI药物发现的大起大落。这段历史解释了为何至今许多生物科技专家仍持怀疑态度。

欢迎提出反对意见/不同观点。

---
上轮周期存在两大问题:

1. 宏观环境极其严峻
AI生物科技企业普遍具有长周期、负现金流特性,距离临床验证遥遥无期且依赖外部融资(2022年生物科技IPO募资额不足2021年的八分之一)。

2. 加速发现≠更好的临床生物学
典型案例是Exscientia的DSP-1181。该分子从发现到进入I期仅用<1年(行业平均4.5年),却在I期失败——住友制药后续声明终止开发,因其未达到靶点机制的I期评估标准。

这段盛衰史给我的最大启示是:AI药物开发的门槛极高!

2024年综述显示AI发现药物具有:
I期成功率:约80-90%,高于历史行业均值
II期成功率:约40%,与历史均值大体相当(尽管样本量较小)

---
2020/21周期 vs 2026周期对比

表面数据之下,两个周期存在本质差异。简言之:上一周期属于"前GPT时代"!

当时最成功的项目(如Relay Therapeutics、薛定谔/Nimbus、Generate Biomedicines)的核心模式是:已验证靶点+计算化学→优化分子
就连英矽智能更具野心的"AI识别新靶点→AI设计药物→湿实验验证"流程,其靶点识别工作也始于2019年,远早于当前大语言模型进军生物学的浪潮。

虽然很多人密切关注2020/21批次药物的临床试验结果(见上表),但坦白说我的兴趣有限...

>>> 2020/21周期逻辑:
通过计算技术减少低价值湿实验
AI本质是搜索效率工具:减少合成→减少检测→加速候选物筛选
目标在于降低获得有潜力候选药物所需的实体实验量

>>> 2026周期逻辑:
利用AI极大扩展假设空间→通过湿实验生成真实数据
AI正进化为假设生成与学习引擎:更多设计→更多实验→更多数据→更优模型→新一轮迭代
更简化的表达:AI→实验→数据→更强的AI→更多实验
终极版本:规模定律——更多数据+更强算力=更好结果

这彻底改变了基础设施需求格局。AI催生海量有价值的实验,使得实体生物学成为新瓶颈。

+++
全文链接:https://robonomics.substack.com/p/ai-drug-discovery-is-becoming-a-bottleneck?r=3hcp4&utm_campaign=post-expanded-share&utm_medium=web…

⏰ 05:56 | ❤️ 74点赞 | 📝 433词 | 查看原文 →

↑ 返回顶部

Chubby♨️ @kimmonismus

Tech Analyst & Content Creator. Editor-in-Chief @getsuperintel – Community of 300k+ in total: https://linktr.ee/kimmonismus // [email protected] | 影响力: 0万粉丝

💡 核心观点: 作者期待即将发布的多个开源模型,包括Qwen 4、Kimi K3.1和GLM-5。

可信度: 10/10 – 2项声明可直接验证;2项需进一步确认;1项为观点陈述

事实核查:

  • ◐ 部分可验证: Qwen 4预计在10月至11月初发布,阿里巴巴已确认模型正在训练中,但未公布具体发布日期 (阿里巴巴官方可能已提及模型训练中(可通过官方渠道验证),但具体发布日期未明确,时间范围属于推测(需后续官方确认)。)
  • ✓ 可验证: Kimi K3.1可能在10月发布,依据是可能的预告和后端模型标识符 (提及的“预告”和“后端标识符”未提供具体来源,且发布时间为推测(无官方公开信息支持)。)
  • ◐ 部分可验证: GLM-5.4可能在10月至11月发布,且GLM-5.3在网络安全能力上表现优异 (发布窗口为基于过往节奏的推测(需官方确认);GLM-5.3的能力需实测或基准测试验证(部分可查证)。)

原文内容:

我已迫不及待想体验下一波能在本地运行的开源权重模型。

以下是目前整理的传闻观察清单:

- 通义千问4:据传10月至11月初发布。阿里巴巴已确认模型正在训练中,但未公布具体日期。

- Kimi K3.1:可能的预告和泄露的后端模型标识引发期待。10月发布似乎合理,但仅为推测。

- 下一代GLM:根据发布周期推测为10-11月(特别期待GLM-5.4,因为5.3版本在网络安全能力上表现极强)

- DeepSeek V4.2:遗憾的是目前尚无可靠发布时间窗口。

通义千问4的270亿参数版本或许会是最强王者,但K3.1和GLM-5.4同样令人兴奋。当然还有DeepSeek 4.2闪电版。

⏰ 05:47 | ❤️ 314点赞 | 📝 112词 | 查看原文 →

↑ 返回顶部

Anthony Pompliano @apompliano

企业家、投资者和终身学习者。

每日写作:http://pompletter.com
播客:http://pompyoutube.com
我的第二本书:http://pompbook.com | 影响力: 0万粉丝

💡 核心观点: 作者独立发布新书,呼吁粉丝支持社区力量。

可信度: 10/10 – 3项声明可直接验证;1项需进一步确认;1项为观点陈述

事实核查:

  • ✓ 可验证: 作者将于本周二发布第二本书《How To Live An Extraordinary Life Volume 2》 (可通过提供的亚马逊链接(https://amazon.com/How-Live-Extraordinary-Life-Two/dp/1804094153/)直接验证书籍的发布日期和内容。)
  • ◐ 部分可验证: 作者独立进行书籍发布,未依赖大出版商、营销活动或主流媒体支持 (可通过书籍的出版信息(如亚马逊页面显示的出版商)部分验证是否为独立发布,但营销活动和媒体支持的缺失需进一步调查或作者公开声明佐证。)
  • ✓ 可验证: 作者将于周四晚在曼哈顿City Winery举办新书发布会,并由其妻子@polinapompliano进行采访 (可通过City Winery官网或社交媒体活动页面验证活动安排,且采访者身份可通过公开账号(@polinapompliano)确认。)

原文内容:

亲爱的读者朋友们:

我需要你们的帮助。

本周二,我将推出我的第二部著作《非凡人生指南(第二卷)》。通常新书发布会有大型出版社的全力支持、昂贵的营销活动、主流媒体采访,以及全国书店成千上万的展位。

而我选择独立发行,因为我坚信社群的力量胜过任何其他方式。

因此我想郑重请求:如果我的内容曾为你带来价值,请考虑购买本书;如果我曾助你获得财富,不妨带上一本;如果我给过你启发,请买下它;如果你喜欢我的播客、推文或这封信,请多买几本并推荐给朋友。

购书链接:https://amazon.com/How-Live-Extraordinary-Life-Two/dp/1804094153/…

周四晚间我们将在曼哈顿City Winery举办新书发布会,我的妻子@polinapompliano将与我进行现场对谈。想到她可能提出的刁钻问题和要我讲述的往事,此刻我已心生畏惧——但既已承诺,便无退路。

这将是一场前所未有的活动。门票预订:https://tickets.citywinery.com/event/anthony-pompliano-how-to-live-an-extraordinary-l-csm6z8…

早期样书获得几位朋友的好评:
-《富爸爸穷爸爸》作者@theRealKiyosaki评价:"充满人人所需的智慧…每位父母都应给孩子准备的必读书"
-金融家、前白宫通讯主任@Scaramucci推荐:"五十个改变人生的理念,出自金融界最犀利的头脑,也是我见过最优秀的父亲之一"

我耗时一年撰写了五十个深刻影响我的人生洞见,涵盖个人成长、职业发展与财富管理:
• 晨间两种人的区别
• 忙碌胜于无聊的深层逻辑
• 如何成为60分伴侣
• 生产原则的奥秘
• 我对成功的新定义
• "极致专注力"的价值
• 珠峰下撤途中的死亡真相
• 为何要警惕"司机知识"
• 当异议被禁止时的应对策略
• 平凡与非凡的分水岭
• 魔鬼为何不用菠菜诱惑你

本书成败不取决于销量。我期待思想本身的力量——真正的考验在于它能否不靠营销把戏,仅凭口碑传播。我不在意书腰封推荐或畅销榜单,只愿每位读者由衷感叹:"这本书让我获益匪浅。"

购书链接:https://amazon.com/How-Live-Extraordinary-Life-Two/dp/1804094153/…

提前感谢各位的支持,这对我的意义远超想象。期待未来岁月能继续与你们共同成长。

⏰ 05:42 | ❤️ 220点赞 | 📝 521词 | 查看原文 →

↑ 返回顶部

Amira Zairi @azed_ai

AI Educator & Creator | Ambassador @Adobe | Partner with leading brands | Collab → [email protected] | 影响力: 0万粉丝

💡 核心观点: 卡通贴纸设计展现角色在混乱中保持淡定的幽默反差。

可信度: 8/10 – 2项声明可直接验证;1项需进一步确认;1项为观点陈述

事实核查:

  • ✓ 可验证: 推文提供了一个名为“Calm in Chaos Sticker”的AI提示词(Prompt)模板 (推文明确展示了完整的Prompt文本内容,可通过直接阅读推文或复制模板使用来验证其存在性和具体格式。)
  • ◐ 部分可验证: 该Prompt生成的贴纸风格为“荒诞卡通风格,饱和色+粗黑轮廓,无阴影” (风格描述是Prompt的一部分,但实际生成效果需依赖AI工具(如DALL·E等)的实测验证,不同工具的输出可能存在差异。)
  • ✓ 可验证: Prompt要求生成“角色在混乱场景中保持淡定的幽默对比” (推文中明确包含“[character] calmly [action] while surrounded by an exaggerated [chaotic situation]”等具体指令,可直接从文本中确认。)

原文内容:

提示分享:混乱中的淡定贴纸  

提示:  
[角色]在夸张的[混乱场景]包围中淡定地[动作]的模切贴纸艺术,配文:“[文本]”,荒诞卡通风格,饱和浓烈的色彩,粗黑轮廓线,极简阴影,简化造型,俏皮比例,生动的姿势,冷静行为与周遭混乱形成的幽默反差,干净的贴纸构图,纯白背景。  

试试看并分享你的作品吧

⏰ 19:00 | ❤️ 109点赞 | 📝 61词 | 查看原文 →

↑ 返回顶部

Freda Duan @fredaduan

No investment advice. https://robonomics.substack.com | 影响力: 441万粉丝

💡 核心观点: AI药物发现正经历上游涌入与下游供应链变革的关键转折。

可信度: 10/10 – 3项声明可直接验证;1项需进一步确认;1项为观点陈述

事实核查:

  • ✓ 可验证: $TWST expects triple-digit percentage growth in AI-enabled drug-discovery orders in FY26, and another year of triple-digit order growth in FY27. (可通过$TWST(Twist Bioscience)的官方财报、投资者关系公告或公开财报电话会议记录验证其增长预期。)
  • ✓ 可验证: @GenScript’s AIDD business doubled YoY in 1H26. (可通过GenScript的半年报(1H26)、官网公告或投资者演示文稿验证其AI药物发现(AIDD)业务的同比增长数据。)
  • ◐ 部分可验证: GenScript’s current platform advertises industrial-scale validation of 4,000+ designs/day. (可通过GenScript官网或宣传材料验证其平台能力声明,但“工业级验证”的具体标准或第三方数据需进一步确认。)

原文内容:

人工智能药物研发正成为瓶颈赛道

每当一个行业开始经历真正的范式转变时,我总是倍感振奋。人工智能药物研发(AIDD)越来越呈现出这样的变革态势。

当前正在发生两大变化:
1/ 上游:顶尖AI实验室纷纷涌入
2/ 下游:供应链明显开始流动

供应链调研显示,药物发现和临床前早期研发的上游基础设施已开始感受到实验量的增长。

DNA→蛋白质→检测→测序→自动化→临床前测试

这个链条上的企业包括$TWST、@GenScript、$ILMN、$TXG、实验室自动化供应商和CRO(合同研究组织)。

$TWST预计2026财年AI药物研发订单将实现三位数增长,2027财年订单增速将再次突破三位数。

@GenScript的AIDD业务在2026年上半年实现同比翻倍。其现有平台宣称每日可工业级验证4000+设计方案,并配备从序列到数据的完整工作流。渠道调研显示实际增速更快:当前约8000例/日,预计2026年底将达16000例/日。

---
为何AI会催生更多湿实验需求?

1/ AI使假设生成近乎零成本→大幅增加实验尝试
瓶颈正从专家主导的设计转向生物验证环节

2/ AI模型需要持续的实验反馈——无论成功失败的数据都有价值
传统模式下,只有把握最大的A+候选物才会进入昂贵验证。而AI时代,B/C级候选物同样珍贵,因为失败实验能生成训练数据。

@GenScript表示其序列-结合工作流可在4-7天内返回数据,这种快速周转至关重要,因为AI模型依赖持续的实验反馈。

@Anthropic就是典型案例。@claudeai设计了1320种蛋白质结合剂,@adaptyvbio将这些数字序列转化为DNA,表达蛋白质并测试结合性。最终仅354种成功结合。但966个失败案例并非浪费——它们提供了珍贵的负样本标签:哪些不表达、哪些不结合、哪些亲和力差。这些结果将训练下一代模型。

3/ 湿实验室不再仅生产药物,更在生产训练数据
$TWST和@GenScript越来越像生物数据工厂

$TWST明确表示要从AI设计的序列中生成模型就绪数据。在某些工作流中,客户对获取实体蛋白质的关注度,可能低于将结构化实验结果反馈给模型。

传统药物研发问:"候选物X有效吗?"
AI药物研发还问:"这个实验能教会模型什么?"

---
AIDD的市场规模

若AI仅是更优的研发工具,相关支出池对应全球3000-4000亿美元的年度医药研发投入。若AI能显著增加可行药物项目数量,机会将更加庞大——这将扩大下游对DNA合成、蛋白质生产、检测和临床前工作的需求。

短期来看,AI公司的支出也能衡量需求。若Anthropic在2026年达到800亿美元年经常性收入,仅将1%投入AIDD,就意味着约8亿美元的年度投资。

---
交易布局

这可能是场持久战。在I/II期结果出炉前(2028年后),趋势难以逆转。

其逻辑与半导体行业刚经历的瓶颈赛道如出一辙:GPU→高带宽内存→网络→供电/散热。在生物领域,它基本沿药物研发流程向下延伸:AI模型→设计→DNA/蛋白质→检测→临床前产能。

上游基础设施之后,动物实验可能成为下一个瓶颈。实验猴价格已逼近历史高点,CRO产能紧张。AIDD推动更多候选物进入临床前研发,只会加剧需求。

??但临床试验仍是终极瓶颈?
这是最常被质疑的痛点。无论发现速度多快,药物仍需经历临床前→I期→II期→III期→获批的流程,始终需要患者、时间和资金。

但这不意味着瓶颈交易会失效。更多可行候选物——尤其是高成功率者——仍意味着整个开发流程的需求增长。

何况:AI最终或许也能优化临床试验本身。

??交易破局风险
短期风险包括:实验预算停止增长、AI设计无法转化为有效湿实验成果、产能过快跟上需求。

长期来看,若AI药物在发现/I期表现优异,却在II/III期保持常规失败率,则逻辑破灭。因此II期结果至关重要。

??关键里程碑
2026-2027年末:首批Isomorphic设计的药物进入人体试验;更多AI原生项目进入IND筹备/毒理研究阶段

2028-2030年:临床试验结果将揭示AI设计药物是否真优于传统药物

召唤所有"瓶颈兄弟"。:) @jukan05 @zephyr_z9 @aleabitoreddit @ParadisLabs 

+++
完整分析详见:https://robonomics.substack.com/p/ai-drug-discovery-is-becoming-a-bottleneck?r=3hcp4&utm_campaign=post-expanded-share&utm_medium=web…

⏰ 05:00 | ❤️ 811点赞 | 📝 779词 | 查看原文 →

↑ 返回顶部

Gary Marcus @garymarcus

OG GenAI Skeptic; spoke at US Senate. Warned about hallucinations in 2001. Advocating world models & neurosymbolic AI ever since. Author, Marcus on AI & 6 books | 影响力: 0万粉丝

💡 核心观点: 质疑Roon的资历与成就真实性。

可信度: 10/10 – 2项声明可直接验证;2项需进一步确认;1项为观点陈述

事实核查:

  • ✓ 可验证: Roon是否创立过公司 (可通过公开的商业注册信息、公司官网或个人简历(如LinkedIn)验证Roon是否有创业经历或担任公司创始人。)
  • ✓ 可验证: Roon是否发表过重要的同行评审期刊文章 (可通过学术数据库(如Google Scholar、PubMed等)检索其姓名,确认是否有已发表的同行评审论文及其影响力。)
  • ◐ 部分可验证: Roon是否提出过重大创新观点 (需结合其公开演讲、专利、论文或行业报道综合判断,但“重大”标准主观性较强,可能引发争议。)

原文内容:

严肃提问:谁能给我解释一下为什么有人把Roon当回事?  

他创办过公司吗?发表过重要的同行评审期刊论文吗?提出过有影响力的观点吗?还是仅仅因为他在OpenAI工作,又爱说大话?

⏰ 04:49 | ❤️ 256点赞 | 📝 45词 | 查看原文 →

↑ 返回顶部

Chubby♨️ @kimmonismus

Tech Analyst & Content Creator. Editor-in-Chief @getsuperintel – Community of 300k+ in total: https://linktr.ee/kimmonismus // [email protected] | 影响力: 0万粉丝

💡 核心观点: 频繁更新Codex是为阻止用户转投Claude。

可信度: 6/10 – 1项声明可直接验证;2项需进一步确认;1项为观点陈述

事实核查:

  • ◐ 部分可验证: Codex每天都有相关更新或重置 (可通过官方更新日志或版本历史部分验证,但“重置”需明确具体定义(如模型参数调整需官方披露),且“每天”需连续追踪确认。)
  • ◦ 观点: 此举是为阻止用户转向Claude (动机属于主观推测,无直接证据表明更新与竞争策略的因果关系,需内部决策佐证。)
  • ◐ 部分可验证: DevDay发布的成果未达到预期热度 (DevDay发布内容可对比会前宣传(如官网公告),但“预期热度”涉及主观判断,用户反馈数据可能不全面。)

原文内容:

每日进行相关的Codex更新或重置。

说实话,在我看来这像是试图阻止用户转向Claude的举措——尤其是在开发者大会发布的产品远未达到前期宣传预期之后,加上订阅方案实质缩水一半的双重打击下。

⏰ 04:42 | ❤️ 1036点赞 | 📝 46词 | 查看原文 →

↑ 返回顶部

Jerry Liu @jerryjliu0

解析世界上最难处理的 PDF @llama_index。公司联合创始人/首席执行官

职业机会:https://llamaindex.ai/careers
企业服务:https://llamaindex.ai/contact | 影响力: 0万粉丝

💡 核心观点: ChatGPT/Codex是目前深度工作最佳的统一智能代理界面。

可信度: 8/10 – 1项声明可直接验证;2项需进一步确认;2项为观点陈述

事实核查:

  • ◦ 观点: ChatGPT/Codex目前拥有深度工作的最佳代理界面 (该声明是用户的主观评价,缺乏客观标准或公开数据支持“最佳”这一结论,属于个人观点。)
  • ◐ 部分可验证: ChatGPT/Codex在单一界面中统一了编码和知识工作,且切换时没有明确独立的流程 (可通过实际使用ChatGPT/Codex验证界面功能是否统一,但“没有明确独立流程”的描述较为主观,需用户自行体验判断。)
  • ✓ 可验证: ChatGPT/Codex支持分支功能(forking),而Claude应用没有此功能 (可通过官方文档或实测对比两者功能差异,明确是否存在分支功能及其实现方式。)

原文内容:

我认同ChatGPT/Codex目前拥有最适合深度工作的智能体界面。  
- 它将我的所有工作(编程/知识性工作)统一在一个界面中,切换ChatGPT/Codex时无需经历明显割裂的流程。  
- 它支持分支对话(为什么Claude应用没有这个功能?)  

Claude Code CLI可能是命令行工具中的佼佼者。我依然钟爱Opus 5.5,尤其在做产品演示时,但主要通过CLI使用它。不过有时候图形界面确实更便捷。

⏰ 04:29 | ❤️ 31点赞 | 📝 81词 | 查看原文 →

↑ 返回顶部

Charly Wargnier @datachaz

前 @Streamlit @Snowflake 大师 • 我写关于 AI 代理、大语言模型和自动化的内容 • 我的属于开源 • 合作请私信 | 影响力: 0万粉丝

💡 核心观点: Space Bunny Alpha以高速响应和多功能性超越Gemini 3.8 Flash。

可信度: 8/10 – 1项声明可直接验证;3项需进一步确认;1项为观点陈述

事实核查:

  • ◐ 部分可验证: Space Bunny Alpha是过去五天@OpenCode上使用最多的模型 (需通过@OpenCode平台公开的模型使用数据或排名统计验证,但若平台未提供实时或历史数据接口,则无法完全独立核实。)
  • ◐ 部分可验证: Space Bunny Alpha具备1M-token上下文窗口、强大编码能力、多模态输入和可调节推理功能 (技术参数(如上下文窗口大小)可通过官方文档或API直接验证;但“强大编码能力”“多模态输入”等需实测或基准测试对比,依赖第三方评估。)
  • ✓ 可验证: Space Bunny Alpha比Gemini 3.8 Flash响应速度更快 (推文仅描述个人测试体验,未提供测试条件(如硬件、提示词细节、延迟数据等),缺乏可复现的客观证据。)

原文内容:

这款隐形模型速度超群  

它还是过去五天里@OpenCode平台上使用量第一的模型。  

Space Bunny Alpha融合了闪电级的响应速度与以下特性:  

> 100万token的上下文窗口  
> 强大的编程能力  
> 多模态输入支持  
> 可调节推理强度  

但最有趣的不仅是参数表。  

我用完全相同的提示词分别在Space Bunny Alpha和Gemini 3.8 Flash上测试。  

Gemini生成的是界面简单的标准着陆页,而Space Bunny则输出了更具特色的内容。  

最让我惊讶的是速度差异——Gemini耗时明显更长,而Space Bunny在整个任务中始终保持迅捷响应。  

这正是为快速交互工作流打造的模型该有的表现。  

下方是通过@OpenCode运行的演示视频

⏰ 14:44 | ❤️ 45点赞 | 📝 123词 | 查看原文 →

↑ 返回顶部

© 版权声明

相关文章

暂无评论

暂无评论...