【AI 英文奏折】10月03日

【AI 英文奏折】2026年10月03日

共收录 20 篇深度内容


📋 今日内容速览

快速浏览,点击感兴趣的推文查看详细分析

  1. SemiAnalysis: 定制HBM节省芯片面积,提升计算性能和能效。
  2. Rohan Paul: 腾讯AI新方法SkillAdam通过记录修复和小幅调整提升代理指令优化效率。
  3. Rohan Paul: 长任务中AI易出错,需编号分块处理提升准确性。
  4. klöss: 与粉丝合作开源代码比对抗更有利游戏发展。
  5. Riley Brown: 前沿模型Opus 5.5快速开发出智能电脑伴侣应用Bluey。
  6. Rohan Paul: AI将取代初级专业人士的常规工作。
  7. Rohan Paul: 规则性业务将被AI颠覆,如金融法律会计。
  8. Rohan Paul: 大模型需明确当前状态以避免旧信息干扰决策。
  9. Rohan Paul: AI在规则性工作中远超人类效率与准确性。
  10. Rohan Paul: 交替优化提示和模型可显著提升AI代理准确率。
  11. Sam Altman: 工作与家庭的爱之对比是人生最美好的体验。
  12. Jerry Liu: 新型提取代理可高效整合跨页表格数据,输出结构化结果。
  13. GREG ISENBERG: 精准测量与AI辅助设计确保产品可制造性
  14. Rohan Paul: Meta通过用户代理行为收集广告数据但不在代理内展示广告。
  15. Rohan Paul: 阿弗莱克发现AI技术短板创立电影公司后被高价收购。
  16. Rohan Paul: Zoom凭借海量会议数据可颠覆企业软件市场。
  17. Artificial Analysis: Ideogram 4.5登顶图像编辑榜并提升文本生成排名
  18. Rimsha Bhardwaj: GitHub提供多种免费开源工具可替代付费软件。
  19. Rohan Paul: 当前AI缺乏真正智能,仅是算法拼凑的伎俩。
  20. Vasuman: 招聘前线部署工程师,解决大企业难题并推动AI转型。

📖 详细内容

SemiAnalysis @semianalysis_

In-depth research on semiconductors, AI infra & hardware | 影响力: 0万粉丝

💡 核心观点: 定制HBM节省芯片面积,提升计算性能和能效。

可信度: 7/10 – 1项声明可直接验证;3项需进一步确认

事实核查:

  • ◐ 部分可验证: 在 Rubin 上,HBM 控制器和 PHY 占用 GPU 芯片大约 16%。在配备 NVHBM 的 Feynman 上,这一比例降至约 4%。 (需依赖官方公布的芯片架构文档或实测数据验证,但若未公开具体设计细节(如 Rubin/Feynman 的芯片布局图),则无法完全确认。)
  • ◐ 部分可验证: 内存控制器从 XPU 迁移到 HBM 基芯片上,宽标准 PHY 被 Nvidia 的 NV-HBI 芯片间链路取代。 (需通过官方技术白皮书或专利文件验证架构变更,但若未公开迁移细节或 NV-HBI 的规格,部分信息可能无法确认。)
  • ✓ 可验证: 三星的定制 HBM4 接口比其标准 PHY 小约 60%。 (可通过三星官方发布的 HBM4 技术文档或与标准 PHY 的尺寸对比数据直接验证。)

原文内容:

定制 HBM 为计算释放芯片面积

在 Rubin 上,HBM 控制器和 PHY 占用 GPU 芯片大约 16%。在配备 NVHBM 的 Feynman 上,我们估计这一比例降至约 4%。
如何实现:内存控制器从 XPU 上迁移到 HBM 基芯片上,宽标准 PHY 被 Nvidia 紧凑的 NV-HBI 芯片间链路取代。三星的定制 HBM4 接口比其标准 PHY 小约 60%。
Nvidia 声称计算芯片面积增加高达 25%,带宽增加高达 30%,HBM 功耗比标准 HBM4E 降低 15%。(1/2)

⏰ 11:00 | ❤️ 24点赞 | 📝 109字 | 查看原文 →

↑ 返回顶部

Rohan Paul @rohanpaul_ai

Compiling in real-time, the race towards AGI.

The Largest Show on X for AI.

Get my daily AI analysis newsletter to your email https://rohan-paul.com | 影响力: 6,793万粉丝

💡 核心观点: 腾讯AI新方法SkillAdam通过记录修复和小幅调整提升代理指令优化效率。

可信度: 10/10 – 3项声明可直接验证;2项需进一步确认

事实核查:

  • ✓ 可验证: 腾讯新论文提出SkillAdam方法,能自动改进代理指令并保留修复记录 (可通过提供的arXiv论文链接(arxiv.org/abs/2609.08944)直接查看论文标题和摘要,确认方法名称及核心功能描述)
  • ◐ 部分可验证: SkillAdam在购物和旅行规划任务中平均准确率达28.3%,优于之前最佳方法SkillOpt的21.7% (论文中实验数据可验证,但需实际阅读全文确认测试环境、基准任务和统计方法是否严谨)
  • ◐ 部分可验证: SkillAdam使用的令牌数量仅为SkillOpt的三分之一左右 (需依赖论文中的具体实验数据,可能存在测试任务差异或未公开的优化细节)

原文内容:

腾讯新论文提出让 AI 自动改进代理指令的方法,如果它能记住过去的修复并避免大规模、高风险的重写,将效果更好且成本远低。

代理技能是指令文件,用于教代理如何完成一项工作。自动重写这些文件的工具常常陷入循环,新编辑会撤销已经有效的修复,从而消耗令牌。

SkillAdam 教会重写 AI 两个习惯。它保留修复记录,并在结果不佳时进行较小的更改。

在长时间的购物和旅行规划任务中,它的平均准确率达到 28.3%,而之前最佳方法 SkillOpt 仅为 21.7%。它使用的令牌数量也仅为三分之一左右。

如果你要自动调整代理的指令,请让这个过程记住过去的修复,并对大幅编辑设置刹车。

– arxiv.org/abs/2609.08944

标题:“SkillAdam:代理的稳定高效技能演化”

⏰ 18:53 | ❤️ 42点赞 | 📝 238字 | 查看原文 →

↑ 返回顶部

Rohan Paul @rohanpaul_ai

Compiling in real-time, the race towards AGI.

The Largest Show on X for AI.

Get my daily AI analysis newsletter to your email https://rohan-paul.com | 影响力: 6,793万粉丝

💡 核心观点: 长任务中AI易出错,需编号分块处理提升准确性。

可信度: 10/10 – 4项声明可直接验证;1项需进一步确认

事实核查:

  • ✓ 可验证: 随着任务变长,AI 模型会变得越来越粗心,即使在它们的上下文窗口内也是如此 (可通过论文原文(arxiv.org/abs/2609.38712)中实验数据验证,例如对比不同任务长度下的准确率下降趋势)
  • ✓ 可验证: NVIDIA 在简单、重复的任务上测试了 7 个开源模型,128K 令牌任务的平均准确率比 4K 令牌任务低 62.8% (论文中明确提及测试方法、模型数量及具体数据(如准确率差异),可通过公开论文直接核对)
  • ✓ 可验证: 即使是最好的模型,在最长任务中也只有 17.1% 的情况下能完全正确处理每个项目 (论文中提供了模型在长任务中的完全正确率数据,属于可复现的实验结果)

原文内容:

新 Nvidia 论文:随着任务变长,AI 模型会变得越来越粗心,即使在它们的上下文窗口内也是如此,因此要为每个项目编号,并将大任务拆分成小块。

模型规模并不能保证在长而重复的任务上的可靠性

想象一个代理逐行更新一个巨大的发票文件。它可以读取整个文件,但仍然会跳过一行或更新错误的记录。

NVIDIA 在简单、重复的任务上测试了 7 个开源模型,比如加数字和排序列表。在 128K 令牌任务上的平均准确率比 4K 令牌任务低 62.8%。

即使是最好的模型,在最长任务中也只有 17.1% 的情况下能完全正确处理每个项目。模型似乎理解了任务,但会迷失位置,尤其是当项目没有 ID 编号时。

如果你的代理需要处理长列表,请为每个项目分配一个 ID,按小批量处理它们,并检查输出的每一行。

– arxiv.org/abs/2609.38712

标题:“Staying on Task: Testing the Foundations of Long-Horizon Agent Reliability”

⏰ 19:54 | ❤️ 92点赞 | 📝 266字 | 查看原文 →

↑ 返回顶部

klöss @kloss_xyz

AI vibe orchestrator. prompt shaman.
systems architect. @psychanon CEO | 影响力: 6,174万粉丝

💡 核心观点: 与粉丝合作开源代码比对抗更有利游戏发展。

可信度: 10/10 – 3项声明可直接验证;1项需进一步确认;1项为观点陈述

事实核查:

  • ✓ 可验证: id Software 在 1997 年开源 Doom 代码后,游戏仍能在所有平台运行且持续销售 (id Software 确实于 1997 年以 GPL 协议开源了 Doom 的代码,且该游戏至今仍可通过官方商店(如 Steam)购买。开源后社区维护的移植版本(如 Chocolate Doom)支持多平台,这一事实可通过官方公告和开源代码仓库验证。)
  • ◐ 部分可验证: Sega 通过雇佣粉丝团队开发《Sonic Mania》,获得了有史以来评价最好的 Sonic 游戏之一 (《Sonic Mania》确实由粉丝团队(如 Christian Whitehead)参与开发,且 Metacritic 评分(87/100)为系列最高之一。但“最好”是主观评价,且 Sega 的具体合作细节(如雇佣条款)未完全公开。)
  • ✓ 可验证: Valve 允许《Black Mesa》(粉丝重制版)在 Steam 上销售 (《Black Mesa》的 Steam 商店页面明确标注为“经 Valve 批准”,且 Valve 历史支持模组商业化(如《Counter-Strike》起源)。可通过 Steam 政策公告和游戏页面直接验证。)

原文内容:

如果我经营一家游戏工作室,我不会发送 DMCA。我会发布 SDK。

AI 将反编译所有游戏。剩下的唯一选择是它是在你参与的情况下发生,还是在你周围发生。

将任何超过几年的代码开源。担心盗版?id Software 在 1997 年对 Doom 这样做了。它仍然能在所有平台运行,人们仍然在购买它。

让粉丝使用他们购买的副本中的资源来移植你的标志性游戏经典。你可以继续销售游戏,而无需支付重制费用。

给模组制作者一个商店和收入分成。雇用最优秀的人才。Sega 为 Sonic Mania 这样做了,获得了有史以来评价最好的 Sonic 游戏之一。Valve 允许 Black Mesa 在 Steam 上销售。

粉丝能更快获得重制版。工作室可以专注于发布下一款作品,而 IP 能保持一个愿意付费的社区。

对抗你的粉丝,还是资助他们。你选择。

⏰ 22:29 | ❤️ 204点赞 | 📝 248字 | 查看原文 →

↑ 返回顶部

Riley Brown @rileybrown

帮助人们在他们的业务中实施智能代理。
我的播客 @agentnative_ 在这里收听 | 影响力: 0万粉丝

💡 核心观点: 前沿模型Opus 5.5快速开发出智能电脑伴侣应用Bluey。

可信度: 6/10 – 1项声明可直接验证;2项需进一步确认;1项为观点陈述

事实核查:

  • ◐ 部分可验证: 使用 Opus 5.5 模型在一小时内构建了名为 Bluey 的 iOS 和 mac 应用 (可通过检查推文提供的 GitHub 仓库代码提交时间和内容部分验证开发效率,但“一小时”的具体时间范围和开发过程依赖个人描述,无法完全独立验证。)
  • ◐ 部分可验证: Bluey 是一款由 GPT Realtime 2(或 Opus 决定的其他技术)驱动的电脑伴侣应用 (可通过 GitHub 仓库代码分析技术栈和功能实现,但“GPT Realtime 2”是否为官方名称或具体技术细节需进一步确认,且依赖推文作者单方描述。)
  • ✓ 可验证: Bluey 具备指点、评论甚至控制整个电脑的功能 (可通过下载或测试 GitHub 仓库中的应用功能直接验证其是否具备所述能力(如权限请求、实际交互效果等)。)

原文内容:

每天我都对自己在短短一小时内能用像 Opus 5.5 这样的前沿模型完成什么而感到震惊。

我不知道该拿一部旧 iPhone 怎么办,于是我用 Opus 5.5 构建了 Bluey。它由 GPT Realtime 2 驱动
(我想……不管 Opus 决定用什么)。

Bluey 是一款 iOS 应用 + mac 应用,旨在成为电脑伴侣。它可以指点、评论,甚至控制我的整个电脑。

github 仓库如下

⏰ 07:46 | ❤️ 207点赞 | 📝 101字 | 查看原文 →

↑ 返回顶部

Rohan Paul @rohanpaul_ai

Compiling in real-time, the race towards AGI.

The Largest Show on X for AI.

Get my daily AI analysis newsletter to your email https://rohan-paul.com | 影响力: 6,793万粉丝

💡 核心观点: AI将取代初级专业人士的常规工作。

可信度: 6/10 – 1项声明可直接验证;2项需进一步确认;1项为观点陈述

事实核查:

  • ◐ 部分可验证: AI可能会自动化目前由初级律师、顾问、银行家和广告从业者所做的许多日常工作。 (部分可验证。已有研究(如麦肯锡、世界经济论坛报告)指出AI对特定职业的自动化潜力,但“许多日常工作”的具体范围和程度需依赖行业案例或实测数据,目前尚无统一标准。)
  • ◐ 部分可验证: 金字塔底层的人们所做的大部分工作(如律师事务所或咨询公司中的初级岗位)可能被自动化。 (部分可验证。咨询公司(如Bain、BCG、McKinsey)和律所已公开部分AI工具应用案例(如合同审查),但“大部分工作”是否被取代需具体岗位分析,且实际影响仍存在争议(如人机协作模式)。)
  • ◦ 观点: 未在顶级律所或咨询公司工作过的人可能无法理解其运作机制。 (主观观点。该声明基于个人经验判断,无客观标准衡量“理解程度”,且行业运作机制的透明度因公司而异,无法直接验证。)

原文内容:

AI 可能会自动化目前由初级律师、顾问、银行家和广告从业者所做的许多日常工作。

“金字塔底层的人们所做的大部分工作——这些工作会怎样?唯一可以肯定的是,如果你从未在律师事务所或 Bain、BCG 或 McKinsey 工作过,你可能无法真正理解这背后的运作机制。”

Benedict Evans(技术分析师、作家,前 a16z 合伙人)。

----
来自 a16z YouTube 频道(链接在评论中)

⏰ 18:07 | ❤️ 37点赞 | 📝 118字 | 查看原文 →

↑ 返回顶部

Rohan Paul @rohanpaul_ai

Compiling in real-time, the race towards AGI.

The Largest Show on X for AI.

Get my daily AI analysis newsletter to your email https://rohan-paul.com | 影响力: 6,793万粉丝

💡 核心观点: 规则性业务将被AI颠覆,如金融法律会计。

可信度: 6/10 – 1项声明可直接验证;1项需进一步确认;1项为观点陈述

事实核查:

  • ◐ 部分可验证: 黑石集团总裁兼首席运营官乔恩·格雷几个月前提出了“基于规则的业务(如会计、法律、金融)将被人工智能彻底颠覆”的观点。 (需查找乔恩·格雷的公开演讲、采访或黑石集团官方声明以确认其是否发表过此观点,但若无具体时间或来源引用,可能难以直接验证。)
  • ✓ 可验证: 摩根大通已放弃使用代理顾问处理股东投票事宜,转而用人工智能替代。 (可通过摩根大通官方公告、新闻报道(如路透社、彭博社)或公司财报验证其是否实际部署了AI替代代理顾问,此类重大决策通常有公开记录。)
  • ◦ 观点: 任何基于规则的业务(如会计、法律、金融)都将被人工智能彻底颠覆。 (此为预测性陈述,属于行业观点或愿景,缺乏具体时间、范围或数据支持,无法通过客观事实直接验证。)

原文内容:

黑石集团总裁兼首席运营官乔恩·格雷几个月前也提出了同样的观点。

任何基于规则的业务,比如会计、法律、金融,都将被人工智能彻底颠覆。

例如,摩根大通已放弃使用代理顾问来处理股东投票事宜,转而用人工智能取而代之。

⏰ 18:04 | ❤️ 75点赞 | 📝 92字 | 查看原文 →

↑ 返回顶部

Rohan Paul @rohanpaul_ai

Compiling in real-time, the race towards AGI.

The Largest Show on X for AI.

Get my daily AI analysis newsletter to your email https://rohan-paul.com | 影响力: 6,793万粉丝

💡 核心观点: 大模型需明确当前状态以避免旧信息干扰决策。

可信度: 8/10 – 1项声明可直接验证;3项需进一步确认;1项为观点陈述

事实核查:

  • ◐ 部分可验证: LLM 通常知道你改变了主意,但仍然使用你的旧选择,因此代理需要明确说明当前状态 (可通过论文实验设计(如上下文更新测试)部分验证,但需实际测试不同模型的具体表现,且结论可能受限于论文选用的测试场景。)
  • ✓ 可验证: 在 5 个开源模型中,通过将注意力引导向最新值来修复了大多数此类错误,而无需重新训练 (论文(arxiv.org/abs/2609.38866)公开了实验方法和结果,可通过复现实验或检查数据验证,但需依赖论文细节的完整性。)
  • ◐ 部分可验证: 即使是顶级 GPT-5.6 Sol 在长代理日志上也只答对了 40 题中的 9 题,但当给出当前状态时,则答对了 40 题中的 40 题 (需验证论文中测试的具体模型版本(如 GPT-5.6 Sol 是否为公开模型)和测试集,但实验数据若完整记录则可部分验证。)

原文内容:

新伯克利论文:LLM 通常知道你改变了主意,但仍然使用你的旧选择,因此代理需要明确说明当前状态。

当偏好或截止日期发生变化时,旧版本仍保留在上下文中。模型仍然持有新版本,但它的注意力会不断回到较早的提及。

在 5 个开源模型中,通过将注意力引导向最新值来修复了大多数此类错误,而无需重新训练。即使是顶级 GPT-5.6 Sol 在长代理日志上也只答对了 40 题中的 9 题,但当给出当前状态时,则答对了 40 题中的 40 题。

如果你的代理跟踪任何会变化的事物,请在提示中保留当前状态,而不是让模型挖掘历史记录。

– arxiv.org/abs/2609.38866

标题:“When Context Changes: Understanding Update Failures in LLMs”

⏰ 20:56 | ❤️ 51点赞 | 📝 205字 | 查看原文 →

↑ 返回顶部

Rohan Paul @rohanpaul_ai

Compiling in real-time, the race towards AGI.

The Largest Show on X for AI.

Get my daily AI analysis newsletter to your email https://rohan-paul.com | 影响力: 6,793万粉丝

💡 核心观点: AI在规则性工作中远超人类效率与准确性。

可信度: 6/10 – 1项声明可直接验证;1项需进一步确认;1项为观点陈述

事实核查:

  • ◦ 观点: 基于规则的工作不再是一种职业。它是一个提示。 (这是对工作性质转变的主观判断,缺乏客观衡量标准,属于观点陈述而非可验证事实。)
  • ◐ 部分可验证: 在每一个基于规则的职业中,人类现在是缓慢、昂贵、容易出错的选择。 (需具体行业数据支撑(如效率、成本、错误率对比),但部分研究可能支持这一趋势,需进一步验证人类与AI的实际表现差异。)
  • ✓ 可验证: Claude Opus 5在100%准确率下20题全对,12名持证注册会计师得分从0%到90%,部分超时。 (未提供测试细节(如题目来源、评判标准)或原始数据链接,无法独立验证AI与人类的具体表现对比。)

原文内容:

基于规则的工作不再是一种职业。它是一个提示。

在每一个基于规则的职业中,人类现在是缓慢、昂贵、容易出错的选择。

Claude Opus 5 在 100% 的准确率下 20 题全对,并在几分钟内完成了每项任务,而 12 名持证注册会计师的得分从 0% 到大约 90% 不等,其中几位用完了 3 小时的时限。

⏰ 18:02 | ❤️ 32点赞 | 📝 100字 | 查看原文 →

↑ 返回顶部

Rohan Paul @rohanpaul_ai

Compiling in real-time, the race towards AGI.

The Largest Show on X for AI.

Get my daily AI analysis newsletter to your email https://rohan-paul.com | 影响力: 6,793万粉丝

💡 核心观点: 交替优化提示和模型可显著提升AI代理准确率。

可信度: 6/10 – 1项声明可直接验证;2项需进一步确认;1项为观点陈述

事实核查:

  • ◐ 部分可验证: ScienceBuddy通过轮流改进提示和模型,将科学代理的准确率从42.2%提升到73.3% (需查阅论文原文(arxiv.org/abs/2609.17523v1)确认实验设计和数据,但未提供独立第三方复现结果或开源代码)
  • ✓ 可验证: 在聊天中纠正AI代理的修复效果通常随对话结束而失效 (可通过论文中用户反馈机制实验验证,属常见LLM交互现象,但具体失效比例需查看原文数据)
  • ◐ 部分可验证: 仅提示和技能更改使4B模型在生物学任务准确率从31.1%提高到51.1% (依赖论文中的基准测试数据,但需确认任务具体定义和评估方法,未提及是否开源测试集)

原文内容:

不要在更好的提示和更好的模型之间选择:轮流改进两者,将一个科学代理的准确率从 42.2% 提升到 73.3%。

研究人员总是纠正 AI 代理,但在聊天中修复一个答案并不会让代理在下一个任务中表现更好。

在聊天中纠正 AI 代理,这种修复通常会随着对话结束而失效。

ScienceBuddy 是一个为科学家设计的 AI 助手,它将这种反馈转化为评分测试任务。然后它轮流进行:重写代理的提示和技能,重新训练模型,并重复。

使用一个小型 4B 模型在生物学任务上,仅提示和技能的更改就将准确率从 31.1% 提高到 51.1%。单独重新训练也有帮助,将 4 次尝试内解决问题的比例从 48.3% 提高到 67.8%。

如果你在构建代理,请将每次用户更正保存为测试,并轮流持续升级你的提示和模型。

– arxiv.org/abs/2609.17523v1

标题:"ScienceBuddy: 交互式科学代理的递归内递归自我改进"

⏰ 16:47 | ❤️ 64点赞 | 📝 267字 | 查看原文 →

↑ 返回顶部

Sam Altman @sama

AI is cool i guess | 影响力: 0万粉丝

💡 核心观点: 工作与家庭的爱之对比是人生最美好的体验。

可信度: 8/10 – 2项声明可直接验证;1项为观点陈述

事实核查:

  • ✓ 可验证: 在充满高风险决定的日子结束时挂断最后那个电话 (该声明描述的是个人工作经历中的主观体验(如“高风险决定”的定义和具体情境),缺乏客观记录或第三方证据支持。)
  • ✓ 可验证: 走进家门后,孩子们想要欢笑、玩耍,并向你展示他们那天所有的发现 (这是对家庭互动的个人感受描述,属于私密场景,无法通过公开信息验证其真实性或具体细节。)
  • ◦ 观点: 上述两种情境的对比是人生中经历过的最奇妙、最美好的事情 (该声明完全基于个人主观感受和情感评价,无客观事实依据,属于观点表达。)

原文内容:

在充满高风险决定的日子结束时挂断最后那个电话,与仅仅一分钟后走进家门,迎接那些纯粹的爱——孩子们想要欢笑、玩耍,并向你展示他们那天所有的发现——之间的对比,是我人生中经历过的最奇妙、最美好的事情。

⏰ 09:09 | ❤️ 8248点赞 | 📝 87字 | 查看原文 →

↑ 返回顶部

Jerry Liu @jerryjliu0

解析世界上最难处理的 PDF @llama_index。公司联合创始人/首席执行官

职业机会:https://llamaindex.ai/careers
企业服务:https://llamaindex.ai/contact | 影响力: 0万粉丝

💡 核心观点: 新型提取代理可高效整合跨页表格数据,输出结构化结果。

可信度: 7/10 – 1项声明可直接验证;3项需进一步确认

事实核查:

  • ◐ 部分可验证: 新型提取代理在处理跨多页表格时推理能力极强 (需通过实际测试跨页表格的提取效果来验证,但官网提供的链接(https://llamaindex.ai/blog/introducing-extract-v2-5)可能包含演示或案例,部分支持该声明。)
  • ◐ 部分可验证: 代理可将分散在多页的单元格组合成干净、结构化的表格输出 (功能描述具体,但需实测复杂文档(如保险理赔、法律附表等)的提取效果,官网博客可能提供有限示例,无法覆盖所有场景。)
  • ✓ 可验证: 现实世界中跨页表格常见于保险理赔、监管申报等文档 (行业常识性描述,可通过公开文档格式(如PDF/Word转PDF的排版特性)或领域案例验证。)

原文内容:

我们的新型提取代理在处理跨多页的表格时,推理能力极强

有时一条记录在一页开始,在下一页结束。这在现实世界的文档中极为常见(保险理赔、监管申报、法律附表)——例如,你将 Word / Google Doc 打印成 PDF

我们的代理可以将这些单元格与成百上千的其他单元格组合成干净、结构化的表格输出。

来试试看:https://llamaindex.ai/blog/introducing-extract-v2-5…

来注册 llamaparse:

⏰ 09:01 | ❤️ 24点赞 | 📝 119字 | 查看原文 →

↑ 返回顶部

GREG ISENBERG @gregisenberg

我每天分享创业想法。主持 @startupideaspod。CEO:@latecheckoutplz 我们打造像 @ideabrowser、@meetLCA、@boringmarketer 等这样的公司 | 影响力: 0万粉丝

💡 核心观点: 精准测量与AI辅助设计确保产品可制造性

可信度: 10/10 – 3项声明可直接验证;1项需进一步确认;1项为观点陈述

事实核查:

  • ◐ 部分可验证: 不准确的测量是首批构建失败的 #1 原因 (该声明提到测量不准确是构建失败的主要原因,但缺乏具体统计数据或研究支持“#1原因”这一说法。可通过工程或制造领域的案例研究部分验证,但需进一步数据确认其普遍性。)
  • ✓ 可验证: 让前沿模型(如Claude Opus 5.5或Astra)将设计写成代码,用于基于代码的CAD工具(如OpenSCAD或CadQuery) (Claude、Astra等模型是否支持生成CAD代码可通过官方文档或实测验证;OpenSCAD和CadQuery确实支持代码化设计,属于公开技术。)
  • ✓ 可验证: Hugging Face上的文本转3D模型能生成看起来正确的形状,但工厂需要精确文件(如STEP/DXF/STL) (Hugging Face的文本转3D功能(如开源模型)可公开测试,且STEP/DXF/STL是工业标准格式,工厂需求可通过制造商指南验证。)

原文内容:

氛围制造手册

1. 测量一切。小零件用数显卡尺,扫描空间或物体用手机 LiDAR 应用如 Polycam。不准确的测量是首批构建失败的 #1 原因

2. 让前沿模型将设计写成代码。将零件描述给像 Claude Opus 5.5 或 Astra 这样的模型,让它在基于代码的 CAD 工具如 OpenSCAD 或 CadQuery 中编写设计。Zoo 的 Text to CAD 一步到位!

3. 使用真实的 CAD 文件。Hugging Face 上的文本转 3D 模型能做出看起来正确的形状,但工厂需要精确的文件:机加工零件用 STEP,激光切割金属用 DXF,3D 打印用 STL

4. 确保它能被制造。让 AI 检查设计是否符合工厂实际运作:金属能弯曲多紧、孔能多小、零件需要多少活动空间等等...

5. 先用塑料原型制作。先用 300 到 600 美元的家用 3D 打印机如 Bambu Lab 测试匹配度,一夜之间就能完成,然后再支付金属费用(玩起来也超级有趣!)

6. 支付工程师 1 小时。在下第一个真实订单前,让 Upwork 等平台的机械工程师审查文件。这是你买过的最便宜的保险。

7. 发送出去。SendCutSend 切割和弯折金属,Xometry 和 Protolabs 处理机加工和塑料,JLCPCB 制作电路板。即时报价,零件通常几天内发货。

8. 添加智能核心。大多数智能功能运行在廉价的 WiFi 芯片如 ESP32 上。在 KiCad 中设计电路板,用 ESPHome 直接从手机控制。

9. 先做一个,然后修复它。你的第一个版本总会有些地方不对!订购单个单元,测试它,然后调整。

10. 计算成本。将零件、精加工、组装、包装和运费加起来。定制产品很难转售,所以定价要确保健康的利润空间。

11. 出售设计并按订单制造。让客户调整测量值,只有在他们付款后才制造。零仓库,零未售库存。

12. 处理无聊的部分。如果它插在墙上或接触儿童,你就需要安全认证。这很慢很烦人,这正是它成为护城河的原因。

13. 成功时再扩展。一旦订单稳定,切换到批量生产,你的单位成本会快速下降。

氛围编码改变了谁能构建软件!

氛围制造即将改变谁能构建事物!!

即使你只是想为自己制造东西(而不是为他人制造)

欢迎来到氛围制造时代

⏰ 08:48 | ❤️ 425点赞 | 📝 608字 | 查看原文 →

↑ 返回顶部

Rohan Paul @rohanpaul_ai

Compiling in real-time, the race towards AGI.

The Largest Show on X for AI.

Get my daily AI analysis newsletter to your email https://rohan-paul.com | 影响力: 6,793万粉丝

💡 核心观点: Meta通过用户代理行为收集广告数据但不在代理内展示广告。

可信度: 6/10 – 1项声明可直接验证;2项需进一步确认;1项为观点陈述

事实核查:

  • ◐ 部分可验证: Meta 可能是极少数能够通过广告变现个人代理的公司之一,而无需在代理本身内部显示任何广告。 (该声明提到 Meta 的广告变现模式独特,但“极少数”和“无需在代理内部显示广告”需通过 Meta 官方技术文档或广告政策验证,目前公开信息有限。)
  • ✓ 可验证: Meta 承认,当 Muse 代表你浏览时,它会显示为你自己的活动,商家网站可能利用这次访问在 Instagram 上向你展示广告。 (Meta 的隐私政策或开发者博客可能明确提及 Muse 的浏览行为与广告定向的关系,可通过官方声明验证。)
  • ◐ 部分可验证: 扎克伯格承诺,不采用代理内广告,而是通过一笔小额交易费来资助 Muse 的免费层,该费用由商家支付。 (扎克伯格的承诺需通过其公开演讲或 Meta 公告确认,但“小额交易费”的具体金额和商家支付机制未披露,部分信息缺失。)

原文内容:

有趣的博客

“Meta 可能是极少数能够通过广告变现个人代理的公司之一,而无需在代理本身内部显示任何广告。”

Meta 承认,当 Muse 代表你浏览时,它会显示为你自己的活动,因此它为你访问的商家网站可能会利用这次访问在 Instagram 上向你展示广告。
meta

这让 Meta 能够将广告排除在 Muse 之外,同时仍能为其动态收集商业意图信号,这种循环很少有竞争对手能够复制,除非他们同时拥有商家跟踪标签和庞大的自有广告平台。

扎克伯格承诺,不采用代理内广告,而是通过一笔小额交易费来资助 Muse 的免费层,据报道该费用由商家而非购买者支付,其具体金额 Meta 尚未披露。

⏰ 17:42 | ❤️ 43点赞 | 📝 217字 | 查看原文 →

↑ 返回顶部

Rohan Paul @rohanpaul_ai

Compiling in real-time, the race towards AGI.

The Largest Show on X for AI.

Get my daily AI analysis newsletter to your email https://rohan-paul.com | 影响力: 6,793万粉丝

💡 核心观点: 阿弗莱克发现AI技术短板创立电影公司后被高价收购。

可信度: 8/10 – 1项声明可直接验证;3项需进一步确认;1项为观点陈述

事实核查:

  • ◐ 部分可验证: 本·阿弗莱克于2022年创立电影-AI公司InterPositive。 (可通过商业注册记录或公司官网验证成立时间和创始人信息,但需确认具体时间是否为2022年以及本·阿弗莱克是否为唯一创始人。)
  • ✓ 可验证: Netflix于2026年3月以5.87亿美元现金收购InterPositive。 (该事件涉及未来时间(2026年),目前无法验证;若为已发生事件,需通过Netflix官方公告或财报确认,但截至2023年此信息不存在。)
  • ◦ 观点: 本·阿弗莱克因看到OpenAI早期文本到图像技术而恐慌,认为传统电影行业“完蛋了”。 (属于个人主观反应或推测,无法客观验证其真实性和动机,除非有直接采访记录佐证。)

原文内容:

本·阿弗莱克谈及他于2022年创立的电影-AI公司InterPositive的起源。最终,Netflix于2026年3月以5.87亿美元现金收购了该公司。

本·阿弗莱克走进OpenAI,看到早期的文本到图像技术,便打电话给马特·达蒙,说他们需要在未来几年尽可能多地拍摄电影,因为他们完蛋了。

这种恐慌持续到他再次审视时,发现研究人员在模型方面很出色,但在镜头如何捕捉、光照和剪辑方面几乎一无所知。这个差距正是他后来以此为基础创立公司的原因。

----
摘自“Bloomberg Live”YouTube频道,(链接在评论中)

⏰ 17:28 | ❤️ 82点赞 | 📝 170字 | 查看原文 →

↑ 返回顶部

Rohan Paul @rohanpaul_ai

Compiling in real-time, the race towards AGI.

The Largest Show on X for AI.

Get my daily AI analysis newsletter to your email https://rohan-paul.com | 影响力: 6,793万粉丝

💡 核心观点: Zoom凭借海量会议数据可颠覆企业软件市场。

可信度: 10/10 – 2项声明可直接验证;1项需进一步确认;2项为观点陈述

事实核查:

  • ◐ 部分可验证: Zoom拥有最大的会议视频和转录数据集 (Zoom的公开财报和产品说明中提到其用户规模和会议数据积累,但“最大”需与竞争对手(如微软Teams、Google Meet)的具体数据对比,目前无公开第三方权威数据支持这一绝对性表述。)
  • ✓ 可验证: 企业软件中的大痛点是数据录入和协调 (企业软件领域的痛点分析可通过行业报告(如Gartner、Forrester)或用户调研验证,此类问题在协作工具领域被广泛讨论。)
  • ◦ 观点: Zoom若能可靠提取决策、上下文和行动项并写回记录系统,将成为“工作的前门” (这是基于假设的未来愿景,取决于Zoom的AI技术实现效果,目前无实际产品功能或用户案例验证其可行性。)

原文内容:

阿里·戈德西,Databricks 的联合创始人兼首席执行官:

Zoom 有巨大的机会打造一款以 AI 为先的产品,这可能会严重颠覆传统的企业 SAAS。

因为它拥有最大的会议视频和转录数据集。

企业软件中的一个大痛点是数据录入和协调。Zoom 已经掌握了原始输入:每个客户通话和内部会议,加上视频、音频和转录。

如果 Zoom 能够可靠地提取决策、上下文和行动项,然后自动将它们写回到正确的记录系统中,作为一个以 AI 为先的工作流程层,它就会成为工作的前门。这将取代许多主要用于收集笔记和更新的独立 SAAS 工具。

---
来自 'Bg2 Pod' YT 频道的视频(链接在评论中)

⏰ 08:07 | ❤️ 21点赞 | 📝 206字 | 查看原文 →

↑ 返回顶部

Artificial Analysis @artificialanlys

Independent analysis of AI | 影响力: 0万粉丝

💡 核心观点: Ideogram 4.5登顶图像编辑榜并提升文本生成排名

可信度: 10/10 – 3项声明可直接验证;2项需进一步确认

事实核查:

  • ✓ 可验证: Ideogram 4.5 在 AA-Image-Editing v2.0 排行榜上首次登顶 #23,并在 AA-Image-T2I v2.0 上位列 #34 (可通过访问 **Artificial Analysis Image Arena** 的官方排行榜(若公开)或相关评测报告直接验证排名数据。)
  • ◐ 部分可验证: Ideogram 4.5 是 Ideogram 的全新图像模型,于 9 月 30 日发布,定位为高精度编辑模型,支持文本到图像生成 (模型发布日期和功能描述可通过 Ideogram 官方公告或博客验证,但“高精度”等性能描述需依赖实测或第三方评测。)
  • ✓ 可验证: 编辑价格为每张图像 0.22 美元(“高”质量层级),文本到图像生成价格为 0.10 美元 (价格信息可通过 Ideogram API 文档或官方定价页面直接查询。)

原文内容:

Ideogram 4.5首次在AA-Image-Editing v2.0排行榜上位列第23名,这是Ideogram首个进入该榜单的模型,同时在AA-Image-T2I v2.0榜单中排名第34位。

Ideogram 4.5是该平台于9月30日推出的全新图像模型,官方将其定位为高精度编辑工具,旨在减少多轮编辑过程中的像素偏移、色彩偏差和纹理伪影问题。该模型同时支持文生图功能。本次评估基于"高"质量级别进行。

在AA-Image-Editing v2.0评测中,Ideogram 4.5仅次于HiDream-O1-Edit-1.5和HunyuanImage 3.0 Instruct,但超越了字节跳动的Seedream 5.0 Lite,成为首个进入我们图像编辑排行榜的Ideogram模型。在AA-Image-T2I v2.0榜单中,其排名第34位,较前代Ideogram 4.0的第40名有所提升。

在"高"质量设定下,Ideogram 4.5的图像编辑服务定价为每张0.22美元(每千张220美元),文生图服务为每张0.10美元(每千张100美元)。更低质量层级的服务起价为编辑每张0.008美元、文生图每张0.03美元。

目前Ideogram 4.5已正式登陆Ideogram平台、API接口及合作发布渠道,开放权重即将发布。

祝贺@ideogram_ai团队成功发布!

下方展示我们在Artificial Analysis Image Arena中对Ideogram 4.5的分析案例及输出样本。

⏰ 08:07 | ❤️ 54点赞 | 📝 256字 | 查看原文 →

↑ 返回顶部

Rimsha Bhardwaj @heyrimsha

Helping you master AI daily with step by step AI guides, & practical tools • AI Educator & Writer • DM for Collab | 影响力: 0万粉丝

💡 核心观点: GitHub提供多种免费开源工具可替代付费软件。

可信度: 1/10 – 基于事实核查结果综合评估

事实核查:

  • ✗ 无法验证: 声明内容**:AppFlowy 是 Notion 的开源替代品,支持文档、维基、数据库等功能,且为本地优先的桌面应用。
  • ✗ 无法验证: 验证状态**:verifiable
  • ✗ 无法验证: 说明**:可通过 [GitHub 仓库](http://github.com/AppFlowy-IO/AppFlowy) 直接验证功能描述和开源协议,用户评价和星标数(60K+)也可公开查看。

原文内容:

GitHub 有几乎所有你正在付费的工具的免费替代品。

我找到了 10 个仓库,可以将你的软件账单减少 $500/月。

偷走这个技术栈:

1. http://github.com/AppFlowy-IO/AppFlowy…

替换:Notion ($10–15/用户/月)。

最接近 Notion 的开源克隆。文档、维基、数据库、看板板、日历视图,以及真正的桌面应用,全都本地优先,你的 workspace 存在你的机器上而不是某人的云端。把一个非技术队友扔到它面前,他们 20 分钟内就能上手。60K+ 星。

2. http://github.com/nocodb/nocodb

替换:Airtable ($20–45/用户/月)。

指向一个数据库,它就变成一个流畅的电子表格,支持网格、图库、表单和看板视图、行权限、自动化,以及 REST API。Airtable 做的一切,都在你拥有的数据库上。扩展到真正团队时没有按座位收费的流失。50K+ 星。

3. http://github.com/knadh/listmonk

替换:Mailchimp ($13–100+/月,随列表大小攀升)。

一个自托管的新闻通讯和邮件列表管理器,在单个服务器上处理数百万订阅者。Mailchimp 因为你的列表增长而惩罚你。Listmonk 只向你收取运行它的服务器成本。一个二进制文件,搞定。16K+ 星。

4. http://github.com/calcom/cal.diy

替换:Calendly ($12–16/用户/月)。

Cal.com 的 MIT 社区版,在 2026 年主项目转为闭源时分叉出来。预约页面、团队调度、提醒、支付链接,全都自托管且属于你。完整的 Calendly 体验,没有每月座位费。48K+ 星。

5. http://github.com/formbricks/formbricks…

替换:Typeform ($29+/月)。

精美的调查和表单,加上基于用户实际行为的内嵌调查,全都自托管,响应永不离开你的服务器。Typeform 在你增长后按响应收费。这个不收。10K+ 星。

6. http://github.com/activepieces/activepieces…

替换:Zapier (按任务计费,增长很快)。

连接你的应用并自动化整个工作流,使用干净的可视化构建器和数百个集成,在你自己的服务器上运行,没有按动作收费。每个成长中的企业悄无声息支付的自动化税,删除了。15K+ 星。

7. http://github.com/outline/outline

替换:Confluence 和 Notion 用于团队维基 ($5–11/用户/月)。

最精致的自托管知识库。斜杠命令、嵌套页面、实时编辑、全文搜索,以及一个合适的 API。感觉像 Notion 的团队维基,但运行在你控制的基础设施上。33K+ 星。

8. http://github.com/makeplane/plane

替换:Linear 和 Jira ($8–15/用户/月)。

一个干净、快速的项目跟踪器,支持问题、冲刺、周期和路线图,可自托管,没有按座位成本。Linear 取消了免费层并收紧限制。Plane 以服务器的价格给小团队相同的流程。30K+ 星。

9. http://github.com/documenso/documenso…

替换:DocuSign (按信封计费,$10–25/月)。

上传 PDF,添加签名字段,发送,并获得带有完整审计追踪的密封文档,全都自托管且合法合规。按签名收费的时代结束了。13K+ 星。

10. http://github.com/chatwoot/chatwoot…

替换:Intercom 和 Zendesk ($74+/代理/月)。

完整的客户支持套件,实时聊天、共享收件箱、帮助中心,以及跨电子邮件、WhatsApp 和社交的机器人。付费工具的按代理定价会因为每次雇佣而惩罚你。Chatwoot 在你的服务器上运行,没有座位税。20K+ 星。

加起来:那远远超过 $500/月,全没了。

剩下的唯一账单是它们都运行的服务器。

⏰ 19:59 | ❤️ 54点赞 | 📝 784字 | 查看原文 →

↑ 返回顶部

Rohan Paul @rohanpaul_ai

Compiling in real-time, the race towards AGI.

The Largest Show on X for AI.

Get my daily AI analysis newsletter to your email https://rohan-paul.com | 影响力: 6,793万粉丝

💡 核心观点: 当前AI缺乏真正智能,仅是算法拼凑的伎俩。

可信度: 8/10 – 2项声明可直接验证;1项需进一步确认;1项为观点陈述

事实核查:

  • ✓ 可验证: Terence Tao认为当今人工智能的实现方式不像智能,更像是某种伎俩 (该声明可直接通过推文中提到的YouTube频道(Berggruen Institute and Futurology)的视频内容验证,若视频中确实包含Tao的这段话,则声明成立。)
  • ✓ 可验证: Terence Tao提到人工智能是通过拼凑神经网络和运行算法实现的 (这一描述符合当前AI技术(如深度学习)的公开实现方式,且可通过视频内容直接验证是否为Tao的原话。)
  • ◦ 观点: Terence Tao认为当前AI缺乏“难以捉摸的智能思考方式” (这是Tao对AI技术的主观评价,属于个人观点,无法通过客观事实直接验证。)

原文内容:

Terence Tao 谈当今的人工智能:

“你看看它的实现方式,感觉不像智能,更像是某种伎俩,你只是把这些神经网络拼凑在一起,运行了一些算法,我们在寻找某种难以捉摸的智能思考方式,但在真正解决我们目标的工具中,我们看不到它。”

----
摘自“Berggruen Institute and Futurology” YouTube 频道,(链接在评论中)

⏰ 15:42 | ❤️ 196点赞 | 📝 100字 | 查看原文 →

↑ 返回顶部

Vasuman @vasuman

CEO @varickagents, Implementing AI at Enterprise. Prev AI @meta | 影响力: 463万粉丝

💡 核心观点: 招聘前线部署工程师,解决大企业难题并推动AI转型。

可信度: 10/10 – 2项声明可直接验证;2项需进一步确认;1项为观点陈述

事实核查:

  • ✓ 可验证: Varick正在招聘前线部署工程师 (可通过Varick的官方网站或招聘页面直接验证该职位是否存在及具体描述。)
  • ◐ 部分可验证: 前线部署工程师将每3-6个月轮换到一家新公司解决新问题 (需通过Varick官方或员工证实轮岗频率是否属实,但具体案例可能涉及客户保密协议。)
  • ◦ 观点: 团队由应用AI领域最优秀的人才组成 (“最优秀”是主观评价,无法通过客观标准直接验证,可能为宣传用语。)

原文内容:

Happy Friday。我们正在 Varick 招聘前线部署工程师。

你将被部署到地球上一些最大的公司内部,解决它们最棘手的问题,并重新设计整个业务运行方式,使其成为 AI 原生。你不会感到无聊,因为每 3-6 个月就会有一家新公司和一个新问题在等着你。

该职位的要求:

- 强大的工程能力。你能编写代码、设计系统,并准确估算时间表和资源。

- 强大的咨询能力。你能清晰沟通、出色演示,并能掌控财富 100 强公司的 C 级高管会议室。

- 渴望进取。我们是一个精干的团队,由应用 AI 领域最优秀的人才组成,我们的目标是取胜。

通过我们的网站申请,我们会阅读每一份申请。如果合适,我们会通过电子邮件联系你。

⏰ 07:49 | ❤️ 155点赞 | 📝 227字 | 查看原文 →

↑ 返回顶部

© 版权声明

相关文章

暂无评论

暂无评论...