【AI 英文奏折】2026年09月30日
共收录 20 篇深度内容
📋 今日内容速览
快速浏览,点击感兴趣的推文查看详细分析
- Santiago Valdarrama: 开源基准测试检验AI代理转换科学图表为PPT的准确性。
- klöss: OpenAI DevDay表现不佳且傲慢,产品更新未达预期。
- Artificial Analysis: AI性能显著提升但成本激增,智能指数翻倍价格涨百倍。
- Amira Zairi: Topaz Labs推出更快浏览器视频渲染升级技术。
- Nathan Lambert: 封闭与开放AI模型均存在安全隐患。
- Rohan Paul: AI代理活动激增将推动全球令牌需求40倍增长。
- Tivadar Danka: 数学应重几何直觉而非机械记忆。
- ChatGPT: 整合并分享个人作品与技能,便于团队发现和复用。
- Rohan Paul: AI市场规模2031年或达6万亿美元,需新增经济价值支撑。
- levelsio: 美国家庭社交活动锐减,孤独感加剧因双职工忙碌与休闲时间减少。
- Jerry Liu: GPT-6.1文档解析能力显著提升,但成本仍高于传统方案。
- Aakash Gupta: AI通过自我评估改进代码性能并修正自身错误。
- Vasuman: AI转型需定制服务而非工具,企业需专业实施者重构流程。
- Rohan Paul: Anthropic 420亿亏损中340亿为会计费用,实际运营亏损80亿。
- Machina: ChatGPT是大众唯一熟悉的AI,新产品需依托其普及度拓展用户。
- Emily: AI订阅费飙升,企业转向本地模型以控成本。
- Rohan Paul: 特朗普推动科技巨头签署AI安全自律协议。
- Artificial Analysis: 韩国AI行业领袖探讨人工智能未来发展与实际应用。
- klöss: OpenAI新品遭网友调侃缺乏新意。
- ℏεsam: 开源与前沿模型的现实威胁差距并不显著。
📖 详细内容
Santiago Valdarrama @svpino
计算机科学家。我在 https://ml.school 教授硬核人工智能/机器学习工程。YouTube:https://youtube.com/@underfitted | 影响力: 0万粉丝
💡 核心观点: 开源基准测试检验AI代理转换科学图表为PPT的准确性。
可信度: 6/10 – 1项声明可直接验证;2项需进一步确认;1项为观点陈述
事实核查:
- ✓ 可验证: 这是一个新的开源基准测试,用于检验 AI 代理是否能够将科学图表转化为可编辑的 PowerPoint 幻灯片。 (可通过检查开源代码库(如GitHub)或相关项目官网直接验证其存在性和功能描述。)
- ◐ 部分可验证: 目标是让代理保留图表的含义、布局和细节。 (需实测基准测试的具体评估指标或查阅文档,以确认其是否明确包含对含义、布局和细节的保留要求。)
- ◦ 观点: 如果代理改变了单个箭头的方向,最终的图表就会变得毫无用处。 (这是对图表细节重要性的主观判断,缺乏客观标准(例如“毫无用处”的定义),可能因使用场景而异。)
原文内容:
这是一个新的开源基准测试,用于检验 AI 代理是否能够将科学图表转化为可编辑的 PowerPoint 幻灯片。 目标是让代理保留图表的含义、布局和细节。 这可能很微妙,但至关重要: 如果你有一个代理改变了单个箭头的方向,最终的图表就会变得毫无用处。 这正是这个基准测试所检验的内容。
⏰ 23:05 | ❤️ 22点赞 | 📝 112字 | 查看原文 →
klöss @kloss_xyz
AI vibe orchestrator. prompt shaman.
systems architect. @psychanon CEO | 影响力: 6,174万粉丝
💡 核心观点: OpenAI DevDay表现不佳且傲慢,产品更新未达预期。
可信度: 8/10 – 1项声明可直接验证;2项需进一步确认;2项为观点陈述
事实核查:
- ✓ 可验证: GPT 6.1 SOL 比 Opus 5.5 还差 (未提供具体性能指标或测试数据,且“GPT 6.1 SOL”和“Opus 5.5”是否为官方命名或公开版本无法确认。)
- ◐ 部分可验证: dots 是他们对 Grok Bot 和 Muse 的竞争回应 (需核实“dots”是否为 OpenAI 官方功能,以及其与竞品(如 Grok Bot、Muse)的直接关联性,但缺乏公开对比证据。)
- ◐ 部分可验证: $200 计划不再是 20 倍,$500 计划现在是 25 倍 (需查阅 OpenAI 官网或订阅计划更新,确认具体倍数调整,但“倍数”所指的具体权益(如计算资源)需进一步明确。)
原文内容:
只是为了回顾一下 OpenAI 的 DevDay…… - GPT 6.1 SOL 比 Opus 5.5 还差 - dots 是他们对 Grok Bot 和 Muse 的竞争回应(看看它有多好,它搞砸了自己的演示) - 你的 $200 计划不再是 20 倍 - 一个 $500 计划现在是 25 倍 现在请告诉我,为什么 Tibo 连续几周都在大喊 DevDay OpenAI 那里正在进行疯狂的精神体操和傲慢,只是为了把今天称为胜利
⏰ 02:49 | ❤️ 3854点赞 | 📝 97字 | 查看原文 →
Artificial Analysis @artificialanlys
Independent analysis of AI | 影响力: 0万粉丝
💡 核心观点: AI性能显著提升但成本激增,智能指数翻倍价格涨百倍。
可信度: 6/10 – 1项声明可直接验证;2项需进一步确认
事实核查:
- ◐ 部分可验证: 人工智能分析智能指数与每任务成本帕累托前沿在过去 18 个月中发生了显著变化 (需查阅第三方研究机构或企业发布的智能指数报告及成本数据,但“显著变化”属于主观判断,需具体数据支持。)
- ◐ 部分可验证: 一年前得分最高的是 GPT-5 mini(高),在智能指数 v4.3 版本中得分 17,每任务约 0.05 美元 (若智能指数 v4.3 版本为公开标准,且 GPT-5 mini 的得分和成本数据曾被官方或权威机构发布,则可验证;否则需依赖未公开数据。)
- ✓ 可验证: 上周 Claude Opus 5.5 创下最高分 58,每任务约 5.98 美元 (需验证 Claude Opus 5.5 的官方性能报告或第三方评测数据,但“最高分”需确认是否涵盖所有已知模型,且成本可能因使用场景波动。)
原文内容:
人工智能分析智能指数与每任务成本帕累托前沿在过去 18 个月中发生了显著变化 仅在一年前,得分最高的是 GPT-5 mini(高),在智能指数 v4.3 版本中得分 17,每任务约 0.05 美元。上周,Claude Opus 5.5 创下了迄今为止的最高分 58,每任务约 5.98 美元。
⏰ 10:13 | ❤️ 373点赞 | 📝 81字 | 查看原文 →
Amira Zairi @azed_ai
AI Educator & Creator | Ambassador @Adobe | Partner with leading brands | Collab → [email protected] | 影响力: 0万粉丝
💡 核心观点: Topaz Labs推出更快浏览器视频渲染升级技术。
可信度: 10/10 – 2项声明可直接验证;3项需进一步确认
事实核查:
- ✓ 可验证: @topazlabs for Web 推出了 Speed Boost 和全新的 Starlight Fast 3 模型,直接在浏览器中实现更快的渲染 (可通过 Topaz Labs 官网或官方发布渠道(如博客、更新日志)直接验证新功能和模型的上线信息)
- ◐ 部分可验证: Starlight Precise 2.6 使用 Speed Boost 最高快 10 倍 (需实测或参考官方提供的性能基准测试数据,但“最高快 10 倍”可能依赖特定硬件或场景,需进一步确认条件限制)
- ◐ 部分可验证: Starlight Fast 3 在相同质量下比前代快 4 倍 (需对比官方发布的性能指标或用户实测数据,但“相同质量”需主观判断,可能缺乏统一标准)
原文内容:
影院级视频画质提升迎来速度飞跃! 网页版@topazlabs重磅推出Speed Boost加速技术与全新Starlight Fast 3模型,让浏览器内渲染效率突破新高 三大性能突破: • Starlight Precise 2.6:启用Speed Boost后提速高达10倍 • Starlight Fast 3:画质无损前提下实现4倍速处理 • Proteus引擎:5倍性能跃升,支持4K实时超分或更高速率 实测搭载Speed Boost的Starlight Precise 2.6处理个人素材,效果对比如下
⏰ 23:56 | ❤️ 44点赞 | 📝 91字 | 查看原文 →
Nathan Lambert @natolambert
Open model research @ something new.
Prev. co-led Olmo at Ai2.
Writes @interconnectsai, wrote http://posttrainingbook.com | 影响力: 931万粉丝
💡 核心观点: 封闭与开放AI模型均存在安全隐患。
可信度: 8/10 – 1项声明可直接验证;4项需进一步确认
事实核查:
- ◐ 部分可验证: Anthropic等美国前沿实验室未充分考虑其他AI安全方法和可能的发展路径 (需通过Anthropic公开的技术文档、安全政策或第三方分析报告间接验证其安全方法论是否单一,但推文中的“未充分考虑”属于主观判断,缺乏量化标准。)
- ◐ 部分可验证: 中国实验室Z ai(开发GLM系列)被暗示不关心安全且商业策略鲁莽 (Z ai(智谱AI)是否忽视安全需通过其模型发布的防护措施(如GLM-5.3的访问限制、安全声明)验证,但“鲁莽”属主观评价;商业策略需结合其公开市场行为分析。)
- ◐ 部分可验证: 封闭模型API和开放模型权重均易被滥用,且封闭模型的漏洞可能导致更大净伤害 (需对比历史案例(如封闭模型API滥用记录)和开放权重模型的滥用研究(如LLaMA漏洞利用),但“更大净伤害”依赖假设性推演,缺乏实证数据。)
原文内容:
唉。 我下面写了这篇帖子,但后来没发,因为我厌倦了总是从那些与Anthropic持有相同安全世界观的人那里得到的持续反对。我猜这意味着我应该发出去。来吧! 这篇帖子相当唯我独见,也没有恰当地将最近的网络风险事件纳入讨论。对我来说,看着像Anthropic这样的美国前沿实验室无法考虑其他安全方法和事情可能的发展方式,真是太难受了。 它暗示Z ai(中国实验室,构建GLM系列)并不真正关心安全,并且采取他们的商业策略是鲁莽的。 说像“鉴于这些证据,我们认为国家和非国家行为者很可能使用像GLM-5.3这样的模型造成现实世界的伤害。”和“这与其他任何类似能力的AI模型不同,所有那些模型都是通过安全措施或有限访问程序发布的。”这样的话,而封闭模型已被用于更多记录在案的网络攻击,这只是回避了有趣的问题。 一种合理的观点是,开放模型权重和封闭模型API(带有一些安全防护)两者都远更容易被滥用,而不是API模型更接近安全。“开放危险,封闭安全”的陈词滥调可能更接近“开放不安全,封闭不安全”。 封闭模型具有更强的能力和更强的防护措施,但更强的能力部分如果防护措施都有漏洞,在净伤害方面可能更重要。 与此同时,正如作者们承认的那样(谢谢——这是进步!),没有极端网络防护栏的开放模型对于快速在经济中扩散网络准备至关重要——因为像project glasswing这样的程序并不能完美地将所有关键行业纳入。 将来会有更多像Fable发布时亚马逊找到变通方法的情况,那让他们能够轻易通过API访问模型的全部能力。 这篇博客在其狭窄的论线上总体上是合理的,但它是一个非常有效的工具,在一个复杂、快速演变的媒体生态系统中强化某种类型的安全思维。
⏰ 06:09 | ❤️ 462点赞 | 📝 583字 | 查看原文 →
Rohan Paul @rohanpaul_ai
Compiling in real-time, the race towards AGI.
The Largest Show on X for AI.
Get my daily AI analysis newsletter to your email https://rohan-paul.com | 影响力: 6,793万粉丝
💡 核心观点: AI代理活动激增将推动全球令牌需求40倍增长。
可信度: 6/10 – 1项声明可直接验证;2项需进一步确认;1项为观点陈述
事实核查:
- ◐ 部分可验证: 每10秒,全球令牌需求在2026年约为317亿。到2030年,它将达到1.27万亿,增长40倍。 (该声明涉及具体数据预测,需通过高通官方报告、行业分析报告或路透社原始视频验证。但未来预测数据可能基于模型假设,实际准确性需持续观察。)
- ◦ 观点: 令牌爆炸与AI从人类节奏的交互转向代理节奏的活动有关。 (此声明为对技术趋势的解释,属于主观观点或行业推测,缺乏客观数据直接支持。需结合其他专家分析或白皮书交叉验证其合理性。)
- ◐ 部分可验证: 每一个有用的行动都隐藏着一笔账单:上下文必须被携带,记忆必须被更新,传感器可能需要被解释,并且错误必须在变得昂贵之前被捕捉。 (该描述涉及技术实现细节,可通过AI或令牌技术的学术论文、开发文档部分验证,但具体成本或流程可能因系统设计而异,无法完全通用化验证。)
原文内容:
“每10秒,全球令牌需求在2026年约为317亿。到2030年,它将达到1.27万亿,增长40倍。” ~ 高通CEO克里斯蒂亚诺·阿蒙: --- 令牌爆炸与AI从人类节奏的交互转向代理节奏的活动有关。 每一个有用的行动都隐藏着一笔账单:上下文必须被携带,记忆必须被更新,传感器可能需要被解释,并且错误必须在变得昂贵之前被捕捉。 ---- 来自“路透社”YouTube频道,(链接在评论中)
⏰ 17:43 | ❤️ 191点赞 | 📝 128字 | 查看原文 →
Tivadar Danka @tivadardanka
I make math and machine learning accessible to everyone. Mathematician with an INTJ personality. Chaotic good. | 影响力: 529万粉丝
💡 核心观点: 数学应重几何直觉而非机械记忆。
可信度: 6/10 – 1项声明可直接验证;2项需进一步确认;1项为观点陈述
事实核查:
- ◐ 部分可验证: 传统教育把数学当作机械的符号排列体操,强迫人们死记硬背公式,忽略底层空间直觉 (可通过教育研究文献或课程大纲部分验证传统数学教学方法的倾向,但“强迫死记硬背”和“完全忽略直觉”属于主观概括,缺乏普遍数据支持。)
- ◐ 部分可验证: 视觉为先的教学方法能有效建立几何直觉,再通过证明和定理巩固知识 (教育心理学研究支持视觉化学习对某些学生的有效性,但推文中的具体方法(如“先直觉后证明”)需实测验证效果,且效果可能因人而异。)
- ◦ 观点: 数学的难度源于教学方法而非概念本身 (属于主观观点,尽管可引用教育研究讨论教学方法的影响,但“难度根源”的结论缺乏普适性证据,且忽略个体差异等复杂因素。)
原文内容:
数学并不难,因为概念复杂。 它难是因为: 传统教育把它当作机械的符号排列体操,强迫人们多年来死记硬背公式,却完全忽略了底层的空间直觉。 从我开始在线上写作教你数学和机器学习开始,我就专注于以视觉为先的方法。 先建立几何直觉。然后用证明和定理来巩固你的知识。然后去构建一些有用的东西。 就是这样。
⏰ 20:33 | ❤️ 122点赞 | 📝 130字 | 查看原文 →
ChatGPT @chatgpt
ChatGPT 是为人民服务的。 | 影响力: 0万粉丝
💡 核心观点: 整合并分享个人作品与技能,便于团队发现和复用。
可信度: 10/10 – 2项声明可直接验证;2项需进一步确认;1项为观点陈述
事实核查:
- ✓ 可验证: 通过可分享的个人资料,可以将Sites和插件整合到一个地方,让其他人可以找到并重复使用。 (该功能是否真实存在可通过访问官方平台或查看官方文档直接验证,例如测试个人资料页的分享和整合功能。)
- ◐ 部分可验证: 团队成员可以发现你分享的技能——这些技能会保留在工作空间内。 (需实测团队协作功能或查看官方说明,但部分细节(如“技能”的具体定义)可能需进一步确认。)
- ✓ 可验证: 该功能适用于免费版、Go版、Plus版、Pro版和商业版用户。 (可通过官方订阅计划页面或帮助文档核对各版本的功能支持情况。)
原文内容:
你构建了它,现在展示并分享它吧。 通过可分享的个人资料,你可以将你的 Sites 和插件整合到一个地方,让其他人可以找到它们并重复使用。团队成员也可以发现你分享的技能——这些技能会保留在你的工作空间内。 适用于免费版、Go 版、Plus 版、Pro 版和商业版用户。即将推出至 ChatGPT 企业版、教育版和医疗版计划。
⏰ 08:22 | ❤️ 645点赞 | 📝 117字 | 查看原文 →
Rohan Paul @rohanpaul_ai
Compiling in real-time, the race towards AGI.
The Largest Show on X for AI.
Get my daily AI analysis newsletter to your email https://rohan-paul.com | 影响力: 6,793万粉丝
💡 核心观点: AI市场规模2031年或达6万亿美元,需新增经济价值支撑。
可信度: 6/10 – 1项声明可直接验证;2项需进一步确认;1项为观点陈述
事实核查:
- ◐ 部分可验证: 贝恩公司预测到2031年AI所需年收入为6万亿美元,是去年基准的三倍。 (可通过贝恩公司官网或公开报告验证预测数据,但需确认报告是否存在及具体内容。若报告未公开详细方法论或数据来源,则部分依赖假设。)
- ◐ 部分可验证: 到2031年AI基础设施支出预计每年达1.5万亿美元,资本支出占行业收入的25%。 (支出比例和预测数据可能基于行业模型或历史数据,但需核实贝恩报告的具体计算逻辑。若缺乏透明数据支撑,则为部分可验证。)
- ✓ 可验证: 消费者和企业AI市场规模为1.2万亿至1.8万亿美元,剩余4.2万亿美元需来自新经济价值来源。 (市场规模预测依赖假设和模型,未提供具体行业或技术路径的实证依据,且“新经济价值来源”为模糊概念,无法直接验证。)
原文内容:
贝恩公司发布了一份扎实的研究报告,现在将 AI 到 2031 年的所需年收入设定为 6 万亿美元,是去年基准的三倍。 它通过预测到 2031 年每年 AI 基础设施支出达 1.5 万亿美元,然后假设资本支出约占行业收入的 25%,得出了这一结论。 “消费者和企业 AI 市场总计可能达到 1.2 万亿至 1.8 万亿美元之间,这将留出约 4.2 万亿美元的新收入,以实现我们估计的 6 万亿美元市场规模,该规模对于资助建设是必要的。 这些收入必须来自新的经济价值来源。” 该报告还指出,可持续资助建设将需要“将年度全球 GDP 增长率提高约 1%”。
⏰ 16:44 | ❤️ 46点赞 | 📝 192字 | 查看原文 →
levelsio @levelsio
http://PhotoAI.com $89K/m
http://Vibej.am $44K/m
http://InteriorAI.com $27K/m
http://levelsio.com @X $17K/m
http://Nomads.com $16K/m
http://Pieter.com
http://Hotelist.com
http://levels.io
http://levels.vc | 影响力: 3,163万粉丝
💡 核心观点: 美国家庭社交活动锐减,孤独感加剧因双职工忙碌与休闲时间减少。
可信度: 10/10 – 2项声明可直接验证;2项需进一步确认;1项为观点陈述
事实核查:
- ◐ 部分可验证: 美国人每月至少在家招待朋友或家人的比例从1975年的42%下降到2026年的12%,大致下降了70%。 (该数据声称源自DDB Needham生活方式调查和Data For Progress的复制研究,但需查阅原始调查报告或学术文献(如罗伯特·帕特南的《独自打保龄》)以确认具体统计方法和时间跨度。2026年为未来年份,当前无法验证预测数据。)
- ◐ 部分可验证: 过去30年,大多数其他形式的社交活动(如打牌、去酒吧、体育赛事、志愿服务)也下降了两位数。 (需对比美国劳工统计局(BLS)时间使用调查或类似长期社会行为研究(如GSS综合社会调查)的数据,但具体下降幅度可能因活动类型和样本差异而需分段验证。)
- ✓ 可验证: 密集育儿导致父母(尤其是父亲)花在孩子身上的时间增加,挤占了招待成年人的时间。 (可通过美国人口普查局或皮尤研究中心关于育儿时间分配的公开报告(如《Parenting in America》系列)验证趋势,但需区分因果关系与相关性。)
原文内容:
关于我们社会孤独感日益增加的一篇精彩文章,在这种情况下是美国,但欧盟可能在较小程度上也存在类似情况: “德里克·汤普森的文章《你不再被邀请参加晚宴》认为,美国人基本上已经停止邀请他人到家里来。 这个标题统计数据来自罗伯特·帕特南在《独自打保龄》中使用的旧DDB Needham生活方式调查,与Data For Progress的新复制研究相结合。 美国人每月至少在家招待朋友或家人的比例从1975年的42%下降到2026年的12%,大致下降了70%。过去30年,大多数其他形式的社交活动也下降了两位数,包括打牌、去酒吧、体育赛事和志愿服务。招待活动的下降幅度比备受讨论的教堂出席率下降还要陡峭。 他排除了两种令人安慰的解释。人们并没有只是把晚宴移到餐厅,因为独餐饮食正在上升,而面对面的社交总体上在下降。他们也没有用其他社交活动取代聚会。锻炼和旅行有所增加,但锻炼主要是独处的,而且自2010年代以来,花在家里的时间急剧增加。 他的解释: 1. 忙碌的双职工家庭。随着社会变得更富裕,休闲开始感觉像工作,而计划一场晚宴基本上就是无偿的项目管理。历史上,女性负责家庭社交日程。当她们进入有偿工作时,男性并没有接手这项工作。他承认这不可能是全部原因,因为总休闲时间实际上已经增加。 2. 密集育儿。父母,尤其是父亲,现在花在孩子身上的时间远多于以往,而这些时间是从过去用于招待成年人的晚上中挤出来的。 3. 朋友网络缩小。亲密友谊正在下降,这种下降在没有大学学位的人群中最为明显,因此招待活动正成为一种奢侈品。从不招待的人倾向于独立人士和非大学毕业生。他推测,较弱的社交联系可能导致较弱的聚会依恋,而不是反过来。 4. 家太舒适了。美国人从2003年到2022年每天在家多花了将近两个小时,其中大部分时间花在屏幕和短视频上。 他的结尾想法是一种“休闲总量”理论,这是对劳动力总量谬误的变体。技术并没有使人类工作变得不必要,但它使其他人对娱乐变得不那么必要。社交休闲原来是有限的,而且很容易被取代。 他将此框定为协调失败,而不是个人失败:一场晚宴需要协调日程、清洁、食物、过敏问题,以及无聊夜晚的风险,而TikTok则对你一无所求。 脚注补充说,如果每个人都变得稍微忙碌一些,协调聚会的难度就会成倍增加,因此个人忙碌的小幅增加可能导致社交活动总体大幅下降。
⏰ 08:08 | ❤️ 214点赞 | 📝 808字 | 查看原文 →
Jerry Liu @jerryjliu0
解析世界上最难处理的 PDF @llama_index。公司联合创始人/首席执行官
职业机会:https://llamaindex.ai/careers
企业服务:https://llamaindex.ai/contact | 影响力: 0万粉丝
💡 核心观点: GPT-6.1文档解析能力显著提升,但成本仍高于传统方案。
可信度: 6/10 – 3项需进一步确认;1项为观点陈述
事实核查:
- ◐ 部分可验证: gpt-6.1 sol 在文档 OCR 任务上的表格解析能力和阅读顺序相比 gpt-6 sol 有显著提升 (需通过 ParseBench 或 llamaparse 提供的基准测试数据对比验证,但推文未提供具体测试方法或原始数据,依赖第三方平台透明度。)
- ◐ 部分可验证: gpt-6.1 sol 的表格解析能力与 gpt-6 astra 相似 (需对比两者在相同测试环境下的性能数据,但推文未提供细节,且“astra”版本信息未明确公开来源。)
- ◐ 部分可验证: 前沿模型比成本效益高的文档解析解决方案贵一个数量级(每页 >1 美分) (需核实模型定价与竞品成本数据,但“数量级”比较缺乏具体数值,且成本可能因使用场景而异。)
原文内容:
我们全面对 gpt-6.1 sol 在文档 OCR 任务上进行了基准测试。 与一周前的 gpt-6 sol(!)相比,我们看到了表格解析能力和阅读顺序的显著提升,这令人惊喜。gpt-6.1 sol 的表格解析能力与 gpt-6 astra 相似。 这些都是很棒的结果。前沿模型通常仍比成本效益高的文档解析解决方案贵一个数量级,但这也意味着在光谱的“高端”(每页 >1 美分)端提升能力也有很大的潜力。 查看 ParseBench:https://parsebench.ai 要了解全面的文档解析能力,请查看 llamaparse:
⏰ 08:02 | ❤️ 45点赞 | 📝 143字 | 查看原文 →
Aakash Gupta @aakashgupta
http://product-growth.com https://aibyaakash.com http://landpmjob.com http://youtube.com/@growproduct | 影响力: 0万粉丝
💡 核心观点: AI通过自我评估改进代码性能并修正自身错误。
可信度: 10/10 – 3项声明可直接验证;2项需进一步确认
事实核查:
- ◐ 部分可验证: Claude Code 现在可以为应用构建评估系统,通过递归自我改进提升分数 (需通过实测验证斜杠命令功能是否存在,且需检查官方文档是否提及递归自我改进的具体实现方式。)
- ✓ 可验证: Anthropic 测试显示 Claude 的评分从 66% 提升到 88% (未提供具体测试数据、保留测试集细节或第三方可复现的实验报告,仅依赖推文单方面陈述。)
- ◐ 部分可验证: Claude 通过编写映射表格修正自身过时的 API 知识 (若官方发布技术博客或代码示例展示此类自我修正逻辑,则可部分验证;否则依赖内部实现细节。)
原文内容:
递归自我改进刚刚作为斜杠命令上线了。 Claude Code 现在可以为你的应用构建一个评估系统,对自己的评分进行评分,然后通过一次一次的更改逐步提升分数,对抗一个它从未见过的保留测试集,这样它就无法通过记忆答案来作弊。Anthropic 将它指向 Claude 本身,并观察到它从 66% 提升到了 88%。 以下是那次运行中发生的事情。 他们将它瞄准了教授 Claude 使用他们自己的 API 编写代码的技能。Claude 添加了缺失的部分,修复了类型表中的错误,并达到了 77%。然后它停滞了。 于是它停止了修补,而是阅读了每一个剩余的失败案例,寻找根本原因。诊断结果很疯狂。正确的信息已经在技能中了,但 Claude 一直写出从其训练记忆中提取的旧版 API 结构。它自己的先验知识就是 bug。 修复方法是给自己写个笔记。它在技能顶部写了一个表格,将它记忆中的 API 形式映射到当前存在的形式。分数跃升至 80%。 然后它发现自己的测试有问题。一个评分器根据过时的文档评分,于是 Claude 调用了实时 API 来解决争议,证明了评分器才是问题所在,并修复了测试而不是代码。这把它带到了 88%。 一个 AI 在自己头脑中发现了陈旧的知识,给自己写了一个修正,然后验证了自己的考试是否公平。整个循环都在人们已经安装的编码工具中运行了。每个人想象中的这个版本涉及一个数据中心和新闻发布会,而实际上它看起来就像一个非常耐心的工程师碰巧在审阅自己。
⏰ 15:48 | ❤️ 259点赞 | 📝 475字 | 查看原文 →
Vasuman @vasuman
CEO @varickagents, Implementing AI at Enterprise. Prev AI @meta | 影响力: 463万粉丝
💡 核心观点: AI转型需定制服务而非工具,企业需专业实施者重构流程。
可信度: 10/10 – 2项声明可直接验证;2项需进一步确认;1项为观点陈述
事实核查:
- ◐ 部分可验证: Varick在AI服务领域构建的时间比任何公司都长 (可通过Varick官网或公开的公司历史记录验证其成立时间和业务范围,但“比任何公司都长”需对比行业其他公司的成立时间,可能存在争议或数据不全。)
- ✓ 可验证: Varick的客户满意度和扩展性不言自明 (未提供具体数据或第三方报告(如客户案例、NPS评分等),仅为主观宣称,无法直接验证。)
- ✓ 可验证: Meta是最新进入AI服务领域的公司 (可通过Meta的官方公告或新闻报道验证其是否近期布局AI服务业务(如Meta AI的B端服务动态)。)
原文内容:
我记得一年前,当每个人都专注于开发更多SaaS时,我曾在屋顶上大声疾呼: AI是一场服务游戏。你无法通过工具采用来解决企业低效问题。你需要AI实施者,他们深入其中,理解业务流程,为AI原生现实进行重构,然后为这些需求实施定制代理。 Varick在这个领域构建的时间比任何人都长。我们的客户满意度和扩展性不言自明。 Meta只是最新进入这个领域的公司。我很高兴,因为仅在美国就有数百万家公司需要这样的服务,而Varick无法独自帮助所有公司。 对于那些不想被锁定在任何一家AI公司的系统中的公司,从而让自己暴露于 - 价格上涨 - 模型量化/退化 - 速率限制 - 后续迁移成本 让我们聊聊。 我们也在招聘: - FDEs - 平台工程师 如果你是该领域的顶尖1%,我希望你加入全球#1 AI转型公司。
⏰ 07:53 | ❤️ 249点赞 | 📝 264字 | 查看原文 →
Rohan Paul @rohanpaul_ai
Compiling in real-time, the race towards AGI.
The Largest Show on X for AI.
Get my daily AI analysis newsletter to your email https://rohan-paul.com | 影响力: 6,793万粉丝
💡 核心观点: Anthropic 420亿亏损中340亿为会计费用,实际运营亏损80亿。
可信度: 9/10 – 2项声明可直接验证;2项需进一步确认
事实核查:
- ◐ 部分可验证: 2025年Anthropic的净亏损预计为420亿美元,其中约340亿美元是非现金会计费用,与可转换融资相关 (需查阅Anthropic的IPO文件或官方财务报告以确认具体亏损金额及非现金费用的分类,但路透社作为权威媒体,其报道通常基于可信来源。)
- ✓ 可验证: 非现金会计费用源于可转换融资工具按公允价值重新估值的会计规则要求 (会计准则(如美国GAAP或IFRS)对可转换融资工具的公允价值重估有明确规定,可通过会计规则文件或审计报告验证。)
- ◐ 部分可验证: Anthropic的基础运营亏损约为80亿美元,高于2024年的约30亿美元 (需对比Anthropic官方发布的2024年与2025年财务数据,但若路透社引用的是IPO文件,则部分可信。)
原文内容:
在路透社对Anthropic IPO文件中的损失报道中 2025年近420亿美元的净亏损不应被解读为运营业务的成本。 其中大约340亿美元是非现金会计费用,与可转换融资相关,这意味着从投资者那里筹集的资金,以换取未来获得Anthropic股份的权利。 由于这些工具被记录为负债,会计规则要求它们在每个报告期按公允价值(或当前市场价值)重新估值。 因此,随着Anthropic的估值大幅飙升,这些投资者有望获得的股份价值变得远为可观,而这一增值被记为亏损。 基础运营亏损约为80亿美元,高于2024年的约30亿美元。
⏰ 19:13 | ❤️ 32点赞 | 📝 188字 | 查看原文 →
Machina @exm7777
running ai-powered agencies | http://weeklyaiops.com | 影响力: 665万粉丝
💡 核心观点: ChatGPT是大众唯一熟悉的AI,新产品需依托其普及度拓展用户。
可信度: 8/10 – 2项声明可直接验证;1项需进一步确认;1项为观点陈述
事实核查:
- ◐ 部分可验证: 对世界上大多数人来说,他们对 AI 的唯一体验就是 ChatGPT (可通过用户调研或应用下载量等数据间接验证,但需明确“大多数人”的具体范围和统计方法,目前无直接公开的全球性对比数据支持。)
- ✓ 可验证: 用户尝试其他AI应用(如Grok Bot、Muse、Hermes)后仍会回到 ChatGPT (依赖个人经验或小众案例,缺乏公开的用户留存率或行为对比数据,无法规模化验证。)
- ✓ 可验证: Dots从第一天起提供Higgsfield访问权限,降低了用户学习成本 (可通过Dots官网或官方文档确认其功能集成和访问权限,但“降低学习成本”需用户反馈佐证。)
原文内容:
你必须明白一件事……对世界上大多数人来说,他们对 AI 的唯一体验就是 ChatGPT 如果你曾经尝试为家人设置 Grok Bot、Muse 或 Hermes,你就知道这一点 你为他们把一切都弄好运行……但不知怎的,他们总是回到 ChatGPT 所以 Dots 从第一天起就能获得 Higgsfield 访问权限,正好落在了每个人已经熟悉的地方 这为那些永远不会安装另一个 AI 应用的人开辟了数千种新的使用场景
⏰ 07:35 | ❤️ 35点赞 | 📝 130字 | 查看原文 →
Emily @iamemily2050
Any sufficiently advanced technology is indistinguishable from magic. Arthur C. Clarke. | 影响力: 1,021万粉丝
💡 核心观点: AI订阅费飙升,企业转向本地模型以控成本。
可信度: 6/10 – 1项声明可直接验证;2项需进一步确认;1项为观点陈述
事实核查:
- ◐ 部分可验证: Anthropic将跟随OpenAI,但500美元甚至不是上限。我们明年将看到1000美元的订阅。 (Anthropic的定价策略可能通过其官网或官方公告部分验证,但“明年将看到1000美元订阅”属于未来预测,需后续观察确认。)
- ◐ 部分可验证: 建设数据中心和训练这些模型的成本将持续上升。 (行业报告或企业财报可能提供历史成本数据支持这一趋势,但“将持续上升”涉及未来推断,需依赖专家分析或经济模型。)
- ✓ 可验证: 企业已开始为隐私和成本原因构建本地模型。 (可通过企业案例研究、技术新闻或行业分析报告(如Gartner、IDC)验证这一趋势,但具体企业名单需进一步调查。)
原文内容:
Anthropic 将跟随 OpenAI,但 500 美元甚至不是上限。我们明年将看到 1000 美元的订阅。建设数据中心和训练这些模型的成本将持续上升。企业已经开始为隐私和成本原因构建本地模型;他们赚钱的唯一其他方式是通过消费者和解决难题,但派遣数百万代理来解决这些问题会在取得进展之前失败无数次,而每次运行他们都在烧钱,他们烧不起这些钱。
⏰ 07:14 | ❤️ 53点赞 | 📝 134字 | 查看原文 →
Rohan Paul @rohanpaul_ai
Compiling in real-time, the race towards AGI.
The Largest Show on X for AI.
Get my daily AI analysis newsletter to your email https://rohan-paul.com | 影响力: 6,793万粉丝
💡 核心观点: 特朗普推动科技巨头签署AI安全自律协议。
可信度: 10/10 – 2项声明可直接验证;3项需进一步确认
事实核查:
- ✓ 可验证: 特朗普总统在TruthSocial上宣布了“超级智能”协议,并发布了一页文件 (可通过访问特朗普的Truth Social账号或官方发布的文件直接验证该声明。)
- ◐ 部分可验证: 谷歌、OpenAI、Anthropic、Meta、xAI和Nvidia的高管签署了白宫AI安全协议 (可通过白宫官网或相关公司公告部分验证签署情况,但需确认具体高管是否参与以及协议细节。)
- ◐ 部分可验证: 协议要求参与公司采用4项保障措施,包括建立内部控制机制、组建内部团队、聘请外部审计师和设立董事会委员会 (若协议文件公开,可验证具体条款,但需确认实际执行情况是否如所述。)
原文内容:
特朗普总统刚刚宣布了“超级智能”协议,这是他在 TruthSocial 上的最新帖子 谷歌、OpenAI、Anthropic、Meta、xAI 和 Nvidia 的高管签署了白宫 AI 安全协议 特朗普在 Truth Social 上发布了这个一页的文件,它要求每家参与公司为这项技术采用 4 项保障措施。 Yahoo Finance 每家公司承诺建立健全的内部控制机制来确保前沿 AI 安全,组建内部团队来运行这些机制,聘请外部审计师来检查这项工作,并设立董事会委员会来监督它。 马克·扎克伯格表示,签署方同意他们的董事会将独立审查审计师的报告,这使得公司董事成为最后一道审查防线。 特朗普的执行机制是同伴压力,因为他将该协议描述为“道德约束力”的,并表示它将通过“自我监管和集体监管”来让公司遵守。 该文件本身表示,以后可能有必要将这些步骤转化为法律或法规,但众议院成员预计要到 11 月中期选举之后才会返回华盛顿。
⏰ 07:01 | ❤️ 23点赞 | 📝 290字 | 查看原文 →
Artificial Analysis @artificialanlys
Independent analysis of AI | 影响力: 0万粉丝
💡 核心观点: 韩国AI行业领袖探讨人工智能未来发展与实际应用。
可信度: 10/10 – 2项声明可直接验证;2项需进一步确认;1项为观点陈述
事实核查:
- ✓ 可验证: Artificial Analysis 最近在韩国举办了首场活动 (可通过Artificial Analysis的官方网站、社交媒体账号(如Twitter)或活动宣传页面核实活动是否举办、时间地点等具体信息。)
- ◐ 部分可验证: George Cameron讨论了人工智能智能、基准测试及每任务成本作为关键衡量指标 (若活动有公开的演讲视频、幻灯片或摘要,可验证讨论内容;但若缺乏公开资料,仅能通过参与者证词部分验证。)
- ◐ 部分可验证: Sung Jun Cheon(@SKtelecom)分享了A.X K2如何提升能力并接近生产就绪 (需依赖SK Telecom的公开技术文档或新闻稿验证A.X K2的进展,但具体细节(如“生产就绪”标准)可能未完全公开。)
原文内容:
Artificial Analysis 最近在韩国举办了我们的首场活动 我们将首尔的一屋子行业建设者和研究人员聚集在一起,度过了一个关于人工智能未来的演讲之夜。 George Cameron (@grmcameron) 从旧金山加入,与大家讨论人工智能智能、基准测试,以及为什么在日益代理化的世界中,每任务成本是关键成本衡量指标。 来自 @SKtelecom 的 Sung Jun Cheon 分享了他们如何让 A.X K2 既更具能力,又更接近生产就绪。 来自 @TrillionLabs 的 Hongjoon Ahn 讨论了物理人工智能的世界,展示了 Gravity 是如何被构建来推理复杂基础设施,如发电厂。 衷心感谢 Bloom、我们的演讲嘉宾,以及所有加入我们并提出了一些好问题、让对话持续进行的人。
⏰ 06:35 | ❤️ 29点赞 | 📝 205字 | 查看原文 →
klöss @kloss_xyz
AI vibe orchestrator. prompt shaman.
systems architect. @psychanon CEO | 影响力: 6,174万粉丝
💡 核心观点: OpenAI新品遭网友调侃缺乏新意。
可信度: 10/10 – 3项声明可直接验证;1项需进一步确认;1项为观点陈述
事实核查:
- ◐ 部分可验证: OpenAI推出Decisions API,被称为”Jev杀手” (需查阅OpenAI官方公告或API文档确认是否存在该产品,但”Jev杀手”的表述可能是主观比喻(需核实是否针对特定竞品)。)
- ✓ 可验证: OpenAI提供500美元套餐(25倍)和200美元套餐(20倍)的对比 (可通过OpenAI官网订阅页面或定价文档直接验证套餐内容和倍数差异。)
- ◦ 观点: OpenAI推出”用ChatGPT登录”功能
原文内容:
OpenAI:来认识一下dots(圆点) 众人:你是说bots(机器人)吧?像Grok Bot那种? OpenAI:来认识ChatGPT Space(空间) 众人:呃...你这是用vibe(氛围)编码的Notion吗? OpenAI:来认识Decisions API(决策接口),Jev终结者 众人:所以你把两周前爆红的创业公司直接复制粘贴了? OpenAI:来认识用ChatGPT登录 众人:恭喜你重新发明了OAuth OpenAI:来认识GPT-6.1 Sol(太阳) 众人:但GPT-6.1 Astra(星辰)在哪里!!! OpenAI:来认识500美元套餐(25倍量) 众人:等等,那200美元套餐不应该是20倍量吗? OpenAI:你们看到Tibo的重置按钮了吗? 众人:但你们本来就欠我们一个 OpenAI:这里有个Chromatic GameBoy(炫彩游戏机) 众人:......
⏰ 06:31 | ❤️ 564点赞 | 📝 131字 | 查看原文 →
ℏεsam @hesamation
apes made fire, then GPUs, then ASI | 影响力: 0万粉丝
💡 核心观点: 开源与前沿模型的现实威胁差距并不显著。
可信度: 6/10 – 1项声明可直接验证;2项需进一步确认;1项为观点陈述
事实核查:
- ◐ 部分可验证: GLM-5.3 在漏洞开发上几乎与 Mythos Preview 匹敌 (需通过技术基准测试或官方性能报告对比两者漏洞开发能力,但目前缺乏公开的直接比较数据,且“匹敌”为模糊表述。)
- ◐ 部分可验证: 国家和非国家行为者会使用 GLM-5.3 这样的模型造成现实世界的伤害 (需依赖安全研究报告或案例证实模型被滥用的实例,但行为者活动通常不公开,Anthropic 可能有内部数据但未完全披露。)
- ✓ 可验证: Mythos 的网络访问权限仍未广泛开放 (可通过 Mythos 官方渠道(如官网公告或访问权限说明)直接确认当前开放状态。)
原文内容:
所以 Anthropic 基本上是在说: > GLM-5.3 在漏洞开发上几乎与 Mythos Preview 匹敌 > “国家和非国家行为者都会使用像 GLM-5.3 这样的模型来造成现实世界的伤害” > 与此同时,Mythos 的网络访问权限仍然不是每个人都能获得 如果开源技术“落后 6 个月”,但前沿网络能力也需要 6 个月才能广泛可用…… ……那么这个差距其实并没有多大意义。
⏰ 06:23 | ❤️ 96点赞 | 📝 113字 | 查看原文 →