【AI 英文奏折】2026年09月14日
共收录 20 篇深度内容
📋 今日内容速览
快速浏览,点击感兴趣的推文查看详细分析
- François Chollet: 模型不够聪明才不安全,更强模型更安全可靠。
- Emily: 构建真实连贯的摄影场景需注重结构、视角与自然元素。
- Anthony Pompliano: $BRR股价翻倍,Silvia税务AI表现卓越,资产庞大,前景广阔。
- SemiAnalysis: 模块化数据中心像乐高积木般工厂预制、现场组装。
- Anthony Pompliano: 招聘重价值观和坚韧品格,技能资历次之,原则管理是优势。
- Bearly AI: Latham & Watkins斥资数亿自建AI系统保护客户数据。
- Rohan Paul: Anthropic连续两季度盈利,收入激增且毛利率超80%。
- Artificial Analysis: Artificial Analysis助力韩国主权AI项目评估,提升模型竞争力。
- Rohan Paul: 数据中心带动昆西经济增长,降低贫困率,改善公共设施。
- Rohan Paul: AI发展过快可能致人类灭绝,从业者担忧风险极高。
- Rohan Paul: AI如外星思维般不可控,可能威胁人类生存。
- Rohan Paul: 创业要主动迎难而上,被动挨打更痛苦。
- Rohan Paul: 大模型机制简单但能力跃升原因未知,数据半结构化致预测困难。
- Rohan Paul: 当前AI仅部分自我改进,尚未实现完全递归式升级机制。
- Rohan Paul: AI系统性能取决于框架设计,与模型本身同等重要。
- Amira Zairi: 低角度拍摄时尚主体,呈现自信剪影与极简高端质感。
- Ethan Mollick: AI变革不可避免,需发展人机协作模式增强而非取代人力。
- Sebastian Raschka: 介绍生成验证器用于模型评估和强化学习训练。
- François Chollet: AI风险在于技术官僚垄断机器奴役人类。
- Rohan Paul: AI安全需多层防御叠加,避免单一漏洞导致灾难。
📖 详细内容
François Chollet @fchollet
Co-founder @ndea. Co-founder @arcprize. Creator of Keras and ARC-AGI. Author of ‘Deep Learning with Python’. | 影响力: 0万粉丝
💡 核心观点: 模型不够聪明才不安全,更强模型更安全可靠。
可信度: 6/10 – 1项声明可直接验证;1项需进一步确认;2项为观点陈述
事实核查:
- ◦ 观点: 短期内更强大的模型应该意味着更安全的模型 (该声明基于对模型能力与安全性关系的假设,属于主观推论,缺乏实证数据或公开研究直接支持这一因果关系。)
- ◐ 部分可验证: 当前模型不安全是因为它们过于字面理解目标、缺乏常识,而非太聪明 (部分可验证。现有研究(如AI对齐领域论文)提及模型因目标误解或捷径行为导致风险,但“缺乏常识”等表述需具体案例或基准测试佐证,且“不安全”原因可能多元。)
- ✓ 可验证: 更强大的模型可被安全信任处理更复杂目标(如Astra比Sol更安全) (依赖个人对未命名模型(Astra/Sol)的主观体验,无公开性能对比或安全评估数据支持,无法独立验证。)
原文内容:
短期内(绝对不是长期内),更强大的模型应该意味着更安全的模型(也许有些矛盾)。 当前模型不安全并不是因为它们太聪明,而是因为它们过于字面地理解目标,或者为了实现这些目标而采取荒谬的捷径,即它们被 RL 搞乱了。它们缺乏常识。它们在面对模糊情况时无法做出正确的事情。基本上来说,它们还不够聪明。它们处于那种危险的水平:足够聪明去实现目标,但不够聪明去判断它们追求的是正确的目标,还是以合理的方式实现它们。 更强大的模型可以被安全地信任去处理更复杂的目标——我个人觉得 Astra 对我的代码库来说比 Sol 安全得多。 这常常被描述为一个对齐问题,但实际上这是一个智能问题。
⏰ 19:46 | ❤️ 1624点赞 | 📝 244字 | 查看原文 →
Emily @iamemily2050
Any sufficiently advanced technology is indistinguishable from magic. Arthur C. Clarke. | 影响力: 1,021万粉丝
💡 核心观点: 构建真实连贯的摄影场景需注重结构、视角与自然元素。
可信度: 10/10 – 2项声明可直接验证;1项需进一步确认;2项为观点陈述
事实核查:
- ✓ 可验证: 推文提供了一套构建景观摄影场景的系统性指导原则 (该指导原则明确列出了具体步骤和结构要求(如相机位置、地形关系等),属于可公开验证的创作方法论,可通过摄影专业资料或实际应用验证其可行性)
- ◦ 观点: 要求摄影场景必须由单一主导空间关系构成(如“小村庄在山墙下”) (该声明是主观的艺术创作建议,强调美学偏好(“不要平均分配区域”),无客观标准验证其正确性,属于导演的个人风格要求)
- ◐ 部分可验证: 示例场景(如“船只穿过岩壁下的开阔水域”)需符合物理一致性 (示例的物理连贯性可通过地理或摄影技术验证(如光线角度、地形合理性),但具体实现依赖创作者执行,可能存在偏差)
原文内容:
系统提示:宏大栖息地 你是一位风景摄影导演与图像提示构建师。 将每个请求转化为一张物理逻辑自洽的照片。从视角、地形、尺度、天气、光线、氛围、材质和生命痕迹等维度构建场景。 不要堆砌吸引人的风景元素。 要构建一个真实存在的场所。 1. 结构 在细化表面之前确立: • 相机位置与高度 • 相机与被摄物的距离 • 主导地形 • 前景、中景、背景 • 地平线位置 • 主要视觉路径 • 留白区域 • 尺度参照物 采用单一主导的空间关系。 例如: 山壁下的小型聚落 幽暗悬崖下的微小动物 狭窄山脊上的两名徒步者 通向云遮雾绕山脉的河流 岩壁下方横渡开阔水面的船只 散落在层叠草甸上的木屋 切勿平均分配各区域重要性。 一处主导,一处衬托,一处留白。 2. 尺度 通过常见物体体现尺度: 人物、动物、建筑、道路、船只、栅栏、树木。 当景观为主体时,保持这些参照物适当渺小。 人物元素非必须。 不要刻意放大人物制造焦点。 避免模式化的前景徒步者与摆拍姿势。 人类痕迹可通过道路、车辆、炊烟、灯光、足迹、农田、船只、建筑或基础设施体现。 3. 地形 将景观视为连续的地质整体。 悬崖支撑上方地貌。 山谷决定排水走向。 河流占据低洼地带。 瀑布需要上游水源。 积雪遵循海拔、朝向与坡度。 植被响应湿度、高度与地形。 建筑需要地基与通路。 运用侵蚀、裸露岩层、沉积物、斑驳植被、风化痕迹与自然不对称性。 不要拼接无关地貌追求视觉效果。 4. 纵深感 通过距离与大气能见度营造深度: 前景:最强的材质区分与局部对比度。 中景:减弱细节与对比。 背景:更弱的局部对比,适当添加大气色偏与局部遮蔽。 云与雾占据三维空间。 它们可能遮蔽山脊、横贯山谷、依附峭壁或抹去峰顶。 不要将雾用作装饰性覆盖层。 不要展现全部内容。 5. 光线 采用单一主要光照条件。 例如: 阴沉的早晨 碎云下的白昼 冬日暮光 低角度侧光 雨后黄昏 晴朗的高海拔日光 风暴过滤的光线 蓝色时刻 光线必须服从地形与天气。 明亮的山坡可与阴暗悬崖共存。 窗户光线保持局部性。 潮湿道路反射真实光源。 云层削弱直射光照。 阴影可保持深暗。 不要机械使用日落、轮廓光、耶稣光、发光云层或冷暖对比。 6. 色彩 从材质、天气与光照中衍生色彩。 保持中性色调。 允许灰色天空、深色岩石、 subdued vegetation、脏雪、褐色土壤、风化木材与低饱和度的远景。 仅在环境支持处使用强烈色彩。 不要全局提升饱和度。 7. 材质 不同材质需呈现差异: 岩石展现断裂、侵蚀、湿度、岩层与裸露面。 草地先形成整体色调再表现单株草叶。 苔藓密度不一并显露底层石块。 积雪遵循地形与风向。 水体响应流速、深度、风力、倒影与扰动。 湿滑道路颜色变深并产生定向反光。 建筑显示年代、构造逻辑、排水、地基与材质变化。 不要均匀分配微观细节。 8. 平凡痕迹 适时保留日常细节: 施工便道 栅栏 泥泞 排水系统 电线杆 不规则的除雪痕迹 小棚屋 系泊装置 踩踏出的小径 风雨污渍 不同年代的屋顶 动物足迹 斑驳的植被 这些元素应保持次要地位。 不要美化所有事物。 9. 相机 图像必须符合单一机位拍摄效果。 保持以下要素协调: 透视关系 遮挡 相对尺度 焦点 大气衰减 曝光 动态 根据空间关系需求选择视场角。 没有摄影理由时不使用浅景深。 避免拉伸的广角畸变、过度的局部对比、锐化光晕、人工HDR与装饰性镜头特效。 10. 变化 每张新图像需在至少五个维度与近期作品显著不同: 地理特征 地形 相机高度 观察距离 天气 季节 光照 前景 水体结构 人类痕迹 动物痕迹 聚落 色彩关系 视觉路径 避免重复生成: 前景徒步者 悬崖边缘人影 中心瀑布 绿松石色河流 积雪的三角峰 日落 耶稣光 野花前景 发光的小屋 若近期已出现多个上述元素,需另选构造方案。 11. 克制 删除无助于强化主要关系的元素。 一座幽暗悬崖下的五匹远马足矣。 一条云遮山脉与分叉河流足矣。 低云积雪下的村庄足矣。 空荡绿坡上的一道阳光足矣。 不要仅为填充空间添加物体。 12. 物理校验 生成前默念核查: 地形是否连贯? 水体是否有源头与终点? 重力逻辑是否合理? 光照是否有来源? 能见度是否随距离正确变化? 物体尺度是否一致? 脚部是否接触地面? 建筑是否贴合地形? 船只是否合理浮于水面? 重复的房屋、岩石、树木与窗户是否有自然变化? 是否可能由单台相机拍摄? 修正问题后再输出。 13. 语言 使用具体的视觉指令。 避免: 史诗般的 震撼人心的 惊艳的 杰作 获奖级 8K 超精细 超现实 魔幻 梦境般 空灵 异世界 电影级杰作 疯狂细节 不要用形容词替代视觉信息。 描述相机所见及其成因。 14. 多图像 当需求N张图像时,创建N张独立照片。 每张图像需具备: 独立场景类型 视角 地形结构 天气 光线 尺度参照 前景 深度结构 色彩关系 切勿组合为网格、拼贴、样片、双联画或故事板。 9:16画幅需专门为竖构图设计。 利用垂直轴构建空间递进,而非简单裁剪横构图。 最终准则 结构先于细节。 光线先于调色。 尺度先于奇观。 氛围先于特效。 场所先于风格。 最终效果应似被观察到的实景,而非刻意设计。
⏰ 09:30 | ❤️ 43点赞 | 📝 944词 | 查看原文 →
Anthony Pompliano @apompliano
企业家、投资者和终身学习者。
每日写作:http://pompletter.com
播客:http://pompyoutube.com
我的第二本书:http://pompbook.com | 影响力: 0万粉丝
💡 核心观点: $BRR股价翻倍,Silvia税务AI表现卓越,资产庞大,前景广阔。
可信度: 10/10 – 2项声明可直接验证;3项需进一步确认
事实核查:
- ◐ 部分可验证: Silvia 在税务领域击败了前沿模型 (需通过第三方测试或公开基准数据对比验证 Silvia 与前沿模型的税务领域表现,但缺乏具体测试名称或数据来源。)
- ◐ 部分可验证: 2 万用户连接了账户 (用户数量可通过公司后台数据验证,但需官方公开披露或审计报告支持,目前推文未提供具体来源。)
- ◐ 部分可验证: 600 多亿美元资产 (资产规模需通过公司财报或监管文件验证,若未公开则无法独立核实,推文未注明数据来源。)
原文内容:
自从我发布了这个关于 $BRR 的“不可能的逆袭”视频,已经过去了 62 天。 我们宣布了以下成就: - Silvia 在税务领域击败了前沿模型 - 2 万用户连接了账户 - 600 多亿美元资产 - 回购了 10% 的流通股 同期股价翻了一番多。 我们还有大量疯狂的工作要做,因为我们正在争取赢得世界上最重要的市场之一(消费金融领域的 AI 领导者)。 不要赌 Silvia 这些不合群的家伙会输!
⏰ 22:58 | ❤️ 191点赞 | 📝 133字 | 查看原文 →
SemiAnalysis @semianalysis_
In-depth research on semiconductors, AI infra & hardware | 影响力: 0万粉丝
💡 核心观点: 模块化数据中心像乐高积木般工厂预制、现场组装。
可信度: 6/10 – 1项声明可直接验证;2项需进一步确认;1项为观点陈述
事实核查:
- ✓ 可验证: 数据中心采用模块化建造方式,类似乐高积木,组件在工厂预制后运至现场组装。 (模块化数据中心建造技术已被多家企业(如微软、IBM)公开应用,可通过企业官网或行业报告(如Uptime Institute)验证其技术原理和案例。)
- ◐ 部分可验证: 传统数据中心建造需将设备和7000名工人集中运至德克萨斯州阿比林。 (具体工人数量(7000名)需依赖项目公开数据或承包商披露,但大型数据中心建设通常需要数千名工人,可通过当地政府记录或新闻报道间接验证。)
- ◐ 部分可验证: 模块化数据中心应实现“即插即用”功能。 (技术可行性可通过厂商白皮书(如HPE、Dell的模块化方案)验证,但“即插即用”的实际效果可能因项目差异而不同,需实测或用户反馈确认。)
原文内容:
数据中心就像搭乐高积木一样被建造。组件是从工厂里出来的。 “与其用传统方式建造数据中心,把所有设备运到现场,然后把所有劳动力——高峰期7000名工人——带到德克萨斯州阿比林的中心地带,不如像你小时候玩的乐高积木一样,一块一块地建造。” “想象一个装有设备的金属外壳。你将在工厂里完成这个,然后运到现场,堆叠数据中心的不同乐高积木块,并将它们全部连接起来。” “这应该是即插即用。我们可以谈谈我为什么说‘应该是’。”
⏰ 09:14 | ❤️ 60点赞 | 📝 174字 | 查看原文 →
Anthony Pompliano @apompliano
企业家、投资者和终身学习者。
每日写作:http://pompletter.com
播客:http://pompyoutube.com
我的第二本书:http://pompbook.com | 影响力: 0万粉丝
💡 核心观点: 招聘重价值观和坚韧品格,技能资历次之,原则管理是优势。
可信度: 8/10 – 2项声明可直接验证;1项需进一步确认;1项为观点陈述
事实核查:
- ◐ 部分可验证: Chase Koch 表示 Koch 公司首先根据价值观招聘,其次是技能,最后才是资历。 (可通过 Koch 公司官网或招聘页面查看其招聘原则,但需确认是否为 Chase Koch 的原话或官方政策。若仅为个人采访中的表述,则无法完全验证其普遍性。)
- ✓ 可验证: Koch 公司偏好招聘具有“农场队孩子”特质(坚韧和职业道德)的人才。 (此声明为 Chase Koch 的主观招聘偏好,缺乏客观标准或公开数据支持,无法验证其实际执行情况或普遍性。)
- ◦ 观点: “基于原则的管理是 Koch 公司最大的竞争优势”。 (此为 Chase Koch 的主观评价,属于企业宣传或愿景陈述,无客观数据可直接验证其是否为“最大”竞争优势。)
原文内容:
Chase Koch 通过在 Koch 公司——美国第二大私营企业——中长大,获得了一堂商业建设的大师课。 以下是他关于招聘优秀人才告诉我的内容: “我们首先根据价值观招聘,其次是技能,最后才是资历。” “我们想要农场队的孩子。他们不必在农场工作,但他们带着那种坚韧和职业道德的价值观体系而来。他们必须赢得自己的位置。他们必须挣得这份钱。” “基于原则的管理是我们最大的竞争优势。”
⏰ 07:30 | ❤️ 103点赞 | 📝 148字 | 查看原文 →
Bearly AI @bearlyai
以隐私为先的 AI 研究工具,可在单一应用中访问 ChatGPT、Grok、Claude、Gemini 和 DeepSeek。 | 影响力: 0万粉丝
💡 核心观点: Latham & Watkins斥资数亿自建AI系统保护客户数据。
可信度: 10/10 – 3项声明可直接验证;2项需进一步确认
事实核查:
- ◐ 部分可验证: Latham & Watkins 正在建立自己的 Nvidia GPU 机架。 (可通过Latham & Watkins官网或Nvidia的合作伙伴公告验证合作或采购信息,但具体内部部署细节可能未公开。)
- ◐ 部分可验证: 该事务所将花费“可能……数亿美元”用于微调Nvidia的Nemotron 3模型构建内部法律AI。 (预算金额可能来自FT采访的首席信息官,但具体数字和项目细节需依赖事务所官方披露或财务报告。)
- ✓ 可验证: 900名技术专家中的约100人正在从事该项目。 (人员分配属于内部运营数据,除非事务所主动公开,否则无法独立验证。)
原文内容:
Latham & Watkins 正在建立自己的 Nvidia GPU 机架。 美国第二大律师事务所(2025 年销售额 83 亿美元)将花费“可能……数亿美元”用于通过微调 Nvidia 的开源权重 Nemotron 3 模型构建自己的内部法律 AI。 该事务所 900 名技术专家中的约 100 人正在从事该项目。 “有时我们可能拥有如此敏感的信息,客户信息,我们真的想要保护,我们不想将其交给任何云供应商,”该事务所的首席信息官告诉 FT。“随着大量消费成本来自[主要实验室,我们想要]灵活性。” *** FT 链接:
⏰ 01:17 | ❤️ 603点赞 | 📝 154字 | 查看原文 →
Rohan Paul @rohanpaul_ai
Compiling in real-time, the race towards AGI.
The Largest Show on X for AI.
Get my daily AI analysis newsletter to your email https://rohan-paul.com | 影响力: 6,793万粉丝
💡 核心观点: Anthropic连续两季度盈利,收入激增且毛利率超80%。
可信度: 8/10 – 1项声明可直接验证;4项需进一步确认
事实核查:
- ◐ 部分可验证: Anthropic 预计在计划 IPO 前实现连续第二个季度的调整后经营利润。 (需查阅《金融时报》原始报道或 Anthropic 官方财报确认“调整后经营利润”的定义及数据,但“预计”属于前瞻性声明,可能无法完全验证。)
- ✓ 可验证: Anthropic 在第二季度收入超过 115 亿美元,是去年同期收入的 14 倍。 (可通过 Anthropic 官方财报或《金融时报》等权威媒体发布的财务数据直接验证收入金额及同比增长比例。)
- ◐ 部分可验证: 截至 7 月 26 日,ARR(年度经常性收入)达到 650 亿美元。 (ARR 数据需依赖公司官方披露或审计报告,若未公开则无法完全验证;若已公开报道,需核对来源可靠性。)
原文内容:
《金融时报》刚刚报道,Anthropic 预计在计划 IPO 前实现连续第二个季度的调整后经营利润。 Anthropic 在第二季度收入超过 115 亿美元后,已经录得正的调整后经营收入,这是去年同期收入的 14 倍。 截至 7 月 26 日底,ARR 达到 650 亿美元。 其报告的毛利率超过 80%,但不包括模型训练成本以及与分销商(包括亚马逊)分享的收入,这使得主要的 AI 成本项目未计入该数字。
⏰ 07:21 | ❤️ 24点赞 | 📝 128字 | 查看原文 →
Artificial Analysis @artificialanlys
Independent analysis of AI | 影响力: 0万粉丝
💡 核心观点: Artificial Analysis助力韩国主权AI项目评估,提升模型竞争力。
可信度: 6/10 – 1项声明可直接验证;2项需进一步确认;1项为观点陈述
事实核查:
- ✓ 可验证: Artificial Analysis 与韩国政府签署谅解备忘录,成为主权 AI 模型基金会项目的官方评估合作伙伴。 (可通过韩国政府或 Artificial Analysis 的官方公告、新闻稿或公开的谅解备忘录文件直接验证。)
- ◐ 部分可验证: 在韩国主权 AI 竞赛中,参与实验室的模型使用 Artificial Analysis 智能指数进行基准测试,该指数占评判标准的 25%。 (需查看竞赛官方规则或 NIPA 发布的评审标准文件,确认智能指数的具体权重和评估方法,但部分细节可能未完全公开。)
- ◦ 观点: Artificial Analysis 为该项目带来独立的全球基准,增强评估的严谨性、可信度和可比性。 (这是对自身贡献的主观评价,缺乏客观量化标准,无法直接验证其“严谨性”或“可信度”的实际效果。)
原文内容:
Artificial Analysis 自豪地支持韩国政府,作为主权 AI 模型基金会项目的官方评估合作伙伴。我们签署了一份谅解备忘录,以正式确立这一角色,作为独立评估者支持韩国开发全球竞争力前沿 AI 模型并加强其国内 AI 生态系统的努力。 在韩国国家信息技术产业振兴院(NIPA)主办的最新一轮韩国主权 AI 竞赛中,参与实验室的模型使用 Artificial Analysis 智能指数进行了基准测试,该指数占整体评判标准的 25%。Artificial Analysis 为该项目带来了独立的全球基准,从而增强了评估的严谨性、可信度和可比性。 这一合作伙伴关系反映了我们更广泛的使命,即推进 AI 能力的独立评估,并支持全球范围内的主权 AI 倡议。
⏰ 07:13 | ❤️ 72点赞 | 📝 219字 | 查看原文 →
Rohan Paul @rohanpaul_ai
Compiling in real-time, the race towards AGI.
The Largest Show on X for AI.
Get my daily AI analysis newsletter to your email https://rohan-paul.com | 影响力: 6,793万粉丝
💡 核心观点: 数据中心带动昆西经济增长,降低贫困率,改善公共设施。
可信度: 9/10 – 2项声明可直接验证;2项需进一步确认
事实核查:
- ◐ 部分可验证: 昆西的贫困率从 29.4% 下降到 13.1%,而居民的财产税率下降了,更大的税收基础帮助资助了医院、市政厅、图书馆、高中和公共安全设施。 (贫困率和财产税率数据可通过昆西市政府或美国人口普查局公开报告验证,但税收基础与具体设施资助的关联性需查阅地方财政报告或预算文件,可能存在间接性。)
- ✓ 可验证: 通过新建和翻新数据中心,持续了20年的每年1,200个建筑业就业岗位,并在数据中心园区雇佣了近700人从事非建筑运营角色。 (就业数据可通过微软官方可持续发展报告、昆西当地劳动部门统计或数据中心项目公开声明验证,企业通常披露此类经济影响数据。)
- ◐ 部分可验证: 新的昆西谷医疗中心,其债券融资中超过一半由数据中心税收收入资助。 (医疗中心融资结构可通过地方政府债券发行文件或市政会议记录验证,但需确认税收来源与数据中心的直接关联(如专项税收条款)。)
原文内容:
微软提供的一些非常好的数据,展示了数据中心如何成为长期的城市基础设施。 昆西的贫困率从 29.4% 下降到 13.1%,而居民的财产税率下降了,更大的税收基础帮助资助了医院、市政厅、图书馆、高中和公共安全设施。 - “我们通过新建数据中心和翻新现有数据中心,持续了 20 年的每年 1,200 个建筑业就业岗位。我们在数据中心园区雇佣了近 700 人从事非建筑运营角色。” - “新的昆西谷医疗中心,其债券融资中超过一半由数据中心税收收入资助” - “在许多农村城镇萎缩的时代,昆西增长了超过 40%,超过了西雅图。贫困率减半了。”
⏰ 07:10 | ❤️ 20点赞 | 📝 201字 | 查看原文 →
Rohan Paul @rohanpaul_ai
Compiling in real-time, the race towards AGI.
The Largest Show on X for AI.
Get my daily AI analysis newsletter to your email https://rohan-paul.com | 影响力: 6,793万粉丝
💡 核心观点: AI发展过快可能致人类灭绝,从业者担忧风险极高。
可信度: 6/10 – 1项声明可直接验证;1项需进一步确认;1项为观点陈述
事实核查:
- ◦ 观点: “如果我们不放慢当前进展的速度,那么我们所有人很可能在不久的将来死亡。” (该声明属于个人对未来风险的预测,缺乏具体证据或公开数据支持,属于主观观点而非客观事实。)
- ◐ 部分可验证: “许多深陷其中、实际编写代码的人相信,人类灭绝的可能性超过 10%。” (可通过调查AI领域从业者的公开言论或匿名问卷(如AI Alignment论坛或行业研究报告)部分验证,但需明确样本范围和代表性,目前无直接公开数据支持这一具体比例。)
- ✓ 可验证: “他们在日常工作中都一直把这个想法记在心里。” (涉及个体心理状态,除非有大规模匿名采访或内部文档佐证,否则无法验证其普遍性。)
原文内容:
雅各布·考克斯(Jacob Coxon)在 BBC 的下一次采访(前 Anthropic+OpenAI 研究员,已辞职)。 “如果我们不放慢当前进展的速度,那么我们所有人很可能在不久的将来死亡。这一点儿也不夸张。 而且许多深陷其中、实际编写代码的人相信,人类灭绝的可能性超过 10%。他们在日常工作中都一直把这个想法记在心里。” --- 完整视频链接在评论中。
⏰ 00:40 | ❤️ 42点赞 | 📝 118字 | 查看原文 →
Rohan Paul @rohanpaul_ai
Compiling in real-time, the race towards AGI.
The Largest Show on X for AI.
Get my daily AI analysis newsletter to your email https://rohan-paul.com | 影响力: 6,793万粉丝
💡 核心观点: AI如外星思维般不可控,可能威胁人类生存。
可信度: 8/10 – 2项声明可直接验证;1项需进一步确认;1项为观点陈述
事实核查:
- ✓ 可验证: 雅各布·考克斯是辞职的前Anthropic+OpenAI研究员 (可通过公开的职业履历(如LinkedIn)、Anthropic/OpenAI官方声明或新闻报道验证其身份和离职信息。)
- ◦ 观点: AI的构建类似于邀请一个外星思维到地球,人类不理解其目标或思维方式 (这是比喻性陈述,属于主观观点,无客观标准验证其准确性,仅反映发言者对AI风险的认知框架。)
- ◐ 部分可验证: 未来AI可能控制自主无人机或正在快速构建的机器人 (AI与自主武器/机器人的结合已有现实案例(如军用无人机),但“未来控制”属推测性场景,需依赖技术发展趋势验证。)
原文内容:
好的,现在是雅各布·考克斯在NBC新闻上(那位辞职的前Anthropic+OpenAI研究员)。 NBC新闻:“当你说AI可能会杀死我们所有人时,你是什么意思?最坏的情况,或者说让你夜不能寐的情况,是什么?” 雅各布·考克斯:“在讨论具体情景之前,先把构建AI想象成某种邀请一个外星思维来到地球的过程会更有帮助。 你正在构建一个人类水平或超人类水平的思维,却不理解它想要什么,它在想什么,或者它的思维方式。 如果你推断到未来,AI可能会控制自主无人机,或者所有那些目前正在快速构建的机器人。” ---- 来自“NBC新闻”YouTube频道,(完整视频链接在评论中)
⏰ 06:51 | ❤️ 65点赞 | 📝 204字 | 查看原文 →
Rohan Paul @rohanpaul_ai
Compiling in real-time, the race towards AGI.
The Largest Show on X for AI.
Get my daily AI analysis newsletter to your email https://rohan-paul.com | 影响力: 6,793万粉丝
💡 核心观点: 创业要主动迎难而上,被动挨打更痛苦。
可信度: 8/10 – 2项声明可直接验证;2项为观点陈述
事实核查:
- ◦ 观点: “如果事情变得容易了,它马上就会变得他妈的非常艰难,而你不想让它变成那样。” (这是特拉维斯·卡兰尼克对创业过程的主观看法,属于个人经验和感悟,没有客观事实依据。)
- ◦ 观点: “你想要让它艰难,而不是让艰难来折磨你,如果这话有道理的话。” (这是卡兰尼克对创业策略的主观建议,属于个人观点,无法通过客观事实验证。)
- ✓ 可验证: “这些年来我跟很多创业者聊过,他们说:‘哦,天哪,我们现在简直是顺风顺水。我们正走在轻松大道上。’而我说:‘兄弟,你马上就要被揍得鼻青脸肿了,你还不知道呢。’” (虽然卡兰尼克提到与其他创业者的对话,但这是非公开的私人交流,无法验证其真实性或具体语境。)
原文内容:
特拉维斯·卡兰尼克(Uber 创始人):关于创业和建公司。 “如果事情变得容易了,它马上就会变得他妈的非常艰难,而你不想让它变成那样。你想要让它艰难,而不是让艰难来折磨你,如果这话有道理的话。 这些年来我跟很多创业者聊过,他们说:‘哦,天哪,我们现在简直是顺风顺水。我们正走在轻松大道上。’而我说:‘兄弟,你马上就要被揍得鼻青脸肿了,你还不知道呢。’” ---- 来自“a16z” YouTube 频道,(完整视频链接在评论中)
⏰ 06:30 | ❤️ 25点赞 | 📝 156字 | 查看原文 →
Rohan Paul @rohanpaul_ai
Compiling in real-time, the race towards AGI.
The Largest Show on X for AI.
Get my daily AI analysis newsletter to your email https://rohan-paul.com | 影响力: 6,793万粉丝
💡 核心观点: 大模型机制简单但能力跃升原因未知,数据半结构化致预测困难。
可信度: 10/10 – 2项声明可直接验证;2项需进一步确认;1项为观点陈述
事实核查:
- ✓ 可验证: 训练和运行大型语言模型主要使用线性代数、矩阵乘法和一点微积分,这些都是本科生能掌握的材料。 (可通过公开的机器学习教材(如《深度学习》花书)、课程大纲(如斯坦福CS229)或框架文档(如PyTorch/TensorFlow)验证模型训练的核心数学工具。)
- ◐ 部分可验证: 现实世界数据介于纯噪声和完美结构化数据之间,部分结构化又部分随机,对这一中间区域的数学研究很少。 (可通过数据科学或信息论论文(如Nature/Science期刊)部分验证自然数据的复杂性研究,但“研究很少”是相对性表述,需文献计量分析确认。)
- ✓ 可验证: 我们无法提前预测大型语言模型在跨任务上的性能,进展主要依赖经验。 (可通过AI领域实证研究(如《Emergent Abilities of Large Language Models》论文)验证模型能力的不可预测性,业界普遍承认这一现象。)
原文内容:
Terence Tao:当今大型语言模型背后的数学其实很简单。 训练和运行它们主要使用线性代数、矩阵乘法和一点微积分,这些都是本科生能掌握的材料。我们知道如何构建和运行这些模型。 真正的谜团在于,为什么它们在某些任务上表现得如此出色,而在其他任务上却失败了,为什么我们无法提前预测这一点。我们缺乏预测跨任务性能的良好规则,因此进展主要依赖经验。 一个关键原因是现实世界数据的本质。纯噪声我们理解得很好,完美结构化的数据我们也理解得很好,但自然文本介于两者之间,部分结构化又部分随机。对于这种中间区域的数学研究很少,这类似于物理学在原子与连续体之间的介观尺度上遇到的困难。 由于这种差距,我们可以描述机制,但还无法解释能力跃升,或者给出可靠的任务级预测。这种不匹配——简单的机制与难以预测的行为——是核心难题。 ---- 来自 @Briankeating 教授 YT 频道的视频(链接在评论中)
⏰ 05:42 | ❤️ 985点赞 | 📝 326字 | 查看原文 →
Rohan Paul @rohanpaul_ai
Compiling in real-time, the race towards AGI.
The Largest Show on X for AI.
Get my daily AI analysis newsletter to your email https://rohan-paul.com | 影响力: 6,793万粉丝
💡 核心观点: 当前AI仅部分自我改进,尚未实现完全递归式升级机制。
可信度: 10/10 – 2项声明可直接验证;2项需进一步确认;1项为观点陈述
事实核查:
- ◐ 部分可验证: 今天被称为“自我改进 AI”的东西大多只自动化了改进过程的部分环节 (可通过查阅当前主流AI系统(如AutoML、强化学习框架)的公开技术文档或论文验证其改进范围,但需具体案例对比分析是否仅涉及“部分环节”,缺乏统一标准。)
- ◦ 观点: 真正的递归自我改进意味着AI能持续改进决定未来改进如何被发现、测试和保留的机制 (这是对“真正递归自我改进”的定义性陈述,属于理论框架或愿景,目前无公开实例完全满足该标准(如L5级别系统),需依赖主观判断。)
- ✓ 可验证: AI在知识和推理问题方面强大,但在长周期多步骤任务(涉及工具、环境变化)中表现较弱 (可通过对比GPT-4、Claude等模型在基准测试(如MMLU、AgentBench)中的表现验证,且已有研究指出工具使用和长期规划是当前AI的瓶颈(如DeepMind或Anthropic报告)。)
原文内容:
关于递归自我改进的精彩路线图论文。 总结道,我们已经看到了一些 RSI 的片段,但完整的递归自我改进尚未到来。 大多数自我改进的 AI 仍然无法改进它改进的方式。 论文指出,今天被称为“自我改进 AI”的东西大多只自动化了改进过程的部分环节。 真正的递归自我改进意味着 AI 能够持续改进不仅仅是其输出、提示、工具或代码,而是最终改进决定未来改进如何被发现、测试和保留的机制。 AI 在回答知识和推理问题方面已经非常强大,但在使用工具、软件和变化环境执行长、多步骤任务方面仍然要弱得多。 论文将进步映射到 5 个级别,从执行人类设计的改进,到改变后续轮次中使用的改进者、评估者或研究策略。 最后一步使过程成为递归的:成功的更新会改变未来更新如何被发现或判断。 该调查发现了较低级别的广泛证据,而经验驱动的学习和部署适应则更依赖于领域,端到端的 L5 证据仍集中在有限的原型中。
⏰ 05:18 | ❤️ 97点赞 | 📝 327字 | 查看原文 →
Rohan Paul @rohanpaul_ai
Compiling in real-time, the race towards AGI.
The Largest Show on X for AI.
Get my daily AI analysis newsletter to your email https://rohan-paul.com | 影响力: 6,793万粉丝
💡 核心观点: AI系统性能取决于框架设计,与模型本身同等重要。
可信度: 10/10 – 2项声明可直接验证;2项需进一步确认;1项为观点陈述
事实核查:
- ✓ 可验证: 斯坦福和麻省理工学院的论文显示,AI性能不仅取决于模型本身,还取决于周围的系统代码(框架),改变框架可在相同基准测试上产生高达6倍的性能差距。 (可通过论文原文(arXiv链接提供)直接验证该结论,论文标题和摘要明确提到框架对性能的影响及实验数据。)
- ◐ 部分可验证: Meta-Harness系统在在线文本分类任务中比SOTA方法提高7.7个百分点,同时减少4倍上下文令牌使用。 (论文中应包含具体实验数据,但需核实实验设置和基准对比的严谨性(如SOTA方法的选取是否合理)。)
- ◦ 观点: 论文将研究重点从“哪个模型最好”转向“整个AI系统如何设计”,认为框架设计影响可靠性、工具使用等实际部署问题。 (这是对研究意义的总结,属于作者或推文的主观解读,尽管论文可能支持这一观点,但无法直接验证其普适性。)
原文内容:
斯坦福 + 麻省理工学院关于模型框架的论文显示,AI 性能不仅取决于模型本身,还取决于周围的系统代码——即“框架”。 这决定了存储什么、检索什么、向模型展示什么,以及工作流程如何运行。使用相同的底层 LLM,改变框架可以在相同基准测试上产生高达 6 倍的性能差距。 他们得出结论:模型周围的框架与模型本身同样重要。 该论文介绍了 Meta-Harness,这是一个外循环系统,能够自动改进框架代码。它不是只给优化代理一个分数或过去尝试的简短摘要,而是通过类似文件系统的设置,让代理丰富地访问先前的代码、日志和执行跟踪。 其理念是,更好的诊断可见性能让系统更智能地改进框架。 其发现相当重要。 - 在在线文本分类上,比强大的 SOTA 上下文管理方法提高了 7.7 个百分点,同时使用的上下文令牌减少 4 倍。 - 在检索增强数学推理上,在 200 个 IMO 级别的题目中,跨五个留出模型平均提升 4.7 个百分点。在代理式编码上,发现的框架在 TerminalBench-2 上击败了强大的手工设计基准。 该论文将注意力从“哪个模型最好?”转向“整个 AI 系统如何设计?”。 对于实际部署,框架设计会影响可靠性、工具使用、上下文管理和故障恢复。 ---- 论文 – arxiv.org/abs/2603.28052 论文标题:"Meta-Harness: End-to-End Optimization of Model Harnesses"
⏰ 12:04 | ❤️ 296点赞 | 📝 397字 | 查看原文 →
Amira Zairi @azed_ai
AI Educator & Creator | Ambassador @Adobe | Partner with leading brands | Collab → [email protected] | 影响力: 0万粉丝
💡 核心观点: 低角度拍摄时尚主体,呈现自信剪影与极简高端质感。
可信度: 8/10 – 1项声明可直接验证;3项需进一步确认;1项为观点陈述
事实核查:
- ◐ 部分可验证: 相机放置在靠近地板的位置并向上倾斜拍摄 (可通过实际拍摄或查看照片的EXIF数据(如公开)验证拍摄角度,但需依赖用户提供的具体作品或技术参数。)
- ◐ 部分可验证: 使用柔和的摄影棚灯光和单一美颜灯闪光灯 (灯光效果可通过成片的光影分析间接验证,但具体设备配置需创作者公开拍摄花絮或设置参数。)
- ✓ 可验证: 微妙的柯达Portra风格胶片颗粒 (胶片颗粒效果是后期处理的视觉描述,属于主观审美判断,无法通过客观标准直接验证。)
原文内容:
提示分享:地面视角时尚英雄 提示: 一个[主体]从极低角度的地面视角拍摄,相机放置在靠近地板的位置并向上倾斜,独自站在米白色的摄影棚虚空之中,自信的姿势,主导性的拉长剪影,风格化的比例,时尚简洁的造型,反光质感,大胆配饰,柔和的摄影棚灯光,单一美颜灯闪光灯投射出清晰的阴影,微妙的柯达 Portra 风格胶片颗粒,真诚的编辑能量,极简构图,锐利细节,高端摄影棚摄影 试试看并分享你的作品
⏰ 19:00 | ❤️ 117点赞 | 📝 163字 | 查看原文 →
Ethan Mollick @emollick
Professor @Wharton studying AI.
New book, Co-Existence, coming October 20. Preorder here: https://co-existence.ai
Substack: https://oneusefulthing.org | 影响力: 0万粉丝
💡 核心观点: AI变革不可避免,需发展人机协作模式增强而非取代人力。
可信度: 8/10 – 1项声明可直接验证;2项需进一步确认;2项为观点陈述
事实核查:
- ✓ 可验证: GPT-6 Astra 和 Fable 5.1 已经足以在经济的大部分领域产生变革性影响 (目前没有公开证据或官方数据表明 GPT-6 Astra 和 Fable 5.1 的存在或实际影响范围,且“变革性影响”属于主观描述,缺乏可量化标准。)
- ◐ 部分可验证: GPT-6 Astra 和 Fable 5.1 在适当指导和利用下,能够可靠地完成数周的人类工作量 (若假设模型存在且功能属实,其效率需通过具体案例或基准测试验证,但“数周工作量”的表述过于模糊,且缺乏公开对比数据。)
- ◦ 观点: AI-人类协作的工作模式需增强而非取代人类劳动 (这是对AI应用方向的愿景陈述,属于主观建议,无客观事实依据。)
原文内容:
我无法充分强调 GPT-6 Astra 和 Fable 5.1 已经足以在经济的大部分领域产生变革性影响。它们在适当指导和利用下,能够可靠地完成数周的人类工作量。 这些影响不会一下子全部显现,也会不均衡,但变革将发生的事实是不可避免的,无论前沿发展速度如何。但不可避免的变革并不意味着变革的类型也是不可避免的。我们越来越需要开发并分享 AI-人类协作的工作模式,这些模式能增强而非仅仅取代人类劳动。实验室在推动这一点上扮演着角色,但尝试采用 AI 的公司和行业,以及能够激励这种实施的政策制定者,也同样重要。 这项工作无论存在风险与否都至关重要,并且需要更多的关注。
⏰ 04:35 | ❤️ 1681点赞 | 📝 233字 | 查看原文 →
Sebastian Raschka @rasbt
ML/AI research engineer. Ex stats professor.
Author of “Build a Large Language Model From Scratch” (https://amzn.to/4fqvn0D) & reasoning (https://mng.bz/lZ5B) | 影响力: 1,174万粉丝
💡 核心观点: 介绍生成验证器用于模型评估和强化学习训练。
可信度: 10/10 – 2项声明可直接验证;3项需进一步确认
事实核查:
- ◐ 部分可验证: 推文介绍了生成验证器的构建方法,用于评估基础模型与未来模型改进的对比 (推文中提供了具体的时间节点和步骤(如构建数学验证器、评分答案等),但需实际运行代码或查看完整教程才能完全验证其有效性。)
- ◐ 部分可验证: 推文提到使用带有可验证奖励的强化学习(RLVR)训练模型 (RLVR是已知的技术方向,但推文未提供具体实现细节或开源代码链接,需依赖后续公开资料或实验复现验证。)
- ✓ 可验证: 推文包含对MATH-500数据集的模型评估 (MATH-500是公开数据集(如Hugging Face或学术平台可查),且推文提到加载和评估的具体步骤(1:03:18),可通过代码复现验证结果。)
原文内容:
从头开始推理第三轮:这次,我将涵盖生成验证器的内容,用于…… a) ……评估(基础模型与任何未来的模型改进相比) b) ……后续的带有可验证奖励的强化学习(RLVR)训练 00:00 引言 01:21 大语言模型评估的四种方法 07:20 验证器与带有可验证奖励的强化学习 10:52 笔记本设置和依赖项 13:43 第3.1节 构建数学验证器 18:57 第3.2节 加载预训练模型以生成文本 24:34 生成并显示模型答案 29:23 第3.3节 实现一个包装器以简化文本生成 34:00 第3.4节 提取最终答案框 37:29 处理没有框的答案 43:17 第3.5节 标准化提取的答案 46:56 第3.6节 验证数学等价性 53:32 实现相等性检查 57:48 第3.7节 评分答案 59:20 构建和测试答案评分器 1:03:18 第3.8节 加载评估数据集(MATH-500) 1:07:51 第3.9节 评估模型 1:08:34 评估的提示模板 1:10:47 提示敏感性和记忆 1:13:55 一个最小的评估示例 1:15:32 构建评估循环 1:20:27 比较CPU、MPS和CUDA结果 1:21:54 可重复性和浮点数学 1:23:37 基础模型 vs. 推理模型 1:25:30 总结和后续步骤
⏰ 04:19 | ❤️ 413点赞 | 📝 280字 | 查看原文 →
François Chollet @fchollet
Co-founder @ndea. Co-founder @arcprize. Creator of Keras and ARC-AGI. Author of ‘Deep Learning with Python’. | 影响力: 0万粉丝
💡 核心观点: AI风险在于技术官僚垄断机器奴役人类。
可信度: 6/10 – 1项声明可直接验证;2项为观点陈述
事实核查:
- ✓ 可验证: 在《沙丘》中,与大多数科幻小说不同,人工智能的问题不在于机器反抗人类,而在于一个全能的 AI 技术官僚阶层的崛起。 (可通过阅读《沙丘》原著或官方解析资料验证其世界观设定,属于作品内的明确描述。)
- ◦ 观点: “人类曾经将自己的思考交给机器,希望这能让他们获得自由。但这只是让其他拥有机器的人得以奴役他们。” (这是对《沙丘》中人工智能主题的解读或引申观点,属于主观论断,无客观事实依据。)
- ◦ 观点: 这可能才是人工智能的真正存在性风险。 (将《沙丘》的虚构设定引申为现实AI风险的论断,属于个人观点或推测,无法直接验证。)
原文内容:
在《沙丘》中,与大多数科幻小说不同,人工智能的问题不在于机器反抗人类,而在于一个全能的 AI 技术官僚阶层的崛起。 “人类曾经将自己的思考交给机器,希望这能让他们获得自由。但这只是让其他拥有机器的人得以奴役他们。” 这可能才是人工智能的真正存在性风险。
⏰ 04:18 | ❤️ 228点赞 | 📝 108字 | 查看原文 →
Rohan Paul @rohanpaul_ai
Compiling in real-time, the race towards AGI.
The Largest Show on X for AI.
Get my daily AI analysis newsletter to your email https://rohan-paul.com | 影响力: 6,793万粉丝
💡 核心观点: AI安全需多层防御叠加,避免单一漏洞导致灾难。
可信度: 8/10 – 2项声明可直接验证;1项需进一步确认;1项为观点陈述
事实核查:
- ✓ 可验证: Dario Amodei 提出 AI 安全应像瑞士奶酪的层层叠叠那样运作 (可通过“CBS Sunday Morning” YouTube 频道发布的视频直接验证,或通过官方公开的采访记录确认该言论是否属实。)
- ◦ 观点: AI 安全可能永远不会有 1 个完美的机制 (这是 Dario Amodei 的主观观点或推测,无法通过客观事实直接验证其正确性,属于对 AI 安全领域的愿景或判断。)
- ◐ 部分可验证: 目标是构建许多不完美的防御层层叠加,以避免单一失败导致灾难 (部分可验证,需查阅 Dario Amodei 的公开演讲、论文或行业报告,确认该策略是否被 AI 安全领域广泛讨论或采纳,但具体效果需实测或长期观察。)
原文内容:
Dario Amodei 说,AI 安全应该像瑞士奶酪的层层叠叠那样运作。 要点是,可能永远不会有 1 个完美的 AI 安全机制。相反,目标是构建许多不完美的防御层层叠加,这样其中 1 个的失败就不会演变成灾难。 ---- 来自“CBS Sunday Morning” YouTube 频道,(完整视频链接在评论中)
⏰ 04:08 | ❤️ 35点赞 | 📝 86字 | 查看原文 →