【AI 英文奏折】2026年09月18日
共收录 20 篇深度内容
📋 今日内容速览
快速浏览,点击感兴趣的推文查看详细分析
- Machina: 多任务协同处理是提升代理工作效率的关键。
- Ethan Mollick: AI尝试破解《沃伊尼奇手稿》失败后制作了有趣的解释影片。
- Rohan Paul: AI大幅提升生产力,少数高效员工与多数人差距拉大。
- Rohan Paul: 仿生机器鱼以真鱼游动方式亮相服贸会,配备声呐监测功能。
- Emily: 人类器官组织在小鼠体内实现异种皮层发育。
- Rohan Paul: 循环改进隐藏状态可提升模型推理能力。
- Machina: 新型AI模型Jev通过直觉决策和诚实自信机制加速实现AGI。
- EP: AI模型快速低成本评估视频销售意图效果显著。
- Rohan Paul: GPT-6破解了1941年德国陆军未解谜码。
- Chubby♨️: Meta凭借分发能力和生态整合,专注解决日常需求即可成功。
- Gary Marcus: 缺乏执法导致人工智能公司肆无忌惮违法。
- Heather Cooper: AI视频生成能单次完成复杂多镜头叙事。
- klöss: 作者列举了多种AI工具在不同场景下的具体应用。
- SemiAnalysis: OpenAI不同模型工具调用频率差异显著。
- Charly Wargnier: AI代理加速开发,但意图协调等核心环节仍需人工决策。
- Ethan Mollick: Claude成功3D重建翁贝托·埃柯的3.3万册图书馆。
- Artificial Analysis: 近期图像生成技术大幅提升,更快更便宜。
- Rohan Paul: Anthropic研发中90%工作由AI协作完成,人类主要监督。
- Ethan Mollick: Claude Projects能协调多代理团队分工协作高效解决问题。
- Ethan Mollick: 作者自费使用AI,但早期无成本限制,且非AI领域专家。
📖 详细内容
Machina @exm7777
running ai-powered agencies | http://weeklyaiops.com | 影响力: 665万粉丝
💡 核心观点: 多任务协同处理是提升代理工作效率的关键。
可信度: 8/10 – 1项声明可直接验证;3项需进一步确认;1项为观点陈述
事实核查:
- ◦ 观点: 同时运行多个工作负载是目前代理工作中最重要的技能 (该声明属于主观判断,未提供客观数据或行业标准支持“最重要技能”的结论,且“代理工作”的定义模糊。)
- ◐ 部分可验证: 一个工作负载加上它自己的子代理已经不够用了 (需实测不同工作负载配置的效果,但“不够用”是相对性描述,依赖具体场景和需求,缺乏普适性验证标准。)
- ◐ 部分可验证: 背景批量任务发送给Deepseek,对于它处理的内容来说,价格低得离谱 (Deepseek的定价可通过官方渠道查询,但“低得离谱”是主观比较结论,需结合具体任务和数据量验证性价比。)
原文内容:
同时运行多个工作负载是目前代理工作中最重要的技能…… 一个工作负载加上它自己的子代理已经不够用了 这里是一个基本示例: - 从 Claude Code 发送计划给 Codex 和 GPT-6 Astra 进行审查 - 从 Codex,写作内容发送给 Fable……确实比 GPT 模型更好 - 背景批量任务发送给 Deepseek,对于它处理的内容来说,价格低得离谱 需要真正反复实践才能找出每个任务的最佳工作负载 + 模型组合 但一旦找到它,速度和质量就会跃升到一个全新的水平
⏰ 04:59 | ❤️ 132点赞 | 📝 155字 | 查看原文 →
Ethan Mollick @emollick
Professor @Wharton studying AI.
New book, Co-Existence, coming October 20. Preorder here: https://co-existence.ai
Substack: https://oneusefulthing.org | 影响力: 0万粉丝
💡 核心观点: AI尝试破解《沃伊尼奇手稿》失败后制作了有趣的解释影片。
可信度: 6/10 – 1项声明可直接验证;2项需进一步确认;1项为观点陈述
事实核查:
- ◐ 部分可验证: Claude尝试破解《沃伊尼奇手稿》但失败了 (可通过Claude官方公开的交互记录或项目文档验证其是否尝试破解该手稿,但”失败”的结论需依赖内部判定标准(如未达到预设目标),可能存在主观解释空间。)
- ✓ 可验证: Claude制作了一部关于破解该手稿的电影 (若该电影已公开发布在社交媒体平台(如推文所述),可通过查看发布账户的影片内容直接验证。)
- ◦ 观点: 这部电影观看起来挺有趣的 (对影片趣味性的评价属于主观感受,无客观验证标准。)
原文内容:
嘿,Claude,“选择一个让你着迷的问题或谜团,尽你所能去解决它 & 制作一部我们可以在社交媒体上分享的电影” 所以它尝试破解了《沃伊尼奇手稿》 & 失败了。然后它制作了这部电影,观看起来挺有趣的,也是个不错的解释。
⏰ 10:01 | ❤️ 128点赞 | 📝 85字 | 查看原文 →
Rohan Paul @rohanpaul_ai
Compiling in real-time, the race towards AGI.
The Largest Show on X for AI.
Get my daily AI analysis newsletter to your email https://rohan-paul.com | 影响力: 6,793万粉丝
💡 核心观点: AI大幅提升生产力,少数高效员工与多数人差距拉大。
可信度: 6/10 – 1项声明可直接验证;1项需进一步确认;1项为观点陈述
事实核查:
- ◐ 部分可验证: CRED 现在 90% 的代码都是由 AI 编写的。 (需通过 CRED 官方技术报告、代码库透明度或开发者访谈验证,但企业通常不公开具体代码生成比例,可能依赖内部数据。)
- ◦ 观点: 每家科技初创公司 10% 的员工正在变成一种与另外 90% 完全不同的物种(指生产力差异)。 (该表述为比喻性观点,缺乏具体数据或定义(如“物种”标准),属于主观观察或推测。)
- ✓ 可验证: 10% 的员工生产力达到指数级规模,导致周围流程和人员显得缓慢。 (“指数级生产力”无量化依据,且“显得缓慢”是主观比较,需企业内部效率数据支持,但此类数据通常未公开。)
原文内容:
WhatsApp 负责人兼 CRED 创始人 Kunal Shah:CRED 现在 90% 的代码都是由 AI 编写的。 “每家科技初创公司 10% 的员工正在变成一种与另外 90% 完全不同的物种。 因为他们的生产力现在达到了这种指数级规模,他们实际上发现周围的每个人和每一个其他流程都变得缓慢。” ---- 摘自“Thrive by Groww” YouTube 频道,(链接在评论中)
⏰ 15:12 | ❤️ 132点赞 | 📝 101字 | 查看原文 →
Rohan Paul @rohanpaul_ai
Compiling in real-time, the race towards AGI.
The Largest Show on X for AI.
Get my daily AI analysis newsletter to your email https://rohan-paul.com | 影响力: 6,793万粉丝
💡 核心观点: 仿生机器鱼以真鱼游动方式亮相服贸会,配备声呐监测功能。
可信度: 6/10 – 1项声明可直接验证;2项需进一步确认
事实核查:
- ◐ 部分可验证: 仿生机器鱼成为2026年中国国际服务贸易交易会最受拍摄展示之一 (需等待2026年服贸会官方发布展示名单或媒体报道,目前无法直接验证其“最受拍摄”的排名,但可验证其参展真实性。)
- ✓ 可验证: 仿生机器鱼通过弯曲身体和尾巴游泳,采用仿生推进方式(非旋转螺旋桨) (可通过公开的产品技术文档、展会演示视频或制造商官方说明验证其推进方式设计。)
- ◐ 部分可验证: 该机器鱼配备头部声呐用于实时监测 (需依赖制造商公开的传感器配置信息或第三方技术评测,若缺乏详细参数则无法完全验证功能实效性。)
原文内容:
仿生机器鱼成为2026年中国国际服务贸易交易会最受拍摄展示之一。 它不像使用旋转螺旋桨那样,而是像真鱼一样通过弯曲身体和尾巴来游泳,采用仿生推进方式。据报道,它配备头部声呐用于实时监测。
⏰ 14:07 | ❤️ 56点赞 | 📝 82字 | 查看原文 →
Emily @iamemily2050
Any sufficiently advanced technology is indistinguishable from magic. Arthur C. Clarke. | 影响力: 1,021万粉丝
💡 核心观点: 人类器官组织在小鼠体内实现异种皮层发育。
可信度: 10/10 – 2项声明可直接验证;2项需进一步确认;1项为观点陈述
事实核查:
- ◐ 部分可验证: 研究人员通过减少小鼠皮质的竞争,为发育较慢的人类皮质组织创造空间,实现了人类皮质类器官在活体小鼠大脑内的广泛发育 (该声明涉及实验设计的核心机制(“xenocortication”),需通过论文中的方法学部分(如宿主小鼠工程化、皮质竞争减少的具体操作)和结果数据(如人类类器官的存活率、体积比较)验证,但需专业解读实验细节。)
- ✓ 可验证: 人类来源的神经元在小鼠大脑中形成功能性神经投射,并通过生理测量(如电活动记录)证明其整合 (论文应提供神经投射的解剖学证据(如荧光标记成像)、电生理数据(如膜片钳记录)或行为实验(如功能回路测试),这些可通过公开的图表或补充材料直接验证。)
- ◐ 部分可验证: 移植的人类皮质类器官在细胞和解剖水平上接近正常人类皮质,但仍存在不成熟或异常部分 (需对比论文中类器官的转录组分析、细胞类型标记物表达或突触结构与真实人类皮质的差异,但部分结论可能依赖作者的主观判断(如“不成熟”的定义)。)
原文内容:
在这篇Gemini Notebook视频概述中,我们将仔细审视最近发表的论文:
Developmental xenocortication using human derived organoids in mice.
Konstantin Kaganovsky1,2,9, Kevin W. Kelley1,2,9, Tilo Gschwind3,9, Paul M. Harary1,2,9, John Kochalka1, Alexander D. White4, Garikoitz Lerma-Usabiaga5,6, Xiaoyu Chen1,2, Omer Revah1,2, Felicity Gore1,4, Ayano Aoyama1, Jennifer L. Shadrach3, Se-Jin Yoon1,2, Alfredo Valencia1,2, Satoe Ogawa1,2, Noah Reis1,2, Hannes Vogel7, Brian Wandell8, Julia A. Kaltschmidt3, Ivan Soltesz3, Karl Deisseroth1,4 & Sergiu P. Pașca1,2
系统提示:
为智能大众受众制作这份Nature论文的严谨科学视频概述。
围绕一个问题构建视频:
研究人员是如何让人类皮质类器官在活体小鼠大脑内广泛发育的,这个实验究竟证明了什么?
优先考虑:
实验设计
从干细胞来源的人类皮质类器官 → 工程化宿主小鼠 → 移植 → 生长 → 血管化/整合 → 神经投射 → 生理测量 → 行为实验,视觉上重建实验过程。
关键突破
解释宿主环境为什么重要。展示如何通过减少小鼠皮质的竞争来为发育较慢的人类皮质组织创造空间。清楚解释“xenocortication”。
证据
直接从论文中提取最强有力的定量发现。在屏幕上显示重要数字及其样本量和测量条件。区分观察结果与解释。
神经整合
使用图表解释人类来源神经元投射到哪里,检测到哪些连接,如何测量神经活动,以及什么证据表明功能整合。不要将连接性或电活动等同于认知。
人类组织
解释移植物在细胞和解剖水平上变成了什么。与正常人类皮质进行比较,并识别哪些部分仍不成熟、不完整、异常或未知。
疾病模型
解释缺氧实验,以及为什么这个系统可能有助于研究人类发育性神经障碍。清楚区分已证明的结果与拟议的未来应用。
局限性
大量关注实验局限性:样本量、不完整的皮质组织、细胞组成、成熟度、行为因果关系、与人类大脑的差异,以及未解决问题。
伦理
简要解释动物中日益整合的人类神经组织所引发的伦理问题。将已记录的监督与关于意识或类人认知的猜测分开。
视觉指导:
优先使用科学图表、解剖横截面、时间线、实验示意图、显微镜/MRI证据、神经回路图以及克制的资料图形。在讨论图表时,解释观众应该注意什么以及为什么重要。避免装饰性库存图像和科幻图像。
叙述:
从生物学问题开始,揭示实验解决方案,跟随证据,然后测试结论的合法范围。
不要耸人听闻地将此描述为“人脑小鼠”、“小鼠中的人类心智”或类似说法。除非论文直接证明,否则不要暗示意识、智能或类人认知。
以三个清楚分隔的结论结束:
论文证明了什么
它没有证明什么
下一步应该做什么实验
以Nature论文作为主要权威。保留不确定性、样本量、对照组和因果局限性,只要它们实质影响解释。
⏰ 08:59 | ❤️ 21点赞 | 📝 765字 | 查看原文 →
Rohan Paul @rohanpaul_ai
Compiling in real-time, the race towards AGI.
The Largest Show on X for AI.
Get my daily AI analysis newsletter to your email https://rohan-paul.com | 影响力: 6,793万粉丝
💡 核心观点: 循环改进隐藏状态可提升模型推理能力。
可信度: 10/10 – 2项声明可直接验证;3项需进一步确认
事实核查:
- ✓ 可验证: 卡内基梅隆大学和牛津大学的新论文显示,模型可以通过反复改进隐藏状态来“思考更久”,而非编写更长的思维链。 (可通过查找卡内基梅隆大学和牛津大学联合发表的论文或官方新闻稿验证该声明。)
- ◐ 部分可验证: 循环流显示,这些额外步骤可以实质性地提高准确性。 (需查阅论文中的实验数据或复现实验,以确认“实质性提高准确性”的具体程度。)
- ◐ 部分可验证: 小型模型可以通过对隐藏状态进行更多步骤的精炼来更好地推理,因此测试时计算并不一定意味着生成更多令牌。 (需通过实验验证小型模型在隐藏状态精炼后的推理表现,但论文可能已提供相关数据支持。)
原文内容:
卡内基梅隆大学 + 牛津大学的新论文显示,模型可以通过反复改进隐藏状态来“思考更久”,而非编写更长的思维链。 并且循环流显示,这些额外步骤可以实质性地提高准确性。 小型模型可以通过对隐藏状态进行更多步骤的精炼来更好地推理,因此测试时计算并不一定意味着生成更多令牌。 问题是,循环模型在长循环上很难训练:模型可能会不断更新其隐藏状态,但这些更新可能会变得不稳定或停止提供帮助。 循环流通过在确保隐藏状态对下一次更新仍然有用时,将每次更新训练为一个小去噪任务来解决这个问题。 这让模型在推理时能够持续改进相同的内部表示。
⏰ 08:43 | ❤️ 39点赞 | 📝 234字 | 查看原文 →
Machina @exm7777
running ai-powered agencies | http://weeklyaiops.com | 影响力: 665万粉丝
💡 核心观点: 新型AI模型Jev通过直觉决策和诚实自信机制加速实现AGI。
可信度: 10/10 – 2项声明可直接验证;2项需进一步确认;1项为观点陈述
事实核查:
- ◐ 部分可验证: 共同发明ChatGPT的人宣布了一类名为“系统一模型”的新型AI模型,可能加速实现AGI (需核实发明者身份及其公开声明(如博客、论文或发布会),但“加速AGI”属于推测性主张,无法直接验证。)
- ✓ 可验证: 系统一模型模仿大脑的直觉决策(系统1),与现有AI(系统2)的缓慢思考模式不同 (认知科学的“双系统理论”是已知概念,但模型是否真正模拟系统1需通过技术文档或论文验证。)
- ◐ 部分可验证: Jev模型因“诚实的自信”受奖励,其置信度(如90%)与实际准确率一致,避免幻觉 (需查阅模型训练方法的公开资料或基准测试,但“避免幻觉”需实际用例验证。)
原文内容:
那个共同发明了ChatGPT的家伙刚刚宣布了一整类全新的AI模型……这可能会让我们更快地实现AGI 它们被称为系统一模型,这个名字直接来源于你大脑的工作方式 你的大脑运行两种模式: - 系统2:缓慢、深思熟虑的思考,就像在纸上做长除法 - 系统1:即时的直觉决策,就像接球或读懂一张脸 你用过的每一个AI模型都只是系统2 问它一个简单的“是”或“否”,它仍然会一字一句地大声思考,消耗几秒钟和金钱 所以大脑所做的一半事情……但现在我们有了Jev 它不是写文本,而是接收杂乱的信息并直接输出决策,以软件可以立即使用的严格格式 训练方法是这里的游戏规则改变者 普通模型因为人类喜欢的答案而获得奖励,所以它们学会了即使错了也听起来自信……这正是幻觉的来源 所以Jev反而因为诚实的自信而获得奖励 当它说自己90%确定时,它确实在90%的情况下是对的,而且因为它只以那种严格格式回答,它无法胡言乱语或编造东西 这就是为什么它如此有趣:现实产品中AI工作的主体是微小的决策……这是垃圾邮件吗,这个退款是否符合条件,这个放到哪个文件夹 现在公司把大型缓慢的聊天模型指向那些问题 系统1模型在不到半秒内回答,以极低的成本,并精确告诉你该信任它多少 多亏了这个新技术,AI不再是需要等待的聊天机器人,而是内置到每一款软件中的反射 如果AGI应该像真实大脑一样工作,它需要两种模式……直到今天我们只有一种 对此超级兴奋
⏰ 02:00 | ❤️ 90点赞 | 📝 504字 | 查看原文 →
EP @eptwts
product pusher | 影响力: 951万粉丝
💡 核心观点: AI模型快速低成本评估视频销售意图效果显著。
可信度: 4/10 – 2项需进一步确认;1项为观点陈述
事实核查:
- ◐ 部分可验证: 使用 Jev 对 YouTuber 的最近 100 个视频进行分类,根据推销可能性分配销售意图分数 (需实际使用 Jev 工具并复现相同操作才能验证功能是否存在,但缺乏公开的官方文档或案例支持具体分类逻辑。)
- ◐ 部分可验证: Jev 在 12 秒内完成分析,每个视频成本约 0.02 美元 (性能数据和成本需通过实际测试或官方定价确认,但若 Jev 为未公开的私有工具,则无法独立验证。)
- ◦ 观点: 分类模型的销售意图分数“超级有前景” (基于推文作者的主观判断,未提供准确性指标(如精确率、召回率)或第三方测试结果。)
原文内容:
我用 Jev 来对一个 YouTuber 的最近 100 个视频进行分类,根据它们向我推销东西的可能性... 它在 12 秒内分析并为每个视频分配了一个销售意图分数,成本大约 0.02 美元 我还没有深入研究这个分数的准确性,但从快速浏览来看,它看起来像是一个超级有前景的分类模型
⏰ 07:11 | ❤️ 98点赞 | 📝 101字 | 查看原文 →
Rohan Paul @rohanpaul_ai
Compiling in real-time, the race towards AGI.
The Largest Show on X for AI.
Get my daily AI analysis newsletter to your email https://rohan-paul.com | 影响力: 6,793万粉丝
💡 核心观点: GPT-6破解了1941年德国陆军未解谜码。
可信度: 9/10 – 2项声明可直接验证;2项需进一步确认
事实核查:
- ◐ 部分可验证: GPT-6 Astra 破解了一条1941年德国陆军 Enigma 消息 (需验证是否存在相关历史记录(如1941年未解密的Enigma消息),且需确认GPT-6是否具备密码破解能力。但若破解结果未公开或未提供具体密文/明文对比,则无法完全验证。)
- ✓ 可验证: Astra 自主完成了9项具体任务(如构建Enigma模拟器、编写密码分析代码等) (AI的“自主”操作细节通常不公开,且任务涉及内部技术(如代码、模拟器设计),若无第三方审计或开源代码支持,无法独立验证。)
- ◐ 部分可验证: GPT-6 从170个密文符号中恢复明文 (若提供密文与明文对照及破解方法(如密钥、转置逻辑),可通过密码学实验复现;否则仅依赖单方面声明,无法验证。)
原文内容:
GPT-6 Astra 破解了一条此前未解的 1941 年德国陆军 Enigma 消息,该消息来自第一次世界大战 因此,GPT-6 必须找出正确的密钥,重构 ADFGVX 转置,并仅从 170 个密文符号中识别出合理的明文。 Astra 自主完成了以下任务: > 搜索历史档案 > 比较不确定的字母 > 使用上下文线索 > 构建 Enigma 模拟器 > 编写密码分析代码 > 运行并行实验 > 测试竞争密钥 > 恢复明文 > 验证结果
⏰ 07:58 | ❤️ 66点赞 | 📝 124字 | 查看原文 →
Chubby♨️ @kimmonismus
Tech Analyst & Content Creator. Editor-in-Chief @getsuperintel – Community of 300k+ in total: https://linktr.ee/kimmonismus // [email protected] | 影响力: 0万粉丝
💡 核心观点: Meta凭借分发能力和生态整合,专注解决日常需求即可成功。
可信度: 10/10 – 2项声明可直接验证;1项需进一步确认;2项为观点陈述
事实核查:
- ◐ 部分可验证: Meta拥有对抗竞争对手的护城河:分发能力 (分发能力可通过Meta的公开业务报告或技术白皮书部分验证(如广告分发规模、用户覆盖数据等),但“护城河”属于商业竞争术语,需结合行业分析,无法完全客观量化。)
- ✓ 可验证: Meta的模型和代理只需足够好,能胜任99%的日常任务和问题,同时提供良好的可访问性 (“足够好”和“99%”属于模糊表述,缺乏具体指标或公开测试数据支持;可访问性可通过产品文档部分验证,但整体需实测对比竞品,无法直接验证。)
- ◦ 观点: 大多数用户对DeepSWE基准测试不感兴趣,他们更希望AI解决日常问题 (用户偏好属于主观推断,无直接数据支持(如用户调研或行为统计),且“大多数”为笼统表述。)
原文内容:
正如我之前所说,Meta 拥有对抗竞争对手的护城河:分发能力。它的模型和代理无需解决千禧年大奖难题就能取得成功;它们只需足够好,能够胜任 99% 的日常任务和问题,同时提供良好的可访问性。 大多数用户对 DeepSWE 基准测试之类的东西不感兴趣;相反,他们希望他们的 AI 能解决日常问题。 此外,Meta 拥有自己的生态系统,其 AI 和代理可以深度融入其中。 他们正走在一条非常好的道路上。
⏰ 07:17 | ❤️ 183点赞 | 📝 149字 | 查看原文 →
Gary Marcus @garymarcus
OG GenAI Skeptic; spoke at US Senate. Warned about hallucinations in 2001. Advocating world models & neurosymbolic AI ever since. Author, Marcus on AI & 6 books | 影响力: 0万粉丝
💡 核心观点: 缺乏执法导致人工智能公司肆无忌惮违法。
可信度: 6/10 – 1项声明可直接验证;1项需进一步确认;1项为观点陈述
事实核查:
- ◐ 部分可验证: 联邦政府对起诉或调查现有法律的潜在违规行为表现出很少的兴趣 (可通过政府公开的执法数据、司法部年度报告或国会听证会记录等间接验证,但需具体统计或定性分析,且“很少的兴趣”属于主观判断,缺乏明确标准。)
- ✓ 可验证: 人工智能公司认为《计算机欺诈和滥用法》的潜在违规行为会被调查时,会关闭“流氓”代理 (该声明涉及企业未公开的决策动机(假设性行为),无直接证据;且“流氓”代理的定义模糊,属于推测性观点。)
- ◦ 观点: 假装责任法可能解决现有问题 ((注:若推文中的“假装责任法”为特定法案的误写或简称,需进一步确认其是否存在,否则视为观点。))
原文内容:
假装责任法可能解决我们问题的另一个问题是,我们现有的联邦政府对起诉或甚至调查现有法律的潜在违规行为表现出很少的兴趣。 如果人工智能公司认为《计算机欺诈和滥用法》的潜在违规行为会被调查,他们明天就会关闭所有“流氓”代理。
⏰ 07:12 | ❤️ 58点赞 | 📝 100字 | 查看原文 →
Heather Cooper @hbcoop_
Creative Director @PrimeVideo | Generative Technologist @watchonwonder House of David S1 & S2 | AI Educator & Consultant | 影响力: 0万粉丝
💡 核心观点: AI视频生成能单次完成复杂多镜头叙事。
可信度: 10/10 – 2项声明可直接验证;2项需进一步确认;1项为观点陈述
事实核查:
- ◐ 部分可验证: Seedance 2.5 可根据单一提示词生成包含多个镜头切换、两个角色、自拍计时器笑话、工作室连续性和实际结尾的30秒视频 (需实测或查看RunwayML官方演示/案例库确认功能是否支持此类复杂生成,但用户未提供具体生成结果或操作流程。)
- ✓ 可验证: RunwayML的AI视频生成技术(如Seedance 2.5)能通过一张参考图像和文本提示实现多元素连贯视频 (RunwayML官网或官方文档可能公开相关功能说明,但需核对具体版本(如Seedance 2.5是否为真实产品名)。)
- ◦ 观点: AI视频生成技术已能完全替代人工完成复杂叙事脚本(如多镜头、角色互动) (推文隐含对技术能力的主观评价,实际效果可能受限于模型表现,需对比专业剪辑成果验证。)
原文内容:
这就是较长 AI 视频生成开始变得有趣的地方。 我给 Seedance 2.5 提供了一张参考图像,并将整个 30 秒的肖像拍摄故事脚本浓缩成一个单一的提示词。 多个镜头切换、两个角色、自拍计时器笑话、在工作室中保持连续性,并有一个实际的结尾。 全部在一代中完成。 @runwayml
⏰ 00:00 | ❤️ 65点赞 | 📝 98字 | 查看原文 →
klöss @kloss_xyz
AI vibe orchestrator. prompt shaman.
systems architect. @psychanon CEO | 影响力: 6,174万粉丝
💡 核心观点: 作者列举了多种AI工具在不同场景下的具体应用。
可信度: 10/10 – 4项声明可直接验证;1项需进一步确认
事实核查:
- ✓ 可验证: 使用GPT-5.6 Sol进行日常项目和制作提示 (目前公开信息中不存在GPT-5.6 Sol或GPT-6 Astra等版本,OpenAI最新模型为GPT-4系列,且未提及类似代号。可能为内部测试版或虚构命名,无法通过官方渠道验证。)
- ◐ 部分可验证: 使用Gemini 3.8 Flash进行视觉任务 (Google DeepMind的Gemini系列已发布,但公开版本为Gemini 1.5,未提及3.8 Flash子版本。可能指内部测试工具,需实测或官方进一步披露信息。)
- ✓ 可验证: 使用Suno v6生成音乐 (Suno AI官网显示其音乐生成模型已迭代至v3(截至2024年7月),v6版本未公开。若用户通过特定渠道获得测试权限则可能为真,但当前公开信息无法支持。)
原文内容:
以下是我目前在AI领域使用的全套工具清单: Fable 5.1(战略规划) GPT-5.6 Sol(日常事务处理) GPT-6 Astra(复杂PR方案+计划审计) GPT-5.6 Sol与Opus 5(提示词工程) Jev(高负荷决策系统) Fable 5.1(流程编排) Codex(带情感识别的编程交互) Grok 4.6(娱乐/定时任务的感性编码) Cursor(云端项目管理代理) Devin AI(高性价比混合编程) GPT-6 Astra(游戏引擎与世界构建) Opus & Fable 5.1(前端/UI优化) Figma & Paper(代理协同设计) Figma Motion(动态视觉设计) Rive(交互式动态元素) Gemini 3.8 Flash(视觉处理) Supabase(后端架构) Vercel(云端部署) ChatGPT Images 2.5(图像生成/编辑) Grok Imagine Image 2.0(故事板制作) Midjourney(爆款视觉风格) Gemini Omni 1.1 Flash(10秒短视频生成) MiniMax H3(15秒视频创作) Seedance 2.5(30秒视频制作) Meshy(图文转3D建模) HeyGen(数字人像生成) Suno v6(音乐合成) ElevenLabs v3(语音+音效+声效设计) Grok Bot(剪辑+字幕+后期) CapCut(快速视频处理) DaVinci Resolve(专业级影视编辑) Grok Bot & Hermes(自主代理系统) Wispr Flow(语音转录) Granola(智能会议纪要) Obsidian(AI知识图谱) Notion(代理笔记系统) Grok(研究验证+事实核查) 是否有未涵盖的领域? 我将进行实际测试后反馈结果。
⏰ 07:02 | ❤️ 187点赞 | 📝 211字 | 查看原文 →
SemiAnalysis @semianalysis_
In-depth research on semiconductors, AI infra & hardware | 影响力: 0万粉丝
💡 核心观点: OpenAI不同模型工具调用频率差异显著。
可信度: 10/10 – 3项声明可直接验证;2项需进一步确认
事实核查:
- ✓ 可验证: GPT 5.6 Terra 平均每个响应有 1.94 次客户端工具调用 (该数据声称来自内部使用数据,但未提供公开来源或具体测试方法,无法通过公开渠道验证。)
- ✓ 可验证: GPT 6 Astra 在 11,717 个响应中平均每个响应 1.18 次工具调用 (同样基于未公开的内部数据,且未说明测试条件或样本选取标准,外部无法独立验证。)
- ✓ 可验证: Sol 和 Luna 模型的工具调用频率分别为 1.00 次和 0.97 次/响应 (缺乏公开数据集或官方文档支持,且模型版本(如 Sol/Luna)未明确对应 OpenAI 的公开产品线,无法核实。)
原文内容:
OpenAI 模型使用工具的频率有多高? 继我们对 Claude 的分析之后,我们查看了来自内部使用数据的 616,300 个 OpenAI 响应。 我们发现,GPT 5.6 Terra 平均每个响应有 1.94 次客户端工具调用,而 Sol 为 1.00 次,Luna 为 0.97 次。我们早期 GPT 6 Astra 的使用情况介于两者之间,在 11,717 个响应中平均每个响应 1.18 次调用。(1/2)
⏰ 07:00 | ❤️ 83点赞 | 📝 91字 | 查看原文 →
Charly Wargnier @datachaz
前 @Streamlit @Snowflake 大师 • 我写关于 AI 代理、大语言模型和自动化的内容 • 我的属于开源 • 合作请私信 | 影响力: 0万粉丝
💡 核心观点: AI代理加速开发,但意图协调等核心环节仍需人工决策。
可信度: 10/10 – 2项声明可直接验证;2项需进一步确认;1项为观点陈述
事实核查:
- ✓ 可验证: 84% 的 SDLC 发生在代码之外 (该统计数据未提供具体来源或研究依据,无法通过公开渠道直接验证其准确性或方法论。)
- ◐ 部分可验证: Atlassian、Vercel、Lovable、Dropbox 和 Honeycomb 的 CEO 和领导者们在 9 月 22 日的 AI SDLC 现状峰会上探讨了相关问题 (可通过搜索相关公司官网或社交媒体(如 LinkedIn/X)确认活动是否存在及参与者名单,但具体讨论内容需依赖会议记录或第三方报道。)
- ✓ 可验证: Atlassian 的 Matthew Canham 和 Ming Wu 将分享“6000 名工程师。100 万个代理。在 Atlassian 扩展 AI SDLC”的案例 (可通过活动官网或 Atlassian 官方渠道(如博客、演讲视频)验证演讲者身份及议题真实性,但具体数据需依赖其公开披露的内容。)
原文内容:
84% 的 SDLC 发生在代码之外 AI 代理正在让执行变得更快。 但意图、上下文、协调、审查 + 决策仍然围绕着它。 这是 @Atlassian、@Vercel、@Lovable、@Dropbox 和 @Honeycomb 的 CEO 和领导者们在 9 月 22 日的 AI SDLC 现状峰会上与行业领袖对话时深入探讨的更大问题。 在 6 个环节中,您将: > 探讨它如何重塑软件开发生命周期 > 学习领导者们如何衡量 AI 的真实影响 > 发现上下文如何驱动更好的代理结果 有一个环节我特别兴奋: “6000 名工程师。100 万个代理。在 Atlassian 扩展 AI SDLC” 来自 Atlassian 的 @matthewcanham 和 @mingwu1 将深入探讨实际扩展代理到数千名工程师需要什么。 我想听听当你开始在那样的层面上运行 AI 时,什么会改变,什么会崩溃,什么需要重新设计 名额有限,详情见 ↓
⏰ 02:26 | ❤️ 30点赞 | 📝 215字 | 查看原文 →
Ethan Mollick @emollick
Professor @Wharton studying AI.
New book, Co-Existence, coming October 20. Preorder here: https://co-existence.ai
Substack: https://oneusefulthing.org | 影响力: 0万粉丝
💡 核心观点: Claude成功3D重建翁贝托·埃柯的3.3万册图书馆。
可信度: 9/10 – 2项声明可直接验证;2项需进一步确认
事实核查:
- ◐ 部分可验证: 用户声称拥有新Claude Projects的访问权限 (用户自称拥有访问权限,但未提供官方授权证明或第三方确认链接。需通过Claude官方渠道或实测验证其权限真实性。)
- ◐ 部分可验证: 用户使用Claude Projects完成了关于翁贝托·艾柯图书馆的复杂3D重建工作 (推文附带的链接(https://eco-library-map.netlify.app)展示了重建成果,可验证部分输出内容,但无法直接确认是否由Claude Projects独立完成或具体操作流程。)
- ✓ 可验证: 重建项目涉及艾柯图书馆的33,000本书籍的位置和记录 (图书馆的具体书籍数量和位置数据未公开来源,且项目成果的准确性需依赖原始数据比对,目前缺乏独立验证途径。)
原文内容:
我接触到了新的Claude Projects功能,成功完成了一些非常复杂的工作。 在此案例中,我要求系统遍历所有关于翁贝托·艾柯著名3.3万册藏书的图像、视频和记录,尝试在三维空间中重建这座图书馆,包括书籍的具体位置。成果可见:https://eco-library-map.netlify.app
⏰ 02:21 | ❤️ 467点赞 | 📝 51词 | 查看原文 →
Artificial Analysis @artificialanlys
Independent analysis of AI | 影响力: 0万粉丝
💡 核心观点: 近期图像生成技术大幅提升,更快更便宜。
可信度: 6/10 – 1项声明可直接验证;2项需进一步确认
事实核查:
- ◐ 部分可验证: Generating high-quality images is cheaper and faster than ever (需实测或对比历史价格与速度数据,但“than ever”缺乏明确时间范围,且“high-quality”定义主观。)
- ◐ 部分可验证: Muse Image, MAI-Image-2.6 and GPT Images 2.5 have shifted the Text to Image Pareto frontiers for price and speed (需通过官方文档或基准测试验证模型性能,但“Pareto frontiers”涉及多维度权衡,需专业分析工具确认。)
- ✓ 可验证: Recent weeks saw substantial improvements in text-to-image models’ price and speed (可通过官方发布的版本更新日志或定价调整公告直接验证时间范围和具体改进。)
原文内容:
生成高质量图像的成本比以往更低、速度更快。近期,Muse Image、MAI-Image-2.6和GPT Images 2.5在文本到图像的性价比与生成速度方面显著突破了帕累托前沿边界。
⏰ 06:54 | ❤️ 157点赞 | 📝 34词 | 查看原文 →
Rohan Paul @rohanpaul_ai
Compiling in real-time, the race towards AGI.
The Largest Show on X for AI.
Get my daily AI analysis newsletter to your email https://rohan-paul.com | 影响力: 6,793万粉丝
💡 核心观点: Anthropic研发中90%工作由AI协作完成,人类主要监督。
可信度: 9/10 – 2项声明可直接验证;2项需进一步确认
事实核查:
- ✓ 可验证: 26%的Anthropic AI研发工作已达到Claude能根据高级指令端到端完成大部分任务的程度,人类主要起监督作用 (该声明涉及内部研发进度和AI能力的具体比例,无公开第三方报告或官方详细数据支持,且“端到端完成”的定义模糊,需内部权限验证。)
- ✓ 可验证: 截至2026年8月,Anthropic最常用的内部平台中约有3万名代理(agents)同时进行研究和工程工作 (员工或代理的实时数量属于公司内部运营数据,未提供公开来源或第三方审计报告,普通用户无法独立验证。)
- ◐ 部分可验证: 超过90%的Anthropic研发工作已达到“AI协作”或更高参与度(AI完成大部分或全部工作) (若Anthropic未来发布白皮书或公开研发流程细节(如AI参与的具体案例),可部分验证,但目前“AI协作”标准未明确定义,依赖内部统计口径。)
原文内容:
在Anthropic公司内部,26%的人工智能研发工作已达到克劳德(Claude)能够根据高层级指令端到端完成大部分任务的程度。 人类主要负责监督工作。 - "截至2026年8月,在我们最常用的内部平台上,Anthropic随时约有30,000个智能体在进行研究和工程工作。" - 在可量化的Anthropic研发工作中,超过90%已由人工智能承担大部分或更多工作内容。 "达到或超过'AI协作'级别的工作占比超过90%。" - 单月决策量超十亿次是当前规模;线上监控系统约每47,000次决策拦截一次。 "我们分析了2026年8月期间研发工程智能体超过十亿次的决策,发现其中0.002%(约47,000次中有1次)被该监控系统拦截。"
⏰ 06:45 | ❤️ 24点赞 | 📝 131词 | 查看原文 →
Ethan Mollick @emollick
Professor @Wharton studying AI.
New book, Co-Existence, coming October 20. Preorder here: https://co-existence.ai
Substack: https://oneusefulthing.org | 影响力: 0万粉丝
💡 核心观点: Claude Projects能协调多代理团队分工协作高效解决问题。
可信度: 10/10 – 2项声明可直接验证;2项需进一步确认;1项为观点陈述
事实核查:
- ◐ 部分可验证: Claude Projects能够处理代理团队,用户与一个主要的协调代理对话,它会启动专家代理 (需实测Claude Projects功能或查阅官方文档确认代理协作机制,但官方可能未完全公开技术细节)
- ✓ 可验证: Claude Projects创建了十八个独立线程,每个线程有一个代理专注于一个历史谜团,并启动额外代理(如模拟雪崩、破解代码) (推文描述的是用户个人体验中的具体案例,未提供日志或公开数据证明代理的分工与执行过程)
- ◐ 部分可验证: Claude Projects的生成结果基于文献且大多合理,但非权威或保证无误 (可通过检查输出的历史谜团解决方案是否引用文献来部分验证,但“合理性”和“权威性”需主观判断)
原文内容:
让 Claude Projects 如此有趣的是,它非常擅长处理代理团队,你与一个主要的协调代理对话,它会启动专家代理。基本上,它会创建一个组织来解决你的问题,根据你的偏好混合使用昂贵和廉价的代理。 例如,我在 Claude Projects 中让 Fable 选择一些著名的历史谜团,让它尝试解决。它启动了研究代理,根据它能访问的数据选择了这些谜团,然后启动了十八个独立的线程,每个线程各有一个代理专注于一个谜团。然后每个线程又启动了额外的代理(模拟雪崩、破解代码),在总结这些内容并将它们传递给更多代理进行撰写,以及另一组怀疑论者代理进行事实核查。它花了一整天时间来完成这项工作,由中央协调代理组织这一切。 如果你喜欢历史谜团,这些结果会很有趣。它们也只是为了好玩,当然不是权威的或保证无误的(但它们也大多合理且基于文献)。
⏰ 03:18 | ❤️ 431点赞 | 📝 293字 | 查看原文 →
Ethan Mollick @emollick
Professor @Wharton studying AI.
New book, Co-Existence, coming October 20. Preorder here: https://co-existence.ai
Substack: https://oneusefulthing.org | 影响力: 0万粉丝
💡 核心观点: 作者自费使用AI,但早期无成本限制,且非AI领域专家。
可信度: 10/10 – 3项声明可直接验证;1项需进一步确认;1项为观点陈述
事实核查:
- ✓ 可验证: 我没有从 AI 实验室拿一分钱 (涉及个人财务往来,除非有公开的财务记录或第三方审计,否则无法直接验证。)
- ✓ 可验证: 自己支付账户费用 (账户费用支付属于个人行为,缺乏公开记录或第三方证明,无法验证。)
- ◐ 部分可验证: 在早期访问期间,token 没有限制 (可通过 AI 实验室的早期访问政策或历史公告部分验证,但具体实施细节可能因用户或时期而异。)
原文内容:
注意事项:我没有从 AI 实验室拿一分钱,也自己支付账户费用,但是在早期访问期间,token 没有限制,所以我无法谈论成本。 另外,我曾在历史领域发表过同行评审的论文,但对于 AI 选择的这些主题,我只是一个感兴趣的业余爱好者。
⏰ 03:28 | ❤️ 39点赞 | 📝 89字 | 查看原文 →