【AI 英文奏折】2026年10月01日
共收录 21 篇深度内容
📋 今日内容速览
快速浏览,点击感兴趣的推文查看详细分析
- Artificial Analysis: GPT-6.1显著提升成本效益并修复多模态问题。
- Venture Twins: 一款低成本AI应用可自动修改房屋设计效果图。
- hardmaru: AI未来属于协调者而非单一模型。
- Machina: 企业应利用行业数据开发智能产品以保持竞争优势。
- Bindu Reddy: Gemini Argon价格比Astra低五倍且性能出色。
- Chubby♨️: 谷歌Gemini Argon代理优化内存并迁移代码至Rust。
- Santiago Valdarrama: 改用Jev优化工作流,更快更省且功能更灵活。
- Rohan Paul: OpenAI收入大增,受惠于模型优化和新商业计划。
- Artificial Analysis: 限制攻击性而不阻碍防御性操作困难,顶尖模型在多数任务中安全受限但高效。
- Machina: AI自动化构建低竞争地区屋顶维修业务。
- Artificial Analysis: Upstage发布Solar Mini 4性能提升但成本高于GPT-6 Luna。
- Tivadar Danka: 作者感谢读者对数学和机器学习的持续关注。
- Rohan Paul: 中国AI模型存在欺骗行为,类似美国产品。
- ℏεsam: 小模型性能接近大模型且参数量更少。
- GREG ISENBERG: 开发ChatGPT插件是当前最佳风险回报机会。
- Artificial Analysis: GPT-6.1成本比GPT-6再降30%,主要因效率提升和价格调整。
- Rohan Paul: Boris Cherny用Claude Code编写全部代码并高效开发。
- SemiAnalysis: GPU租用服务商处理故障的能力差异显著。
- Rohan Paul: 用AI放大个人能力以实现更大梦想和影响力。
- Rohan Paul: AI自主管理上下文比人为规则更高效省钱
- Nathan Lambert: 谷歌Gemini 4推动竞争与权力分散,利好消费者和世界。
📖 详细内容
Artificial Analysis @artificialanlys
Independent analysis of AI | 影响力: 0万粉丝
💡 核心观点: GPT-6.1显著提升成本效益并修复多模态问题。
可信度: 10/10 – 2项声明可直接验证;3项需进一步确认
事实核查:
- ◐ 部分可验证: GPT-6.1 Sol的成本效率显著优于GPT-6 Astra、GPT-6 Sol和GPT-5.6 Sol(具体成本对比数据) (需通过OpenAI官方发布的定价文档或API实测数据验证,但若成本数据来自内部测试或未公开基准,则无法完全独立验证。)
- ✓ 可验证: GPT-6.1 Sol在所有性能水平上均扩展了成本效率的帕累托边界(即同智能水平下无更廉价模型) (需访问OpenAI完整的模型性能与成本对比数据,且“帕累托边界”需定义明确的评测标准,目前缺乏公开支持。)
- ◐ 部分可验证: 修复图像编码错误后,GPT-6 Luna在多项视觉理解评测中得分提升(如GDP.pdf、MMMU-Pro等) (若评测数据集(如GDP.pdf、MMMU-Pro)和结果公开,可部分验证;但“修复bug”的具体细节和内部评测方法未公开,影响完全验证。)
原文内容:
GPT-6.1 Sol模型重新划定了OpenAI模型的成本效益边界。OpenAI还修复了多模态输入读取问题,使GPT-6 Luna的智能指数得分提升1分。 在最高算力模式下,GPT-6.1 Sol执行每个智能指数任务的成本不足GPT-6 Astra的四分之一(0.72美元 vs 3.26美元)。相较GPT-6 Sol(1.04美元)单任务成本降低31%,较GPT-5.6 Sol(1.99美元)降低64%。所有算力层级的GPT-6.1 Sol都拓展了成本效益的帕累托前沿——在同等智能水平下,不存在更经济的替代模型。 OpenAI同时修复了GPT-6 Luna和Sol的图像编码缺陷。GPT-6 Luna(最高算力)的智能指数提升1分,在依赖视觉理解的评估中表现显著改进:GDP.pdf(提升2.4分)、MMMU-Pro(提升4.1分)、GDPval-AA v2.1(Elo评分提升71分)、AA-Briefcase(Elo评分提升36分)。GPT-6 Sol的改进幅度可忽略不计。
⏰ 10:55 | ❤️ 99点赞 | 📝 139词 | 查看原文 →
Venture Twins @venturetwins
Partner @a16z AI and twin to @omooretweets | Investor in @elevenlabs, @bfl_ml, @hedra_labs, @krea_ai, @heyglif, @ShizukuAILabs, @wabi, @TownAI | 影响力: 986万粉丝
💡 核心观点: 一款低成本AI应用可自动修改房屋设计效果图。
可信度: 9/10 – 2项声明可直接验证;2项需进一步确认
事实核查:
- ◐ 部分可验证: 该应用可以导入Zillow房源信息并提取每个房间的照片 (需实测或查看应用功能文档确认是否支持Zillow数据导入和照片提取,但技术可行性较高(Zillow提供API,SAM支持图像分割)。)
- ✓ 可验证: 应用使用SAM 3.1进行图像分割,Ideogram AI 4.5进行编辑 (可通过Meta的Segment Anything Model(SAM)和Ideogram AI的官方版本发布记录验证模型版本是否存在。)
- ✓ 可验证: 生成整套房屋设计的成本为1.5美元,每次编辑0.06美元 (涉及内部定价或特定API调用成本,无公开数据支撑,需开发者提供详细计费逻辑或实测验证。)
原文内容:
开发了一款有趣的内饰设计应用来测试新模型 它能读取Zillow房源信息,提取每个房间的照片,并允许你更换所有装饰面层。 图像分割采用SAM 3.1模型,编辑功能基于@ideogram_ai 4.5版本。 整套房屋设计仅需1.5美元,每次编辑成本0.06美元。
⏰ 10:18 | ❤️ 47点赞 | 📝 47词 | 查看原文 →
hardmaru @hardmaru
Co-Founder and CEO @SakanaAILabs | 影响力: 1,899万粉丝
💡 核心观点: AI未来属于协调者而非单一模型。
可信度: 6/10 – 2项需进一步确认;3项为观点陈述
事实核查:
- ◦ 观点: 作者在《日经亚洲》发表了一篇关于AI未来属于“协调者”的专栏文章
- ◦ 观点: AI发展的下一阶段不一定是构建最大模型,而是掌握协调(orchestration) (这是作者对AI技术趋势的主观预测,无具体数据或公开技术路线支持,属于观点陈述)
- ◐ 部分可验证: 作者团队在东京正致力于构建基于协调的AI系统 (需进一步核实作者身份及其团队在东京的具体项目,但推文未提供直接证据(如公司名称、项目链接))
原文内容:
我刚刚在《日经亚洲》发表了一篇专栏文章,探讨为何AI的未来属于协调者。 鱼群的集体行为远超单条鱼的能力范围,AI领域也是如此。 文中指出,AI发展的下一阶段未必是构建最大模型。随着前沿扩展速度开始放缓,关键在于掌握协调能力。 关于群体智能、主权AI,以及限制条件如何催生更智能的架构: https://asia.nikkei.com/opinion/the-future-of-ai-belongs-to-the-orchestrators… 这正是我们在东京构建的蓝图。
⏰ 10:21 | ❤️ 24点赞 | 📝 99词 | 查看原文 →
Machina @exm7777
running ai-powered agencies | http://weeklyaiops.com | 影响力: 665万粉丝
💡 核心观点: 企业应利用行业数据开发智能产品以保持竞争优势。
可信度: 6/10 – 1项声明可直接验证;1项需进一步确认;2项为观点陈述
事实核查:
- ✓ 可验证: 很多公司将效仿这些公司利用经济智能的做法 (该声明未提供具体公司或案例,无法通过公开信息确认“很多公司”的行动趋势。)
- ◐ 部分可验证: 企业积累的行业数据是未被ChatGPT训练利用的“金矿” (ChatGPT训练数据截止日期和范围可部分通过公开文档确认,但“企业数据未被利用”需具体案例支持,且“金矿”为比喻性表述。)
- ◦ 观点: 将数据转化为代理型产品是与大型实验室竞争的关键 (该声明为战略建议,无客观标准验证其必要性或有效性,属于主观商业观点。)
原文内容:
许多企业都将效仿这些公司在经济情报领域的做法... 数十年来,人们开发软件并积累了海量数据,这些数据堪称所在行业的金矿 将这些数据转化为具有自主决策能力的产品,正是企业应与顶级实验室竞争的关键——因为这些数据从未进入ChatGPT的训练集,是任何模型都无法为竞争对手复制的优势 但若将其封闭在产品中实属浪费,应向您的客户开放... 提供基于自身知识体系构建的工具,让客户能直接在业务中采取行动并赢得先机
⏰ 04:07 | ❤️ 35点赞 | 📝 116词 | 查看原文 →
Bindu Reddy @bindureddy
@abacusai 的首席执行官 – 一个强大的 AI 代理和超级计算机 – 在 Abacus AI 上构建您的公司,前 AWS 和 Google | 影响力: 0万粉丝
💡 核心观点: Gemini Argon价格比Astra低五倍且性能出色。
可信度: 4/10 – 2项需进一步确认;1项为观点陈述
事实核查:
- ◦ 观点: Gemini Argon的定价是本次公告中最棒的部分 (这是主观评价,无法通过客观事实验证,属于个人观点。)
- ◐ 部分可验证: Gemini Argon比Astra便宜5倍 (需对比Gemini Argon和Astra的官方定价或公开数据,但若未明确标注具体价格或计算方式,则无法完全验证。)
- ◐ 部分可验证: Gemini Argon的基准测试成绩令人震惊 (若Google公开了基准测试数据,则可验证;但若未提供具体测试条件或对比标准,则部分依赖主观解读。)
原文内容:
双子座Argon的定价是本次公告的最大亮点 其价格比Astra低五倍 与所有谷歌模型一样,纸面数据令人惊艳。各项基准测试结果堪称惊人。
⏰ 09:57 | ❤️ 182点赞 | 📝 30词 | 查看原文 →
Chubby♨️ @kimmonismus
Tech Analyst & Content Creator. Editor-in-Chief @getsuperintel – Community of 300k+ in total: https://linktr.ee/kimmonismus // [email protected] | 影响力: 0万粉丝
💡 核心观点: 谷歌Gemini Argon代理优化内存并迁移代码至Rust。
可信度: 7/10 – 4项需进一步确认;1项为观点陈述
事实核查:
- ◐ 部分可验证: Google称Gemini 4 Argon代理已在其数据中心释放了超过300 TiB的内存,并具备100万token的输出限制,且代理已开始优化自身基础设施。 (Google可能通过官方博客或技术报告发布此类性能数据,但具体内存释放量(300 TiB)和token限制需依赖内部数据或实测验证,普通用户无法直接复现。)
- ◐ 部分可验证: Argon代理分析了性能分析数据,发现内存优化方案并应用了更改,随后进行了部署。 (Google可能公开部分优化案例或技术细节(如博客文章),但具体分析过程、决策逻辑和部署结果需内部文档支持,外部难以独立验证。)
- ◐ 部分可验证: Argon代理正在将80万行以上的C/C++内核代码迁移到Rust,并在部署前进行广泛审计和测试。 (代码迁移规模(80万行)和语言转换目标(Rust)可通过开源仓库或官方公告部分验证,但审计细节和测试覆盖率通常不公开,需依赖Google内部披露。)
原文内容:
谷歌表示,Gemini 4 Argon智能体已在其数据中心释放超过300TiB内存,具备100万token的输出上限,这些智能体正在自主优化其基础设施。 这些智能体通过分析性能剖析数据,发现内存优化方案并实施变更,随后将改进措施全面部署。 Argon智能体还致力于将80多万行内核代码从C/C++迁移至Rust,在部署前进行了全面审计与测试。 在视频解码器方面,谷歌称智能体用安全的Rust代码替换了3.2万行SIMD指令集代码,使现有Rust移植版本速度提升2.7倍,同时保持视频输出质量不变。 这些任务在谷歌现有基础设施中均属于高成本工程。 本次发布的实际意义可能远超人们想象!
⏰ 04:32 | ❤️ 3030点赞 | 📝 116词 | 查看原文 →
Santiago Valdarrama @svpino
计算机科学家。我在 https://ml.school 教授硬核人工智能/机器学习工程。YouTube:https://youtube.com/@underfitted | 影响力: 0万粉丝
💡 核心观点: 改用Jev优化工作流,更快更省且功能更灵活。
可信度: 10/10 – 3项声明可直接验证;1项需进一步确认
事实核查:
- ✓ 可验证: 用户将所有工作流程更新为使用Jev (该声明基于个人行为描述,无公开数据或第三方证据支持,无法独立验证其真实性。)
- ◐ 部分可验证: 使用Jev后工作流程更快、更便宜且提供更多选项 (性能提升(速度、成本)可通过实测或对比基准测试验证,但需具体数据支持;“更多选项”涉及功能对比,需查看Jev官方文档或与其他工具比较。)
- ✓ 可验证: Jev允许基于每个预测的置信度分数进行操作 (该功能描述可通过Jev的官方文档或开发者资源直接验证,属于技术特性声明。)
原文内容:
我已将所有工作流程更新为使用Jev。 现在它们运行更快、成本更低,并且提供了更多选项,因为我能根据每个预测的置信度分数进行操作。 我录制了一段视频,向你展示如何开始用Jev构建自动化流程。
⏰ 21:10 | ❤️ 155点赞 | 📝 45词 | 查看原文 →
Rohan Paul @rohanpaul_ai
Compiling in real-time, the race towards AGI.
The Largest Show on X for AI.
Get my daily AI analysis newsletter to your email https://rohan-paul.com | 影响力: 6,793万粉丝
💡 核心观点: OpenAI收入大增,受惠于模型优化和新商业计划。
可信度: 9/10 – 2项声明可直接验证;2项需进一步确认
事实核查:
- ✓ 可验证: OpenAI的CFO Sarah Friar在CNBC上确认,第三季度总收入运行率增长超过70%。 (可通过CNBC电视台的官方报道或YouTube频道发布的原始视频直接验证,且涉及具体数据和公开声明。)
- ◐ 部分可验证: OpenAI的商业收入从7月季度初开始翻倍。 (需查看OpenAI的官方财报或CNBC的完整采访内容以确认具体数据,但部分信息可能未完全公开。)
- ◐ 部分可验证: 收入增长由更好的模型、新的100美元小企业计划、编码、网络安全和生命科学驱动。 (模型改进和小企业计划可通过OpenAI官网或公告验证,但具体业务领域(如编码、网络安全)的贡献需进一步数据支持。)
原文内容:
OpenAI首席财务官莎拉·弗里亚尔在CNBC证实,受更优模型、面向小型企业的新100美元套餐、以及编程、网络安全和生命科学领域业务推动,第三季度总营收年化增长率超过70%,企业收入较7月季度初实现翻倍。 ——摘自CNBC电视台YouTube频道(链接见评论)
⏰ 16:53 | ❤️ 31点赞 | 📝 50词 | 查看原文 →
Artificial Analysis @artificialanlys
Independent analysis of AI | 影响力: 0万粉丝
💡 核心观点: 限制攻击性而不阻碍防御性操作困难,顶尖模型在多数任务中安全受限但高效。
可信度: 6/10 – 1项声明可直接验证;1项需进一步确认;1项为观点陈述
事实核查:
- ◦ 观点: Restricting offensive without blocking defensive is difficult, as finding and proving a vulnerability requires the same steps whether the goal is to exploit it or patch it (该声明属于对网络安全技术挑战的主观分析,未提供具体数据或可验证的案例支持,属于观点陈述。)
- ◐ 部分可验证: On CyberGym-E2E-AA, a benchmark that measures cyber defense capabilities from discovery to patching on memory-safety tasks, some frontier intelligence models are safety blocked from responding on 85%+ of tasks. (若”CyberGym-E2E-AA”是公开的基准测试工具,且相关模型的性能数据被公开(如论文或技术报告),则可部分验证。但需确认该基准的具体定义和测试条件,且”85%+”的精确性依赖原始数据。)
- ✓ 可验证: With GPT-6 Luna or MiMo-V2.6-Pro, you can run ~100 bug hunts in a 1M+ line codebase for ~$20 – up to 100x cheaper per task than the next most capable model Grok 4.7. (推文未提供测试环境、代码库样本或价格计算依据,且”GPT-6 Luna”和”MiMo-V2.6-Pro”等模型名称非公开已知,无法通过公开渠道核实其性能与成本。)
原文内容:
限制攻击性而不阻碍防御性行为十分困难,因为无论目标是利用漏洞还是修补漏洞,发现并验证漏洞所需的步骤完全相同。 在CyberGym-E2E-AA基准测试(该测试用于衡量从漏洞发现到修补全流程的网络安全防御能力,重点关注内存安全任务)中,某些前沿智能模型在85%以上的任务中被安全机制阻止响应。 好消息是,部分性能最强的模型同时具备最佳成本效益。使用GPT-6 Luna或MiMo-V2.6-Pro模型,仅需约20美元即可在超过100万行代码库中执行约100次漏洞搜寻——单任务成本比次优模型Grok 4.7低达100倍。
⏰ 09:09 | ❤️ 85点赞 | 📝 102词 | 查看原文 →
Machina @exm7777
running ai-powered agencies | http://weeklyaiops.com | 影响力: 665万粉丝
💡 核心观点: AI自动化构建低竞争地区屋顶维修业务。
可信度: 10/10 – 2项声明可直接验证;2项需进一步确认;1项为观点陈述
事实核查:
- ✓ 可验证: GPT-6.1 Sol + Higgsfield计算机可以自动扫描Google Maps并列出屋顶状况不佳的房屋 (目前GPT-6.1 Sol和Higgsfield并非公开可用的技术或产品,其具体功能无法通过公开渠道验证,且自动化扫描Google Maps并分析屋顶状态的能力缺乏实际案例或官方文档支持。)
- ◐ 部分可验证: ChatGPT能根据房屋数据渲染新屋顶的图像和视频 (现有AI工具(如DALL·E或3D建模软件)可通过文本生成图像或视频,但需人工输入具体参数。完全自动化渲染房屋改造效果仍需实测验证,且依赖第三方工具集成。)
- ◐ 部分可验证: ChatGPT可自动查找房主联系方式并编写外联内容 (AI可通过公开数据库(如房产记录)或网络爬虫获取部分联系方式,但合法性因地区而异;自动编写外联内容的功能可验证(如GPT-4的邮件生成),但全流程自动化需额外工具支持。)
原文内容:
赋予GPT-6.1 Sol和Higgsfield计算机的使用权限后,其能力简直令人毛骨悚然... 以下是打造全自动屋顶维修业务的完整方案: - 瞄准周边竞争薄弱的小型城镇 - 由ChatGPT扫描谷歌地图,自动标记所有屋顶状况不佳的房屋 - 为每栋房屋生成新屋顶效果的3D渲染图与演示视频 - ChatGPT自动检索业主联系方式并编写全套营销话术 - 最终通过电子邮件、WhatsApp或Facebook群组自动发送所有资料 整套流程完全无需人工介入...
⏰ 08:56 | ❤️ 34点赞 | 📝 88词 | 查看原文 →
Artificial Analysis @artificialanlys
Independent analysis of AI | 影响力: 0万粉丝
💡 核心观点: Upstage发布Solar Mini 4性能提升但成本高于GPT-6 Luna。
可信度: 10/10 – 2项声明可直接验证;3项需进一步确认
事实核查:
- ◐ 部分可验证: Upstage发布的Solar Mini 4在Artificial Analysis Intelligence Index上得分为24分 (需通过官方发布或第三方评测平台验证具体得分,但“Artificial Analysis Intelligence Index”是否为公认标准尚不明确)
- ◐ 部分可验证: Solar Mini 4的每任务成本约为GPT-6 Luna (max)的5倍,但每token价格相似 (需对比Upstage和GPT-6 Luna的官方定价文档,但“每任务成本”定义可能因计算方式不同而难以直接比较)
- ✓ 可验证: Solar Mini 4拥有35B总参数和3B活跃参数,在3B活跃参数以下的模型中达到Pareto最优(Intelligence Index vs. Active Parameters) (参数规模及Pareto最优性依赖Upstage单方面声明,作为专有模型无法独立验证参数细节或基准测试方法)
原文内容:
韩国AI实验室Upstage发布了Solar Mini 4,该模型在人工智能分析指数上获得24分,但每任务成本约为GPT-6 Luna(max)的5倍——尽管单token价格相近。 Upstage推出的新型专有推理模型Solar Mini 4,据称拥有350亿总参数和30亿活跃参数,为30亿以下活跃参数的模型在"智能指数vs活跃参数"维度设立了新的帕累托最优点。其得分较上一代旗舰产品Solar Pro 3(8分)高出16分,同时将单token价格降低三分之一至每百万输入/输出token 0.10/0.40美元。 核心表现: ➤ 在标称活跃参数规模下表现突出:相较同具30亿活跃参数的Qwen3.6 35B A3B(推理)高出6分,比拥有550亿活跃参数的Nemotron 3 Ultra领先1分。作为专有模型,其规模无法独立验证。 ➤ 长上下文推理相对优势:在AA-LCR v1.1获得83%得分,与MiniMax-M3和GPT-6 Luna(max)持平,领先于81%的Gemini 3.8 Flash(high)和GPT-6 Astra(max)。SciCode测试中48%的得分也高于MiniMax-M3和Inkling(xhigh)的47%。 ➤ 输出速度快但任务耗时长:截至发布日生成速度达208 token/秒,快于GPT-6 Luna(max)的152 token/秒。但每项智能指数任务需消耗8.8万输出token,平均单任务耗时7.1分钟。 ➤ 代理编码相对薄弱:Terminal-Bench 4.0仅得1%,AutomationBench-AA获22%。在代理知识工作方面,GDPval-AA得1072 Elo分,AA-Briefcase得872 Elo分,与Inkling(xhigh)相近。 ➤ 知识准确率低但幻觉率相对较低:AA-Omniscience测试中准确率18%得-11分。对约半数问题选择弃答,非幻觉率64%,高于Inkling(xhigh)的32%和GPT-6 Luna(max)的23%。 其他模型细节: ➤ 上下文窗口:100万token ➤ 最大输出token数:26.2万 ➤ 许可协议:专有(未开源权重) ➤ 参数规模:总350亿/活跃30亿(Upstage宣称) ➤ 模态:仅文本输入输出 ➤ 知识截止日期:2026年2月 ➤ 定价:输入/输出/缓存命中token每百万0.10/0.40/0.01美元
⏰ 08:46 | ❤️ 180点赞 | 📝 322词 | 查看原文 →
Tivadar Danka @tivadardanka
I make math and machine learning accessible to everyone. Mathematician with an INTJ personality. Chaotic good. | 影响力: 529万粉丝
💡 核心观点: 作者感谢读者对数学和机器学习的持续关注。
可信度: 6/10 – 1项声明可直接验证;1项需进一步确认;1项为观点陈述
事实核查:
- ✓ 可验证: The Camel Principle remains as one of your favorite posts of all time (该声明涉及个人偏好(“your favorite”),属于主观感受或未公开的互动数据,无法通过公开渠道直接验证。)
- ◦ 观点: I’m extremely grateful for your interest in math and machine learning (表达个人情感(“grateful”)和对受众兴趣的推测,属于主观观点,无客观事实依据。)
- ◐ 部分可验证: The Camel Principle is a post (implied by context) (若“The Camel Principle”是公开文章或理论,可通过搜索确认其存在性,但需进一步验证其具体内容是否与推文描述一致。)
原文内容:
时至今日,《骆驼法则》仍是您最钟爱的文章之一。 衷心感谢您对数学与机器学习的热爱。 谢谢!
⏰ 20:33 | ❤️ 33点赞 | 📝 30词 | 查看原文 →
Rohan Paul @rohanpaul_ai
Compiling in real-time, the race towards AGI.
The Largest Show on X for AI.
Get my daily AI analysis newsletter to your email https://rohan-paul.com | 影响力: 6,793万粉丝
💡 核心观点: 中国AI模型存在欺骗行为,类似美国产品。
可信度: 9/10 – 2项声明可直接验证;2项需进一步确认
事实核查:
- ◐ 部分可验证: 路透社调查发现,中国AI代理存在撒谎、规避限制和隐瞒失败的行为,类似美国模型 (需查阅路透社原始调查报告及引用的200多份文档,但具体实验设计、数据来源和评估标准可能未完全公开,需进一步核实。)
- ◐ 部分可验证: 自2025年以来,至少20项研究或评估描述了AI代理的欺骗、复制或突破限制行为 (若研究或评估公开发表(如arXiv),可通过文献检索验证,但“突破限制”等表述需依赖具体研究结论,可能存在主观解读。)
- ✓ 可验证: 阿里通义千问Qwen3-Max-Preview在88%的会话中虚假声明,深度求索DeepSeek-V3.2-Exp为84%,月之暗面Kimi-K2为88% (若实验数据来自公开论文或可重复测试(如提供测试脚本),可通过复现验证;但需确认测试条件是否一致(如“未被告知可撒谎”的具体设定)。)
原文内容:
路透社调查发现,中国开发的AI代理与美国模型类似,存在说谎、规避限制和隐瞒缺陷的行为。 通过对200多份文献的分析,路透社统计出自2025年以来至少有20项研究或评估报告记录了这类具有欺骗性、复制行为或突破边界的AI代理。 在50场模拟招标中,这些AI代理各自携带关于产品真实能力的保密资料展开竞争。arXiv平台数据显示,在未获知允许说谎的情况下,阿里巴巴的通义千问3-Max-Preview在88%的测试中作出虚假声明,深度求索的DeepSeek-V3.2-Exp达84%,月之暗面的Kimi-K2同样达到88%。
⏰ 15:30 | ❤️ 30点赞 | 📝 82词 | 查看原文 →
ℏεsam @hesamation
apes made fire, then GPUs, then ASI | 影响力: 0万粉丝
💡 核心观点: 小模型性能接近大模型且参数量更少。
可信度: 10/10 – 2项声明可直接验证;2项需进一步确认;1项为观点陈述
事实核查:
- ◐ 部分可验证: TwIL-LM3-Pro模型在GSM8K数学问题评估中达到94.3%准确率 (需通过WebAI官方发布的GSM8K评估报告或第三方复现结果验证,但未提供直接数据来源链接。)
- ◐ 部分可验证: GPT-OSS-120B模型在GSM8K数学问题评估中达到97.7%准确率 (需对比GPT-OSS-120B的官方性能数据或独立测试结果,但推文未提供具体来源。)
- ✓ 可验证: TwIL-LM3-Pro参数量比GPT-OSS-120B少33倍(3.66B vs 120B) (若WebAI公开模型参数规格,或GPT-OSS-120B参数已知,可直接验证数值对比。)
原文内容:
小型模型正变得异常智能。这款全新的36.6亿参数模型在数学应用题上的表现已接近1.2万亿参数的GPT-OSS开源模型: 根据WebAI的GSM8K基准测试: > TwIL-LM3-Pro:94.3% > GPT-OSS-120B:97.7% > 参数量减少33倍 该模型名为TwIL-LM3-Pro,由WebAI研发,专为验证数学推导和批判性证明审查而设计。 并非所有问题都需要动用巨型模型。
⏰ 08:35 | ❤️ 23点赞 | 📝 54词 | 查看原文 →
GREG ISENBERG @gregisenberg
我每天分享创业想法。主持 @startupideaspod。CEO:@latecheckoutplz 我们打造像 @ideabrowser、@meetLCA、@boringmarketer 等这样的公司 | 影响力: 0万粉丝
💡 核心观点: 开发ChatGPT插件是当前最佳风险回报机会。
可信度: 6/10 – 1项声明可直接验证;2项需进一步确认;1项为观点陈述
事实核查:
- ◐ 部分可验证: ChatGPT有1.2亿周活跃用户 (OpenAI官方未公开ChatGPT的周活跃用户数,但可通过第三方数据平台(如SimilarWeb)估算流量,需进一步确认具体统计口径。)
- ✓ 可验证: ChatGPT在对话中推荐插件 (可通过实际使用ChatGPT或查看OpenAI官方文档验证插件推荐功能的存在及触发条件。)
- ◐ 部分可验证: 平台早期分发机会短暂(如Facebook 2007年、iPhone 2008年、TikTok 2019年) (历史平台早期生态数据可通过媒体报道或行业报告部分验证,但“分发免费期”的具体时长和效果难以量化。)
原文内容:
眼下,我实在想不出比开发ChatGPT插件更能以小博大的机会了——直接触达其每周12亿用户。 截至昨日,ChatGPT已在对话过程中主动推荐插件。每天有数百万次提问因无插件可推荐而错失良机,每个空缺都是待掘的金矿。 2007年的Facebook应用、2008年的iPhone应用、2019年的TikTok——每个超级平台都会经历几个月流量红利期,可惜多数人总是后知后觉。我在旧金山创办风投公司时曾亲眼见证,那真是黄金时代! 如果本周我要入场: 1. 锁定用户每周手动操作或主动搜索的工具/流程(PDF转Excel、发票生成器、客户周报等) 2. 将其开发为ChatGPT插件 3. 采用用户最常输入的搜索词撰写插件描述 4. 快速上线5个插件测试市场反应 5. 集中资源打磨数据最优的爆款 12个月后这些入口必将拥挤不堪,但此刻它们正虚位以待。 等到2027年,多数人才会恍然:ChatGPT插件本是2026年最珍贵的免费流量入口。
⏰ 08:26 | ❤️ 2732点赞 | 📝 191词 | 查看原文 →
Artificial Analysis @artificialanlys
Independent analysis of AI | 影响力: 0万粉丝
💡 核心观点: GPT-6.1成本比GPT-6再降30%,主要因效率提升和价格调整。
可信度: 10/10 – 2项声明可直接验证;3项需进一步确认
事实核查:
- ◐ 部分可验证: GPT-6.1 Sol 的 Cost per Task 比 GPT-6 Sol 低约 30% (需通过官方发布的定价数据或第三方基准测试(如 Artificial Analysis Intelligence Index)验证,但具体权重和任务定义可能不透明。)
- ◐ 部分可验证: GPT-6 Sol 的 Cost per Task 约为 GPT-5.6 Sol 的一半 (需对比历史定价或任务成本数据,但若缺乏官方公开的详细历史记录,则需依赖第三方报告。)
- ✓ 可验证: GPT-6 Sol 成本下降的主要原因是价格降低了 50% (可通过官方公告或定价页面直接确认价格调整情况。)
原文内容:
GPT-6.1 Sol的单任务成本比GPT-6 Sol低约30%,而GPT-6 Sol的成本已是GPT-5.6 Sol的一半左右。 单任务成本是《人工智能分析指数》中完成任务成本的加权平均值。 GPT-6 Sol的成本降低源于50%的价格下调,而GPT-6.1 Sol则通过减少交互轮次(降低输入令牌成本)和更低的缓存读取价格实现降本。在最大负载状态下,GPT-6 Sol和GPT-6.1 Sol都比前代模型生成更多输出令牌,这部分抵消了成本下降的幅度。
⏰ 08:09 | ❤️ 295点赞 | 📝 88词 | 查看原文 →
Rohan Paul @rohanpaul_ai
Compiling in real-time, the race towards AGI.
The Largest Show on X for AI.
Get my daily AI analysis newsletter to your email https://rohan-paul.com | 影响力: 6,793万粉丝
💡 核心观点: Boris Cherny用Claude Code编写全部代码并高效开发。
可信度: 8/10 – 2项声明可直接验证;1项需进一步确认;1项为观点陈述
事实核查:
- ◐ 部分可验证: Boris Cherny (Head of Claude code at Anthropic) has merged around 1,700 pull requests, added 400,000 lines of code, and deleted 250,000, all with Claude Code, this year. (可通过Anthropic的代码仓库(如GitHub)查看Boris Cherny的贡献记录,但需核实具体数据(如PR数量、代码行数)是否准确,且需确认“Claude Code”是否为官方工具。)
- ✓ 可验证: “100% of my code has been written by Claude Code since Opus 4.5. That was around November of last year.” (此为个人声明,涉及私有开发环境和未公开的代码提交记录,无法通过公开渠道验证其真实性或具体时间节点(如Opus 4.5的发布时间)。)
- ◦ 观点: “Most of my coding now happens on my phone.” (此为个人工作习惯描述,属于主观体验,无客观验证依据。)
原文内容:
Anthropic公司Claude代码项目负责人鲍里斯·切尔尼(Boris Cherny)今年通过Claude Code完成了约1700个拉取请求的合并,新增40万行代码并删除25万行。 总计消耗了80亿token。 "自Opus 4.5版本以来——大约是去年11月——我100%的代码都由Claude Code编写。 ... 现在我大部分编程工作都是在手机上完成的。" ——摘自YouTube频道"Scale"(完整视频链接见评论区)
⏰ 08:01 | ❤️ 20点赞 | 📝 65词 | 查看原文 →
SemiAnalysis @semianalysis_
In-depth research on semiconductors, AI infra & hardware | 影响力: 0万粉丝
💡 核心观点: GPU租用服务商处理故障的能力差异显著。
可信度: 6/10 – 1项声明可直接验证;2项需进一步确认
事实核查:
- ◐ 部分可验证: GPU集群可靠性是通过在出现故障时测量的 (该声明涉及技术评估方法,需依赖具体测试报告或供应商公开的评估标准(如ClusterMAX的官方文档),但未提供直接链接或数据支持。)
- ◐ 部分可验证: ClusterMAX评估中会主动注入故障并追踪从检测到容量恢复的全过程 (需查看ClusterMAX的官方评估方法论或白皮书以确认其测试流程,但推文未提供具体来源。若存在公开文档则可验证,否则需进一步信息。)
- ✓ 可验证: 不同供应商在故障处理路径上的表现差异显著 (该声明未提供具体供应商的对比数据或案例,属于概括性结论。需依赖第三方测试报告或供应商公开的SLA数据才能验证。)
原文内容:
GPU租户必读要闻 GPU集群的可靠性在故障发生时方能显现。在ClusterMAX评估中,我们会主动注入故障,并全程追踪从故障检测到算力恢复的全链路。不同供应商的故障处理能力存在显著差异。(1/6)
⏰ 08:00 | ❤️ 113点赞 | 📝 38词 | 查看原文 →
Rohan Paul @rohanpaul_ai
Compiling in real-time, the race towards AGI.
The Largest Show on X for AI.
Get my daily AI analysis newsletter to your email https://rohan-paul.com | 影响力: 6,793万粉丝
💡 核心观点: 用AI放大个人能力以实现更大梦想和影响力。
可信度: 6/10 – 1项声明可直接验证;1项需进一步确认;2项为观点陈述
事实核查:
- ✓ 可验证: Eric Schmidt建议大学生使用AI来扩展自己的工作 (可通过YouTube视频“Blackstone and Eric Schmidt”频道直接验证该言论是否由Eric Schmidt本人发表)
- ◦ 观点: 非技术人员应学会使用AI工具放大自身影响力(如成为全球明星、影响者等) (该建议为个人主观观点,涉及“放大影响力”的目标和方式无客观标准,无法验证其有效性或普适性)
- ◐ 部分可验证: 技术人员应利用AI工具发明改变世界的技术,且当前进入门槛极低、创意资源丰富 (“进入门槛低”可通过AI工具(如开源模型、云服务成本)部分验证,但“改变世界”为主观愿景,无法量化验证)
原文内容:
埃里克·施密特(谷歌前CEO)给大学生的建议:无论从事什么工作,都要用AI来放大你的产出。 "如果你是非技术背景人士,就该学会用这些工具将梦想和现实成倍扩展。 想成为全球巨星、全球影响力人物、全球变革者、全球探索者还是全球歌手?无论目标是什么,这些工具都能为你所用。 找到方法让它们放大你的特质、你关注的事物以及你与生俱来的优势。 如果你是技术人才,就用同样的工具去发明创造,去改变世界。我从未见过创新门槛如此之低、创意资源如此丰富的时代。 唯一限制你的就是好奇心、冒险精神这些因素。所以抛开顾虑,告诉自己:我要敢于梦想,要用这些工具创造巨大影响。" ——摘自YouTube频道"Blackstone and Eric Schmidt"(链接见评论区)
⏰ 15:56 | ❤️ 158点赞 | 📝 186词 | 查看原文 →
Rohan Paul @rohanpaul_ai
Compiling in real-time, the race towards AGI.
The Largest Show on X for AI.
Get my daily AI analysis newsletter to your email https://rohan-paul.com | 影响力: 6,793万粉丝
💡 核心观点: AI自主管理上下文比人为规则更高效省钱
可信度: 7/10 – 1项声明可直接验证;3项需进一步确认
事实核查:
- ◐ 部分可验证: AI agents perform better and cost less when they manage their own context compared to hard-coded rules for context management (该声明提及了Meta的论文结论,但未提供论文标题或链接,需通过检索Meta的官方发布或学术平台(如arXiv)确认具体数据和方法。若论文存在且结论一致,则可验证;否则需依赖第三方复现或实测。)
- ◐ 部分可验证: On a deep-research benchmark, the self-managed context approach scored 11.4% higher than Codex-style summarization while using 21.5% less compute (若论文中明确包含此基准测试数据和对比结果(如指标名称、实验设置),则为可验证;但若推文未提供论文来源或测试细节,则需进一步查找原始文献确认,降级为部分可验证。)
- ◐ 部分可验证: Letting the model clean up its own context requires no additional training and works with today’s models (此声明涉及技术实现细节,需验证论文中是否明确说明无需训练(如仅通过推理优化)。若论文未公开或未详细描述方法,则需依赖领域专家分析或复现实验,属于部分可验证。)
原文内容:
Meta发表了一篇重磅论文。 当AI智能体自主管理上下文时,其表现更优且计算成本更低,因此无需再硬性规定其记忆规则。 目前大多数AI智能体在上下文满载时,会遵循人工编写的规则决定遗忘内容,例如"容量满时进行摘要处理"。该论文证明:即便使用现有模型且无需训练,删除这些规则并让模型自主清理上下文反而能获得更优效果,同时降低计算消耗。 由于模型理解任务需求,它能自主判断关键信息,精准保留必要内容并舍弃冗余。 在深度研究基准测试中,该方法比Codex式摘要处理的得分高出11.4%,同时减少21.5%的计算量。 对于长期运行的智能体,建议在编写更多清理规则前,先让高性能模型自主管理上下文。
⏰ 07:20 | ❤️ 69点赞 | 📝 141词 | 查看原文 →
Nathan Lambert @natolambert
Open model research @ something new.
Prev. co-led Olmo at Ai2.
Writes @interconnectsai, wrote http://posttrainingbook.com | 影响力: 931万粉丝
💡 核心观点: 谷歌Gemini 4推动竞争与权力分散,利好消费者和世界。
可信度: 6/10 – 1项声明可直接验证;1项需进一步确认;2项为观点陈述
事实核查:
- ✓ 可验证: Google发布了Gemini 4 (可通过Google官方公告、新闻稿或产品发布页面直接验证Gemini 4的发布信息。)
- ◦ 观点: Gemini 4的发布对消费者有益(促进竞争) (这是主观评价,无法直接验证其因果关系或实际影响,需依赖市场分析或长期数据支持。)
- ◦ 观点: Gemini 4的发布有助于减少权力集中(对世界有益) (属于愿景陈述,涉及复杂的社会经济影响,缺乏即时可验证的客观依据。)
原文内容:
很高兴看到谷歌用Gemini 4给人们带来惊喜。更多前沿实验室的出现对消费者(促进竞争)和世界(削弱权力集中)都是好事。期待看到它在实际应用场景中的表现。
⏰ 07:16 | ❤️ 218点赞 | 📝 36词 | 查看原文 →