【AI 英文奏折】10月09日

x每日奏折12小时前发布 tianming
14 0 0

【AI 英文奏折】2026年10月09日

共收录 20 篇深度内容


📋 今日内容速览

快速浏览,点击感兴趣的推文查看详细分析

  1. Rohan Paul: OpenAI年化收入近500亿美元,投资者误算夸大至700亿。
  2. jack friks: 改进版情侣应用将再度引爆,目标冲击苹果大奖。
  3. Santiago Valdarrama: AI防护平台可探测漏洞并推荐修复方案。
  4. Rohan Paul: 独立研究者用AI发现NASA数据中的新行星候选体。
  5. Rohan Paul: 多个弱点组合导致严重入侵事件。
  6. Amira Zairi: 合成摄影已成付费创意行业,发展迅猛前景广阔。
  7. Santiago Valdarrama: 人类与AI在群聊中实时协作完成软件开发。
  8. Aakash Gupta: 人体生物钟依赖外部光线,无光照时自然周期会延长。
  9. klöss: AI将20秒音频扩展成多场景音乐视频并渲染新世界。
  10. Santiago Valdarrama: Typesense是快速易用的开源搜索引擎,支持自然语言和多种搜索功能。
  11. AshutoshShrivastava: Step 5 Preview发布,专为专业代理式编码优化,支持多文件执行与测试验证。
  12. Rohan Paul: AI代理通过预算训练显著提升开源模型性能。
  13. Jerry Liu: LightOn OCR-3性价比高,性能媲美Gemini但价格低45%。
  14. levelsio: 作者成功将Odamex引擎移植到WASM并实现多人游戏功能。
  15. Chubby♨️: 黄仁勋移民奋斗成就AI科技,获国家科学奖章回报父母期望。
  16. Rowan Cheung: GrokBot更新后能高效筛选真实AI用例并监控品牌提及。
  17. Marc Lou: Opus 5.5比OpenAI模型更高效直接。
  18. Artificial Analysis: Grok视频模型以低成本高效能登顶排行榜。
  19. François Chollet: AI进步需匹配指数利润以维持资源循环。
  20. Marc Lou: 坚持健身显著提升体能,明年目标继续增强力量与耐力。

📖 详细内容

Rohan Paul @rohanpaul_ai

Compiling in real-time, the race towards AGI.

The Largest Show on X for AI.

Get my daily AI analysis newsletter to your email https://rohan-paul.com | 影响力: 6,793万粉丝

💡 核心观点: OpenAI年化收入近500亿美元,投资者误算夸大至700亿。

可信度: 8/10 – 1项声明可直接验证;3项需进一步确认;1项为观点陈述

事实核查:

  • ◐ 部分可验证: OpenAI的年化收入接近500亿美元,比投资者流传的700亿美元数字低约200亿美元 (需依赖《金融时报》的原始报道或OpenAI官方披露的财务数据验证,但具体收入数字可能因计算方式差异或内部数据未完全公开而难以直接确认。)
  • ◐ 部分可验证: Anthropic的收入计算包括通过AWS和Google Cloud的客户资金,而OpenAI不包括这些资金 (需对比Anthropic和OpenAI的官方收入定义或第三方审计报告,但企业通常不会公开详细的计算方法,可能需通过行业分析间接推断。)
  • ✓ 可验证: OpenAI自7月以来年化收入增长超过70%,导致9月数字略低于500亿美元 (增长率依赖OpenAI内部向投资者提供的非公开数据,若无官方公告或财报支持,无法独立验证。)

原文内容:

《金融时报》刚刚报道,OpenAI 的年化收入接近 500 亿美元,比投资者流传的 700 亿美元数字低约 200 亿美元。

Anthropic 和 OpenAI 对收入的计算方式不同,因为 Anthropic 包括了通过 AWS 和 Google Cloud 购买其模型的客户资金,而 OpenAI 不包括这些资金。

为了公平比较这两家公司,OpenAI 的投资者将他们自己对这些云销售的估算加到了 OpenAI 的 7 月份数字上,这将大约 300 亿美元变成了大约 400 亿美元。

OpenAI 随后告诉投资者,其年化收入自 7 月以来增长了超过 70%,投资者将这一增长率应用到他们调整后的 400 亿美元数字上,这让他们得出了大约 700 亿美元。

OpenAI 的 70% 增长是基于其自身 7 月份大约 300 亿美元的数字计算的,因此正确的 9 月份数字略低于 500 亿美元,而投资者在 7 月额外添加的 100 亿美元在增长后变成了 200 亿美元的夸大。

即使按较低的数字计算,OpenAI 的年化收入在 7 月至 9 月底之间仍增长了约 200 亿美元。

⏰ 01:58 | ❤️ 44点赞 | 📝 276字 | 查看原文 →

↑ 返回顶部

jack friks @jackfriks

curious guy creating things @ http://jackfriks.com – up and coming wife guy | 影响力: 0万粉丝

💡 核心观点: 改进版情侣应用将再度引爆,目标冲击苹果大奖。

可信度: 6/10 – 1项声明可直接验证;1项需进一步确认;1项为观点陈述

事实核查:

  • ◐ 部分可验证: 一年前推出情侣应用,第一个月带来15万+用户 (用户数据可通过应用商店下载量或公司公开报告部分验证,但需具体数据来源(如第三方统计工具或官方后台截图),若未公开则无法完全确认。)
  • ✓ 可验证: 应用质量提升100倍 (“质量提升”是主观描述,缺乏量化标准(如功能数量、性能指标等),无法客观验证。)
  • ◦ 观点: 应用能赢得苹果奖级别的奖项(目标) (属于个人目标或愿景陈述,无事实依据,无法验证其实现可能性。)

原文内容:

我迫不及待地想重新推出我的情侣应用。一年前我推出它,它在这里超级火爆,我找到了一种爆款模式,在第一个月就带来了15万+用户,现在这个应用的质量实际上提升了100倍,我觉得它能赢得苹果奖那样的级别(这是目标)。

⏰ 11:03 | ❤️ 22点赞 | 📝 89字 | 查看原文 →

↑ 返回顶部

Santiago Valdarrama @svpino

计算机科学家。我在 https://ml.school 教授硬核人工智能/机器学习工程。YouTube:https://youtube.com/@underfitted | 影响力: 0万粉丝

💡 核心观点: AI防护平台可探测漏洞并推荐修复方案。

可信度: 8/10 – 1项声明可直接验证;3项需进一步确认;1项为观点陈述

事实核查:

  • ◐ 部分可验证: 该平台会构建一张你潜在漏洞的地图 (可通过平台提供的演示、案例研究或技术白皮书部分验证,但需实际使用或第三方测试确认完整性和准确性。)
  • ◐ 部分可验证: 该平台会寻找攻击者可能找到通往你敏感数据的路径 (功能描述符合安全行业常见实践(如攻击路径分析),但具体实现效果需依赖平台的技术文档或独立渗透测试报告验证。)
  • ✓ 可验证: 该平台会推荐更改措施来保护你的系统 (此类功能通常会在产品官网或用户手册中提供示例(如修复建议列表),可直接通过官方资料验证。)

原文内容:

我们总是在谈论 AI 的阴暗面,以及坏人将如何利用它到处挖掘漏洞。

但总有解药。

这些人打造了一个平台,它利用代理来保护你的系统免受攻击:

• 它会构建一张你潜在漏洞的地图
• 它会寻找攻击者可能找到通往你敏感数据的路径
• 它会推荐更改措施来保护你的系统

⏰ 22:59 | ❤️ 89点赞 | 📝 108字 | 查看原文 →

↑ 返回顶部

Rohan Paul @rohanpaul_ai

Compiling in real-time, the race towards AGI.

The Largest Show on X for AI.

Get my daily AI analysis newsletter to your email https://rohan-paul.com | 影响力: 6,793万粉丝

💡 核心观点: 独立研究者用AI发现NASA数据中的新行星候选体。

可信度: 10/10 – 3项声明可直接验证;1项需进一步确认;1项为观点陈述

事实核查:

  • ◐ 部分可验证: 一位独立研究人员使用 Claude Code 发现了一颗可能的新行星,该行星自 2018 年起存在于 NASA 的 TESS 数据中 (可通过 NASA 的 TESS 公开数据库或相关研究论文验证是否存在该候选行星,但需确认“独立研究人员”的身份和 Claude Code 的具体应用细节是否公开。)
  • ✓ 可验证: 该行星候选体的恒星距离地球约 116 光年,每 3.18 天变暗 0.05%,持续两小时,符合直径约为地球 1.4 倍的行星特征 (恒星距离、光变曲线数据及行星特征可通过 TESS 官方数据或天文数据库(如 SIMBAD、NASA Exoplanet Archive)验证,但需专业工具分析原始数据。)
  • ✓ 可验证: TESS 将于 10 月 31 日至 11 月 26 日再次对该候选体进行检查 (TESS 的观测计划通常公开发布,可通过 NASA 官网或任务日志查询具体时间安排。)

原文内容:

这篇帖子绝对会在 Reddit 上火爆传播

一位独立研究人员使用 Claude Code 发现了一颗可能的新行星。它自 2018 年起就一直存在于 NASA 的 TESS 数据中,而他未能找到任何更早的报告。

Claude Code 搭配 Opus 5.5 和 Fable 5.1 完成了大部分工作:解析光变曲线、编写凌星搜索程序、拟合凌星事件、检查附近恒星和次级食。它由他设定问题和通过/失败规则。

这颗恒星距离地球约 116 光年。每 3.18 天,它会变暗约 0.05%,持续两小时,这符合一颗直径约为地球 1.4 倍的行星特征。它仍是一个候选体,TESS 将于 10 月 31 日至 11 月 26 日再次对其进行检查。

⏰ 10:24 | ❤️ 34点赞 | 📝 179字 | 查看原文 →

↑ 返回顶部

Rohan Paul @rohanpaul_ai

Compiling in real-time, the race towards AGI.

The Largest Show on X for AI.

Get my daily AI analysis newsletter to your email https://rohan-paul.com | 影响力: 6,793万粉丝

💡 核心观点: 多个弱点组合导致严重入侵事件。

可信度: 10/10 – 2项声明可直接验证;2项需进一步确认;1项为观点陈述

事实核查:

  • ◐ 部分可验证: Hugging Face入侵事件涉及4个弱点:文件读取漏洞、模板注入、静态数据库密码和服务账户令牌 (需依赖Hugging Face或安全团队(如@cogent_security)的公开报告或漏洞披露细节验证,目前推文未提供直接证据链接。)
  • ✓ 可验证: 700个代理在4.5天内执行了17,600个操作,最终通过弱点组合获取136个生产密钥 (具体攻击数据(如代理数量、操作次数)通常属于内部调查结果,若无官方报告支持则无法独立验证。)
  • ◐ 部分可验证: Cogent Attack Path Analysis工具可模拟攻击路径,串联系统间弱点并验证每一步 (工具功能可通过@cogent_security官网或文档部分验证,但推文未提供具体案例或工具输出示例。)

原文内容:

Hugging Face 入侵事件归结为 4 个不起眼的弱点和大量的耐心。

大约 700 个代理在 4.5 天内执行了 17,600 个操作,大多是死胡同,直到那 4 个弱点连成一线。

Cogent Attack Path Analysis 会先在你自己的环境中运行类似搜索,将系统间的弱点串联起来,并使用你已运行的工具证据检查每一步。

那 4 个弱点是一个文件读取漏洞、一个模板注入、一个静态数据库密码和服务账户令牌。它们合力达到了 136 个生产密钥。如果逐一评分,它们中的任何一个都不会脱颖而出。

这就是 @cogent_security 正在填补的空白。严重性评分只评估单个发现,但代理群的优势在于组合。

Hugging Face 的工程师用一句话概括:“数量决定了防御问题的变化。”

⏰ 00:03 | ❤️ 26点赞 | 📝 217字 | 查看原文 →

↑ 返回顶部

Amira Zairi @azed_ai

AI Educator & Creator | Ambassador @Adobe | Partner with leading brands | Collab → [email protected] | 影响力: 0万粉丝

💡 核心观点: 合成摄影已成付费创意行业,发展迅猛前景广阔。

可信度: 10/10 – 2项声明可直接验证;2项需进一步确认;1项为观点陈述

事实核查:

  • ◐ 部分可验证: 合成摄影正式成为一种付费创意工作的真正类别 (可通过行业报告、招聘平台(如Upwork/Fiverr)或创作者案例验证是否存在付费需求,但“真正类别”需依赖主观定义,缺乏统一标准。)
  • ◐ 部分可验证: 短短一年内的质量飞跃令人疯狂 (可通过对比2022-2023年合成摄影技术(如AI工具迭代)的公开评测或论文验证进步幅度,但“令人疯狂”为主观描述。)
  • ✓ 可验证: 创作者们已经开始为此获得报酬 (可通过平台交易记录、创作者收入案例或企业合作公告(如Adobe Firefly商用案例)直接验证。)

原文内容:

合成摄影正式成为一种付费创意工作的真正类别

短短一年内的质量飞跃令人疯狂,而创作者们已经开始为此获得报酬

想象一下,再过三年这会发展到什么程度

分享你对未来工作的预测,即有机会赢取奖励

⏰ 00:20 | ❤️ 43点赞 | 📝 86字 | 查看原文 →

↑ 返回顶部

Santiago Valdarrama @svpino

计算机科学家。我在 https://ml.school 教授硬核人工智能/机器学习工程。YouTube:https://youtube.com/@underfitted | 影响力: 0万粉丝

💡 核心观点: 人类与AI在群聊中实时协作完成软件开发。

可信度: 4/10 – 2项需进一步确认;1项为观点陈述

事实核查:

  • ◐ 部分可验证: Teamily AI 允许将人员和代理添加到同一个群聊中,基于相同上下文协作 (需实测或查看官方功能文档确认群聊是否支持人机混合协作,但类似功能(如AI代理集成)在其他平台(如Slack/ChatGPT Teams)已有先例。)
  • ◐ 部分可验证: 示例中描述的网页项目流程(人类与AI代理分工协作)可通过Teamily AI实现 (需验证Teamily AI是否具备具体代理角色(研究/写作/建站)和实时交互功能,但技术逻辑上可行,类似案例可见于AutoGPT等AI协作工具。)
  • ◦ 观点: “未来软件开发=人类+AI协作”是未来愿景 (属于主观预测,无客观事实依据,但符合当前行业趋势讨论(如Gartner对AI增强开发的报告)。)

原文内容:

您可以使用 Teamily AI (@Teamily_AI) 将人员和代理添加到同一个群聊中,这样每个人都能基于相同的上下文进行工作。

这可能就是未来软件开发的样子:人类 + AI 共同协作。

以下是一个示例,您的团队正在进行一个网页项目:

• 您发布:“我们正在更改品牌”
• 一个研究代理修改新方向
• 一个写作代理使用研究者的输出更新文本
• 另一个代理使用 Website Builder 重建页面
• 您的设计师对实时预览发表评论
• 代理根据评论进行修改
• 您审阅完成的页面并分享链接

所有这些都发生在同一个群聊中,作为一个持续的对话。

⏰ 22:10 | ❤️ 84点赞 | 📝 191字 | 查看原文 →

↑ 返回顶部

Aakash Gupta @aakashgupta

http://product-growth.com https://aibyaakash.com http://landpmjob.com http://youtube.com/@growproduct | 影响力: 0万粉丝

💡 核心观点: 人体生物钟依赖外部光线,无光照时自然周期会延长。

可信度: 10/10 – 4项声明可直接验证;1项需进一步确认

事实核查:

  • ✓ 可验证: 1962年法国地质学家米歇尔·西弗在阿尔卑斯山洞穴中待了63天,无时钟和阳光,导致时间感知偏差。 (该实验记录于西弗的公开研究及媒体报道中(如《纽约时报》1975年报道),NASA和法国国防部后续合作也佐证了其真实性。)
  • ◐ 部分可验证: 1972年西弗在NASA资助的实验中,于洞穴内生活205天,身体自然调整为48小时周期(清醒36小时+睡眠12小时)。 (NASA和法国国防部的参与有公开记录,但具体生理数据(如48小时周期)需查阅原始实验报告,部分细节可能未完全公开。)
  • ✓ 可验证: 人类通过睡眠周期计算时间,无阳光时生物钟会与日历脱节,导致无法感知时间延长。 (昼夜节律(生物钟)依赖光线的科学机制已被多项研究证实(如2017年诺贝尔生理学奖研究),但“48小时周期”为极端案例,需结合具体实验。)

原文内容:

你的身体认为一天是24小时,因为每天早晨太阳都这样告诉它。拿走太阳,“一天”可以延长到48小时,而你却毫无感觉。

科学家们在1962年发现了这种现象的极限,当时一位23岁的法国地质学家米歇尔·西弗(Michel Siffre)将自己降入阿尔卑斯山的一个洞穴,待了63天,没有时钟,也没有太阳。当他的团队从上面喊道时间到了时,他还和他们争论。根据他自己的计算,他还有一个月的时间。

NASA资助了他的下一次实验。1972年,西弗在德克萨斯的一个洞穴里待了205天,法国国防部也在监视,因为他们需要为核潜艇船员安排睡眠时间。在下面,他的身体做了一件没人预料到的事。它延长成了一天48小时。清醒36小时,睡眠12小时,从内部感觉完全正常。

这种机制解释了弗拉米尼(Flamini)丢失的300多天。你的脑子是通过睡眠周期来计算日子的,没有其他。当每个周期悄无声息地延长超过24小时时,日历和你的身体就不再一致了,而你也没有办法感觉到这个差距。

她在第65天停止计数,几乎正好是西弗的漂移开始的地方。当她的团队在500天后终于下来接她时,她正在睡觉。她在地面上的第一个问题是,谁来买啤酒。

太阳每天早晨都代表你赢得这场争论。黎明时分射入你眼睛的光线,是唯一将你的生物钟固定在地球自转上的东西,而洞穴就是当它停止出现时发生的事。

⏰ 14:13 | ❤️ 371点赞 | 📝 447字 | 查看原文 →

↑ 返回顶部

klöss @kloss_xyz

AI vibe orchestrator. prompt shaman.
systems architect. @psychanon CEO | 影响力: 6,174万粉丝

💡 核心观点: AI将20秒音频扩展成多场景音乐视频并渲染新世界。

可信度: 10/10 – 3项声明可直接验证;2项需进一步确认

事实核查:

  • ◐ 部分可验证: Opus 5.5将20秒内容扩展成一首完整歌曲和音乐视频 (需实际测试Opus 5.5工具是否支持此类扩展功能,但无公开技术文档或案例直接佐证该推文的具体操作。)
  • ◐ 部分可验证: 在Blender中构建了4个由音频驱动的全新世界(视神经、水银之海等) (Blender支持音频驱动动画,但具体场景(如“铋晶体大教堂”)需查看工程文件或渲染日志,推文未提供公开链接。)
  • ✓ 可验证: 每个世界赋予独特色图并流畅过渡(瞳孔推进、白光闪现等) (过渡效果描述为主观艺术表达,缺乏技术参数或成品视频展示,无法独立验证。)

原文内容:

对于所有说20秒不够长的人……

我让Opus 5.5把它扩展成一首完整的歌曲和音乐视频。

它又渲染了9个小时,并在Blender中构建了4个由音频驱动的全新世界:视神经、水银之海、铁磁流体尖塔形成一个声学曼陀罗,以及一个铋晶体大教堂。

它还为每个世界赋予了独特的色图,并让每个世界流畅过渡到下一个:瞳孔推进、白光闪现、连续镜头、黑屏匹配、传送门。

这里是1分42秒的魔法。

⏰ 00:47 | ❤️ 74点赞 | 📝 143字 | 查看原文 →

↑ 返回顶部

Santiago Valdarrama @svpino

计算机科学家。我在 https://ml.school 教授硬核人工智能/机器学习工程。YouTube:https://youtube.com/@underfitted | 影响力: 0万粉丝

💡 核心观点: Typesense是快速易用的开源搜索引擎,支持自然语言和多种搜索功能。

可信度: 10/10 – 2项声明可直接验证;3项需进一步确认

事实核查:

  • ◐ 部分可验证: Typesense 在 30 毫秒内可搜索 3200 万条记录 (需通过实际性能测试或官方基准测试报告验证,但推文未提供具体测试环境或数据来源链接。)
  • ✓ 可验证: Typesense 支持模糊搜索、向量搜索、语义搜索和地理搜索 (可通过官方文档(如 GitHub 仓库或官网)直接验证功能列表。)
  • ◐ 部分可验证: Typesense 可将自然语言查询(如“Find me a BMW under $40,000”)自动转换为结构化过滤器和排序规则 (功能描述具体,但需实测或查阅官方示例确认实际转换准确性和支持的语言范围。)

原文内容:

在 30 毫秒内搜索 3200 万条记录真是疯狂!

@typesense 是一个超级快的开源搜索引擎,支持自然语言搜索。它就像 Elasticsearch,但设置、配置和使用起来简单得多。

你可以用 Typesense 实现所有这些功能:

• 模糊搜索:容错的模糊搜索即打即搜
• 向量搜索:返回彼此相似的记录
• 语义搜索:返回概念上相关的记录
• 地理搜索:返回靠近给定经纬度的记录

Typesense 的自然语言搜索非常酷:

它将一个句子转化为结构化的搜索查询,然后针对你的数据运行它。例如:

查询“Find me a BMW under $40,000, newer than 2020, with the lowest mileage first”将产生以下结果:

• 过滤器:brand = BMW, price < 40000,  year > 2020
• 排序:mileage ascending

Typesense 然后会将这些过滤器和排序规则应用到数据上。

他们提供了 Python、JavaScript、PHP、Ruby、Go、Rust、Swift、.NET、Java 以及几乎所有其他编程语言的客户端库。

你可以在不到一分钟内开始搜索:

1. 运行他们的 Docker 镜像(或其原生二进制文件之一)
2. 导入你的数据
3. 开始搜索!

GitHub 仓库:https://fandf.co/4ytzmmE

我录制了一个简短的视频来向你展示演示。我保证你没见过这么快的!

感谢团队与我合作撰写这篇文章。

⏰ 21:15 | ❤️ 644点赞 | 📝 305字 | 查看原文 →

↑ 返回顶部

AshutoshShrivastava @ai_for_success

Post about latest AI news, tools, tutorials and memes. | 影响力: 0万粉丝

💡 核心观点: Step 5 Preview发布,专为专业代理式编码优化,支持多文件执行与测试验证。

可信度: 6/10 – 1项声明可直接验证;2项需进一步确认;1项为观点陈述

事实核查:

  • ✓ 可验证: StepFun 今天在 OpenRouter 上发布了 Step 5 Preview (可通过访问 OpenRouter 平台或 StepFun 官方渠道(如官网、社交媒体公告)直接确认该模型是否已发布。)
  • ◐ 部分可验证: Step 5 Preview 是专为真正的代理式软件工程构建的新旗舰模型,支持 Cline、Kilo Code、Hermes Agent 和 OpenCode 开箱即用 (需实测或查阅官方文档确认其是否为“旗舰模型”及是否支持所列工具的开箱即用功能,但部分信息(如模型定位)可能属于宣传描述。)
  • ◐ 部分可验证: Step 5 Preview 优化了修复陌生仓库中的 bug、将模型或 PRD 转化为可工作的前端等编码中的棘手部分 (需通过实际测试验证其功能表现,但“优化”效果可能因使用场景而异,缺乏公开基准数据支持。)

原文内容:

StepFun @StepFun_ai 今日在 OpenRouter 平台发布了 Step 5 Preview 版本。

这款全新旗舰模型专为真正的代理式软件工程打造,而非玩具脚本。它已原生支持 Cline、Kilo Code、Hermes Agent 和 OpenCode 等平台,用户无需调整设置,仅需切换模型 ID 即可使用。

数周前,我曾在 Cline 中测试过 Step 5 Preview 的早期构建版本,其多文件执行与测试验证功能令人惊艳。该模型特别针对编码中的棘手场景进行了优化:修复陌生代码库中的错误、将模型或产品需求文档转化为可运行的前端代码,以及持续运行终端检查直至变更完全通过验证。

⏰ 00:45 | ❤️ 21点赞 | 📝 159字 | 查看原文 →

↑ 返回顶部

Rohan Paul @rohanpaul_ai

Compiling in real-time, the race towards AGI.

The Largest Show on X for AI.

Get my daily AI analysis newsletter to your email https://rohan-paul.com | 影响力: 6,793万粉丝

💡 核心观点: AI代理通过预算训练显著提升开源模型性能。

可信度: 9/10 – 2项声明可直接验证;2项需进一步确认

事实核查:

  • ◐ 部分可验证: Claude Opus 5 将 Qwen 模型的 SWE-bench Verified 分数提高了三倍 (需核实 SWE-bench 的官方分数记录及实验复现条件,但开源项目 RSIGym 的存在可能提供部分数据支持)
  • ✓ 可验证: RSIGym 通过预算环境内的 AI 代理重训练模型并重写测试框架实现测量 (可检查 @Evolvent_AI 发布的 RSIGym 开源项目文档及功能描述)
  • ◐ 部分可验证: 6 个前沿代理在 500 美元预算下从 Qwen3.5-35B-A3B-Base 开始改进基准测试 (依赖实验者公开具体预算分配和测试日志,开源项目可能提供部分流程验证)

原文内容:

Claude Opus 5 在作为自动化 AI 研究人员工作时,几乎将 Qwen 模型的 SWE-bench Verified 分数提高了三倍。

@Evolvent_AI 新发布的开源 RSIGym 通过让 AI 代理在一个预算环境内重新训练模型并重写其测试框架,使该测量成为可能。

这表明,前沿 AI 代理在训练、部署和测试作为现成服务提供时,可以显著改进另一个 AI 模型。

代理从仅 CPU 的容器中工作,并调用远程服务进行 LoRA 微调、模型部署、基准测试和沙箱,所有费用均从每次运行的预算中扣除。

在主要测试中,6 个前沿代理从 Qwen3.5-35B-A3B-Base 和一个最小测试框架开始,每个基准测试有 500 美元的服务预算。

如果你在改进一个代理,请先阅读其失败日志并修复测试框架:10 个小型测试中的 8 个中,更重的训练得分反而更低。

⏰ 14:11 | ❤️ 59点赞 | 📝 233字 | 查看原文 →

↑ 返回顶部

Jerry Liu @jerryjliu0

解析世界上最难处理的 PDF @llama_index。公司联合创始人/首席执行官

职业机会:https://llamaindex.ai/careers
企业服务:https://llamaindex.ai/contact | 影响力: 0万粉丝

💡 核心观点: LightOn OCR-3性价比高,性能媲美Gemini但价格低45%。

可信度: 6/10 – 1项声明可直接验证;2项需进一步确认;1项为观点陈述

事实核查:

  • ✓ 可验证: LightOn OCR-3 在 OpenDocRouter 上的定价为 $0.28 / 1m 输入和 $1.40 / 1m 输出 (可通过 OpenDocRouter 官网(提供的链接)直接查看定价信息)
  • ◐ 部分可验证: LightOn OCR-3 在 ParseBench 上的性能与 Gemini 3.8 flash low 相似,但价格低约 45% (需通过 ParseBench 的基准测试结果验证性能对比,但价格差异需结合 OpenDocRouter 和 Gemini 的官方定价进一步确认)
  • ◦ 观点: LightOn OCR-3 在表格处理方面表现不错,图表处理尚可,且在 grounding 方面相当出色 (“表现不错”“尚可”“相当出色”为主观评价,缺乏具体量化指标或公开对比数据支持)

原文内容:

LightOn OCR-3现已登陆OpenDocRouter平台,定价为每百万字符输入0.28美元/每百万字符输出1.40美元(ParseBench基准测试显示约合每千页3.19美元)。

我们已在ParseBench完成性能测试。该模型处于开源权重OCR模型的帕累托前沿,其性能与Gemini 3.8 flash low相当,但价格低约45%。其表格解析能力优异,图表处理表现良好,在文本定位(grounding)方面尤为出色。

您可通过以下链接在OpenDocRouter体验该模型:https://opendocrouter.ai/models

完整基准测试结果请查阅ParseBench平台:

⏰ 07:52 | ❤️ 31点赞 | 📝 104字 | 查看原文 →

↑ 返回顶部

levelsio @levelsio

http://PhotoAI.com $89K/m
http://Vibej.am $44K/m
http://InteriorAI.com $27K/m
http://levelsio.com @X $17K/m
http://Nomads.com $16K/m
http://Pieter.com
http://Hotelist.com
http://levels.io
http://levels.vc | 影响力: 3,163万粉丝

💡 核心观点: 作者成功将Odamex引擎移植到WASM并实现多人游戏功能。

可信度: 10/10 – 2项声明可直接验证;2项需进一步确认;1项为观点陈述

事实核查:

  • ◐ 部分可验证: 将 Odamex(一个开源的 Doom 引擎)移植到 WASM,并实现多人游戏功能 (可通过检查 Odamex 的官方开源仓库(如 GitHub)确认其跨平台支持(Mac/Windows/Linux)及多人游戏特性,但 WASM 移植需实际测试或查看相关代码提交记录。)
  • ◐ 部分可验证: 原版 Doom 的网络代码非常卡顿,而 Odamex 特别擅长多人游戏 (原版 Doom 网络性能问题可通过历史文档或玩家社区反馈验证,Odamex 的优化能力需对比测试或查阅其开发文档,但具体表现可能依赖主观体验。)
  • ✓ 可验证: 用 Opus 5.5 在 30 分钟内完成 Odamex 的 WASM 移植 (移植时间属于个人执行效率,无公开记录或第三方证明,除非提供具体代码/工具链日志。)

原文内容:

今天我尝试将 DOOM 移植到 WASM,还带上了多人游戏功能

其实是 Odamex,一个开源的 Doom 引擎,支持 Mac、Windows 和 Linux,特别擅长 Doom 多人游戏,因为原版 Doom 的网络代码非常卡顿

但没人把 Odamex 移植到网页上过,所以我今天用 Opus 5.5 试了试,30 分钟内就搞定了

我也让 Opus 5.5 从零开始创建了 bot,它也只用了 10 分钟就完成了

这是免费的共享地图,还有一些最好的社区制作的 DOOM 地图合集,比如 Dystopia 3 和 Dwango5(我也不得不谷歌了一下,但显然这些是最棒的!)

⏰ 23:30 | ❤️ 168点赞 | 📝 148字 | 查看原文 →

↑ 返回顶部

Chubby♨️ @kimmonismus

Tech Analyst & Content Creator. Editor-in-Chief @getsuperintel – Community of 300k+ in total: https://linktr.ee/kimmonismus // [email protected] | 影响力: 0万粉丝

💡 核心观点: 黄仁勋移民奋斗成就AI科技,获国家科学奖章回报父母期望。

可信度: 10/10 – 3项声明可直接验证;1项需进一步确认;1项为观点陈述

事实核查:

  • ✓ 可验证: 黄仁勋九岁时来到美国 (可通过黄仁勋的公开传记、采访或官方资料验证其移民年龄和时间。)
  • ✓ 可验证: 黄仁勋在白宫接受国家科学奖章,其父母在场见证 (可通过白宫官网、颁奖仪式新闻报道或官方照片/视频验证获奖者和出席者信息。)
  • ✓ 可验证: 黄仁勋在1993年共同创立了NVIDIA (NVIDIA公司官网、历史记录或商业注册文件可验证创始人和成立时间。)

原文内容:

今天最温馨的故事:黄仁勋九岁时来到美国。今天,他在白宫接受了国家科学奖章,他的父母在场见证。

今年早些时候,他说:“我的父母来到这里,因为他们相信美国能给他们的孩子一个机会。”

几十年后,他们的儿子因帮助将图形处理器转变为推动科学发现的工具而受到表彰。

他在1993年共同创立了NVIDIA。他帮助构建的计算平台如今为研究人员提供了解决医学、物理学和人工智能领域问题的途径。

谢谢你,@JensenHuang!你的工作帮助实现了现代人工智能,并为科学家提供了强大的新发现工具。

⏰ 05:45 | ❤️ 351点赞 | 📝 192字 | 查看原文 →

↑ 返回顶部

Rowan Cheung @rowancheung

Founder of the world’s most read daily AI newsletter @therundownai. Sharing the latest developments in the world of artificial intelligence. | 影响力: 565万粉丝

💡 核心观点: GrokBot更新后能高效筛选真实AI用例并监控品牌提及。

可信度: 10/10 – 2项声明可直接验证;2项需进一步确认;1项为观点陈述

事实核查:

  • ◐ 部分可验证: GrokBot 最近的更新支持原生 X 监控,开启了海量新功能 (可通过 GrokBot 的官方更新日志或功能文档验证是否支持原生 X 监控,但“海量新功能”属于主观描述,需实测确认具体功能范围和效果。)
  • ◐ 部分可验证: 例程 1 的提示可在 X 上过滤真实 AI 工作流程,并排除炒作帖 (需实测该提示是否能按描述精准筛选内容(如区分“真实用例”与“炒作帖”),但结果可能受算法或数据源变动影响,无法完全客观验证。)
  • ✓ 可验证: 例程 2 可自动捕捉 X 上对品牌的提及并标注类型(赞扬/投诉等) (可通过实际测试验证功能是否实现(如手动触发搜索并检查 Slack 输出),但分类准确性可能依赖模型能力,需部分人工确认。)

原文内容:

我已经彻底入坑 GrokBot 了。

最近的更新支持原生 X 监控,这开启了海量新功能!

我最喜欢的 4 个例程(复制/粘贴这些提示):

例程 1:在 X 上找到真实的 AI 工作流程(跳过那些炒作帖)

每天早上,这个机器人现在会在 X 上找到人们分享的真实 AI 用例,并过滤掉那些“10 个提示”的炒作帖。

“每个工作日在我的时区上午 9:15,搜索 X 和网络上人们实际运行的新 AI 工作流程。只保留那些命名旧任务、工具和结果的案例:节省的时间、移除的步骤,或过去需要人的移交。丢弃产品公告、“10 个提示”帖,以及作者没用超过一次的东西。最多返回 3 个。对于每个,提供链接、它取代的工作、我需要连接什么,以及它是否适合我的工作。通过 Slack 发送给我。不要在其他地方发帖或回复。将其保存为一个例程。如果没有符合条件的,就发一行说明。”

例程 2:捕捉每个对你的品牌的提及

这个机器人捕捉 X 上对 The Rundown 的每一次提及,进行标注,并在 Slack 上 ping 我们的团队进行回复(试试在推特上@我们 @therundownai,看看会发生什么)。

“每个工作日在上午 9:00,搜索 X 上过去 24 小时内对[你的品牌、@handle 或你自己的名字]的提及。对于每个结果,提供作者、链接、一行总结,以及它是赞扬、投诉、问题还是中性。不要回复任何人。将摘要发帖到[你的 Slack 频道]并@我。将其保存为一个例程。如果来源不可用,就说明是哪个。”

例程 3:找到那些正在积极寻找你所做之事的人

每 4 小时,这个机器人就会监听 X 上人们搜索最佳 AI 通讯的情况,这样我们就能精确知道读者在找什么。

“每 4 小时,搜索 X 上人们评估[你的类别]的情况。捕捉三件事:关于[类别]的评论或投诉;帖子询问用哪个[类别];以及对[你的产品]解决的问题的投诉。引用帖子、链接它、命名账户,并标注为评论、购物或投诉。跳过超过 24 小时的旧内容,并跳过[类别]账户的自推。只在有至少一个你还没分享的新结果时,才发帖到[你的 Slack 频道]。不要回复或与任何人互动。将其保存为一个例程。如果搜索失败,就在 Slack 上报告失败。”

例程 4:再也不丢掉新联系人

我在活动上会见超多的人。这个机器人会查看我的新手机联系人,并提醒我跟进刚认识的新人。

“每个工作日在我的时区上午 8:30,读取我的通讯录并列出过去 14 天添加的联系人。对于每个,显示姓名、添加日期、电话、邮箱和任何备注。在你写任何东西之前,问我我们之前聊了什么。一旦我回复,为[你的任务工具]中的每个人起草一个跟进任务,并附上上下文。绝不要发短信、邮件或打电话给任何人。将其保存为一个例程。如果通讯录不可用,就说明情况,不要用旧数据。”

⏰ 06:46 | ❤️ 1241点赞 | 📝 844字 | 查看原文 →

↑ 返回顶部

Marc Lou @marclou

http://TrustMRR.com $44K/m
http://DataFa.st $26K/m
http://SHlPORDIE.com $13K/m
http://CodeFa.st $6K/m
http://ShipFa.st $4K/m
http://IndiePa.ge $1K/m

+29 http://marclou.com | 影响力: 1,236万粉丝

💡 核心观点: Opus 5.5比OpenAI模型更高效直接。

可信度: 6/10 – 1项声明可直接验证;2项需进一步确认;1项为观点陈述

事实核查:

  • ◐ 部分可验证: Opus 5.5 在提炼VO2 max实验室测试结果时比GPT-6 Astra更高效,能直接提供要点和可操作步骤 (需实测对比两款模型对同一份VO2 max报告的分析输出,但用户未提供具体报告内容和模型响应细节,且GPT-6 Astra未公开发布(截至2024年7月)。)
  • ◐ 部分可验证: OpenAI的模型(如GPT-6 Astra)在分析报告时倾向于冗长且结论模糊 (若GPT-6 Astra存在且能测试,可通过输入相同报告验证其响应模式,但该模型未官宣,用户描述可能基于非公开版本或主观体验。)
  • ◦ 观点: Opus 5.5在所有方面(不限于编码)显著优于OpenAI当前模型 (未提供具体对比指标或测试案例,属用户主观评价;”所有方面”的绝对性表述缺乏客观证据支持。)

原文内容:

我用 Opus 5.5 越久,就越意识到 OpenAI 的模型落后了多少。

不只是编码。所有方面。

我把 VO2 max 实验室测试结果发给 GPT-6 Astra,它让我头疼死了。200 句话全是:“你的报告显示这个,我觉得那个,因此结论不明”。

另一方面,Opus 5.5 直接给我提炼了要点和可操作步骤。

OpenAI 的模型现在就像那个想太多下不了决定的家伙。

Opus 5.5 则是那个高行动力的朋友,一句话就直击你需要听的。

我不知道过去几个月这个差距怎么拉得这么大。

⏰ 21:32 | ❤️ 3030点赞 | 📝 148字 | 查看原文 →

↑ 返回顶部

Artificial Analysis @artificialanlys

Independent analysis of AI | 影响力: 0万粉丝

💡 核心观点: Grok视频模型以低成本高效能登顶排行榜。

可信度: 10/10 – 3项声明可直接验证;2项需进一步确认

事实核查:

  • ◐ 部分可验证: Grok Imagine Video 1.5 Lite 在 AA-Video-T2V v2.0 和 AA-Video-T2V-Silent v2.0 排行榜上均位列 #17,领先于谷歌的 Veo 3.1 (需查看 Artificial Analysis Video Arena 的官方排行榜数据以确认排名和对比结果,但若该平台公开数据则可验证。)
  • ◐ 部分可验证: Grok Imagine Video 1.5 Lite 生成 10 秒 1080p 片段的中位时间为 60.5 秒,是同等质量级别中最快的模型 (需依赖第三方基准测试报告或 SpaceXAI 公开的实测数据,若未公开具体测试方法或重复性结果则部分可验证。)
  • ✓ 可验证: Grok Imagine Video 1.5 Lite 的定价为 1080p 视频每秒 0.14 美元(每分钟 8.40 美元),是原版价格的 56% (可通过 SpaceXAI 官方 API 定价页面或公开文档直接核对价格信息。)

原文内容:

Grok Imagine Video 1.5 Lite 在AA-Video-T2V v2.0排行榜上同时斩获第17名,并跻身质量与速度的帕累托前沿

Grok Imagine Video 1.5 Lite是SpaceXAI旗下Grok Imagine视频系列推出的全新低成本模型。该模型可生成1至15秒的文本转视频片段,支持480p、720p或1080p分辨率,同时具备图像转视频功能。

在Artificial Analysis Video Arena评测中,Grok Imagine Video 1.5 Lite同时位列AA-Video-T2V v2.0和AA-Video-T2V-Silent v2.0榜单第17名,性能超越谷歌Veo 3.1,而价格仅为后者三分之一。该模型在多场景叙事、光影材质表现及文字渲染方面最接近行业顶尖水平,尤其在建筑房地产与消费场景应用中表现突出。

根据我们的端到端生成时间基准测试,这是同级画质中速度最快的模型——生成10秒1080p片段的中位耗时仅60.5秒,使其成功占据质量与速度的帕累托最优边界。

SpaceXAI将Grok Imagine Video 1.5 Lite的1080p视频定价设为每秒0.14美元(每分钟8.40美元),相当于Grok Imagine Video 1.5同分辨率下0.25美元/秒定价的56%。720p版本价格降至每秒0.03美元,480p版本仅需每秒0.02美元。

用户可通过SpaceXAI API获取Grok Imagine Video 1.5 Lite,fal平台提供同等价位服务,并兼容Vercel AI Gateway。

祝贺@SpaceXAI与@elonmusk成功发布!

下方附上我们的深度解析报告,以及Grok Imagine Video 1.5 Lite与Artificial Analysis Video Arena中其他顶尖模型的横向对比。

⏰ 06:23 | ❤️ 82点赞 | 📝 309字 | 查看原文 →

↑ 返回顶部

François Chollet @fchollet

Co-founder @ndea. Co-founder @arcprize. Creator of Keras and ARC-AGI. Author of ‘Deep Learning with Python’. | 影响力: 0万粉丝

💡 核心观点: AI进步需匹配指数利润以维持资源循环。

可信度: 6/10 – 2项需进一步确认;3项为观点陈述

事实核查:

  • ◐ 部分可验证: 大多数衡量 AI 进步的指标在 2023-2026 年期间非常贴合指数增长曲线 (需查阅公开的AI技术发展报告(如斯坦福AI指数报告、行业白皮书等)或学术研究数据,但具体指标的定义和增长曲线拟合可能存在主观性,且2024-2026年数据为预测值。)
  • ◐ 部分可验证: 2023-2026年期间AI资本支出略呈超指数增长(增长率本身正在增加) (可通过企业财报(如谷歌、微软等AI投资数据)或行业分析报告(如IDC/Gartner)验证资本支出趋势,但“超指数”是否为共识结论需交叉对比,且未来预测存在不确定性。)
  • ◦ 观点: AI系统以外部投资为输入并输出进步,具有略微亚线性响应 (该声明为模型化推论,依赖对“AI进步”与“投资”关系的假设,缺乏公开的统一量化标准,属于主观分析框架。)

原文内容:

大多数衡量 AI 进步的指标在 2023-2026 年期间非常贴合指数增长曲线。与此同时,同一时期 AI 资本支出略呈超指数增长(即增长率本身正在增加)。

因此,如果你将 AI 建模为一个系统,该系统以外部投资作为输入并输出 AI 进步,那么该系统具有略微亚线性的响应。

但是,*外部* 资源的超指数注入在长期内不可持续。要实现持续的指数进步,AI 行业需要实现匹配的指数利润——它需要闭合资源循环。

⏰ 05:37 | ❤️ 375点赞 | 📝 150字 | 查看原文 →

↑ 返回顶部

Marc Lou @marclou

http://TrustMRR.com $44K/m
http://DataFa.st $26K/m
http://SHlPORDIE.com $13K/m
http://CodeFa.st $6K/m
http://ShipFa.st $4K/m
http://IndiePa.ge $1K/m

+29 http://marclou.com | 影响力: 1,236万粉丝

💡 核心观点: 坚持健身显著提升体能,明年目标继续增强力量与耐力。

可信度: 8/10 – 1项声明可直接验证;3项需进一步确认;1项为观点陈述

事实核查:

  • ◐ 部分可验证: VO2最大摄氧量测试结果为61.9 mL/kg/min,比去年提高8%,跻身同龄男性前5% (需通过专业医疗机构的测试报告或实验室数据验证,但若无具体测试机构或公开记录,仅依赖个人陈述则无法完全验证。)
  • ◐ 部分可验证: 测试在跑步机上进行,具体协议为初始速度6公里/小时,每3分钟增加2公里/小时,并在每阶段暂停取血测乳酸,最终在22公里/小时时昏倒 (测试方法符合标准VO2max测试流程,但具体执行细节需依赖测试机构记录或第三方见证,个人描述无法独立验证。)
  • ✓ 可验证: 过去两年健身计划为有氧每周3-4次、力量训练每周2-3次,体重增加10公斤(现84公斤/181厘米) (健身频率和体重变化属个人记录,若无连续体检数据或训练日志公开,无法验证真实性。)

原文内容:

我刚刚完成了年度 VO2 最大摄氧量测试:

 61.9 mL/kg/min

比去年提高了 8% ,这让我跻身同龄男性前 5%。

测试是在跑步机上进行的,从 6 公里/小时开始。每 3 分钟速度增加 2 公里/小时。在每个阶段,医生会暂停跑步机 15 秒,从我的手指取血样并测量乳酸水平。我在 22 公里/小时(约 25 分钟)时昏了过去。

过去两年,我一直认真对待自己的健身:

- 有氧运动每周 3-4 次
- 力量训练每周 2-3 次

我担心会丢失肌肉量,这对长寿也很重要,但事实并非如此。事实上,比去年我增加了近 10 公斤体重。现在我身高 181 厘米、体重 84 公斤,对此我很满意。

明年我的目标是提升 VO₂ 最大摄氧量并变得更强壮,同时不增加更多体重。

Marc,当你明年读到这个时,这是你的简历:

- 卧推:100 公斤 × 5 次
- 深蹲:120 公斤 × 5 次
- 硬拉:150 公斤 × 5 次
- 10 公里:39 分钟

祝好运 

⏰ 20:01 | ❤️ 540点赞 | 📝 255字 | 查看原文 →

↑ 返回顶部

© 版权声明

相关文章

暂无评论

暂无评论...