【AI 英文奏折】07月24日

x每日奏折16小时前发布 tianming
40 0 0

【AI 英文奏折】2026年07月24日

共收录 20 篇深度内容


📋 今日内容速览

快速浏览,点击感兴趣的推文查看详细分析

  1. Rohan Paul: 中国AI模型在国际数学奥赛中获满分,超越人类和同行表现。
  2. Santiago Valdarrama: 与AWS工程师面对面交流学习是参会最大价值。
  3. Vasuman: Moonshot AI通过蒸馏Anthropic模型开发K3并规避检测。
  4. Hasan Toor: Unstract用自然语言提示从文档提取结构化JSON,替代付费工具。
  5. Gary Marcus: Gary Marcus认为神经符号结合是AGI的必要条件但非充分条件。
  6. Marc Lou: 税务优化可显著增加财富积累和投资收益。
  7. Santiago Valdarrama: 通过演示操作训练AI代理,数据自主可控。
  8. Anthony Pompliano: Meta通过人性化沟通策略有效提升用户情感连接。
  9. Sakana AI: Fugu-Ultra v1.1性能升级,编码推理更强且价格不变。
  10. Marc Lou: DataFast MCP提供免费AI工具优化营销分析与决策。
  11. Rohan Paul: 长上下文模型需减少盲目复制,聚焦关键内容以提高准确性。
  12. Rohan Paul: API调用无法直接证明模型来源需额外证据。
  13. Pierrick Chevallier | IA: 马斯克或推出AI创作的宏大《奥德赛》版本。
  14. Rohan Paul: AI将加速解决所有可验证的数学问题。
  15. Amira Zairi: 阿尔及利亚野火肆虐,致人畜伤亡,消防员奋力救援。
  16. Emily: 推文指导如何用两个系统改写用户内容生成图像提示。
  17. Aakash Gupta: 推文详解大语言模型原理、应用场景及优化技巧。
  18. Anthony Pompliano: 讨论通胀成因、政策影响及比特币与黄金的未来前景。
  19. Rohan Paul: 新方法通过外部适配器为冻结模型注入知识。
  20. levelsio: 家庭自动化应以实体按钮为主,智能控制为辅。

📖 详细内容

【AI 英文奏折】07月24日Rohan Paul @rohanpaul_ai

Compiling in real-time, the race towards AGI. The Largest Show on X for AI. | 影响力: 0万粉丝

💡 核心观点: 中国AI模型在国际数学奥赛中获满分,超越人类和同行表现。

可信度: 10/10 – 3项声明可直接验证;1项需进一步确认;1项为观点陈述

事实核查:

  • ◐ 部分可验证: RedNote的AI模型dots-note-3.0在国际数学奥林匹克竞赛(IMO)中获得满分42分 (需通过IMO官方成绩公告或RedNote官方发布的测试报告验证,但目前仅依赖第三方媒体(SCMP)报道,且未提供直接链接至原始成绩记录或官方声明。)
  • ✓ 可验证: 谷歌DeepMind和OpenAI去年在IMO测试中达到35分(金牌级别) (DeepMind和OpenAI的数学竞赛表现可通过其官方博客或学术论文(如AlphaGeometry)验证,但需确认具体测试是否基于IMO真题及相同评分标准。)
  • ✓ 可验证: IMO要求书面证明且人类评分者逐行审查,而多数AI数学测试仅检查最终答案 (IMO官方规则明确要求完整证明过程,其评分标准公开可查;AI测试的常见局限性(如仅验证答案)在学术论文(如MATH数据集评估)中也有讨论。)

原文内容:

一家中国社交应用的 AI 模型在国际数学奥林匹克竞赛中获得满分 42 分。

RedNote(小红书背后的公司)构建了该系统,名为 dots-note-3.0,目前仍处于测试阶段。

谷歌 DeepMind 和 OpenAI 去年达到了 42 分中的 35 分,这是金牌级别的表现。

今年在上海的 666 名人类参赛者中,只有 7 人达到了这一成绩。

IMO 要求书面证明,而非最终答案,人类评分者会逐行阅读。一处遗漏的案例或未说明的条件都会扣分,即使最终答案正确。

大多数 AI 数学基准测试只检查最后一个数字,因此幸运猜测也能获得满分。这种差距正是为什么这里 42 分满分比普通测试中的高分更有意义。

这次模型直接阅读了原始比赛文件,没有人工改写。它运行了一个代理循环,将自然语言推理与它自己执行的 Python 代码相结合。

草稿在提交给官方评分者之前会经过测试、故障排除和修复。

自我审查在这里起着关键作用,因为系统反复质疑自己的假设。

比赛规则禁止在运行过程中提供提示、修正以及其他任何形式的帮助。

RedNote 承诺,该模型将在适当时候开源,但尚未承诺具体时间。

获胜的模型变体也是 dots3 家族中最小的,该家族包括两个更大的版本——jazz 和 aria——针对不同的使用场景和计算成本进行了定制。

---

scmp. com/tech/article/3361482/worlds-first-ai-model-earn-perfect-score-maths-olympiad-comes-chinas-rednote

⏰ 15:10 | ❤️ 88点赞 | 📝 401字 | 查看原文 →

↑ 返回顶部

【AI 英文奏折】07月24日Santiago Valdarrama @svpino

| 影响力: unknown万粉丝

💡 核心观点: 与AWS工程师面对面交流学习是参会最大价值。

可信度: 10/10 – 3项声明可直接验证;1项需进一步确认;1项为观点陈述

事实核查:

  • ✓ 可验证: AWS re:Invent 将有超过 2,200 个会议环节,其中约 70% 是动手操作或讨论式的 (可通过 AWS re:Invent 官网或官方活动页面核实会议环节总数及类型分布。)
  • ✓ 可验证: 早鸟优惠从 2,499 美元降至 1,299 美元,需在 8 月 25 日前注册并使用商务邮箱 (官网注册页面或促销条款会明确标注价格、截止日期及注册要求。)
  • ◐ 部分可验证: 与构建 AWS 产品的工程师直接交流以解决实际问题 (官网可能提及工程师互动环节,但具体体验(如“手把手解决”)需实际参与验证。)

原文内容:

我在科技会议上最美好的时光,是与那些打造我所用工具的人们坐下来交流。

就投资回报率而言,没有什么能比得上将问题带给那些人,并让他们手把手带你解决问题。

AWS re:Invent 即将来临。

超过 2,200 个会议环节,其中约 70% 是动手操作或讨论式的:粉笔谈话、工作坊、代码讲座和小桌讨论。这是一场以代码为先的会议。

你有两大理由想要参加:

首先,如果你对任何 AWS 产品感到困惑,带上你的真实架构和约束条件,与那些构建它的工程师一起逐一解决。

其次,你将与世界上一些最优秀的构建者并肩而坐。老实说,单单这一点就值得你专程前往。我学到的一些最佳洞见,并非来自舞台,而是来自我身边的人。

顺便说一句,如果你想带着一些具体收获离开,那里还会有现场认证准备和折扣考试。

这场活动将于 11 月 30 日至 12 月 4 日在内华达拉斯维加斯举行。

早鸟优惠可节省 1,200 美元,从 2,499 美元降至 1,299 美元,前提是你要在 8 月 25 日前注册。你需要使用商务邮箱。

在此注册:https://bit.ly/4yoKsKI

感谢 @awscloud 团队赞助本文。

⏰ 23:10 | ❤️ 21点赞 | 📝 341字 | 查看原文 →

↑ 返回顶部

【AI 英文奏折】07月24日Vasuman @vasuman

| 影响力: unknown万粉丝

💡 核心观点: Moonshot AI通过蒸馏Anthropic模型开发K3并规避检测。

可信度: 8/10 – 2项声明可直接验证;1项需进一步确认

事实核查:

  • ✓ 可验证: Moonshot AI 通过蒸馏 Anthropic 的 Fable 来开发其 K3 模型 (该声明涉及公司内部技术开发细节,未提供公开证据或第三方验证来源,且“蒸馏”过程属于未公开的商业机密。)
  • ✓ 可验证: Moonshot AI 开发了内部平台用于对美国模型进行大规模蒸馏,并切换访问方法以避免检测 (平台的具体功能、设计及操作方式属于企业内部信息,缺乏公开披露或独立验证渠道,且“避免检测”的行为无法通过公开数据证实。)
  • ◐ 部分可验证: Moonshot AI 采购了配备 GB300 的服务器并在泰国访问 GB300,可能用于训练 AI (服务器采购和地理位置信息可通过供应链或公开招标记录部分验证,但“用于训练 AI”属于推测性关联,需内部数据确认。)

原文内容:

我们有信息显示,Moonshot AI 通过蒸馏 Anthropic 的 Fable 来开发其 K3 模型。

为此,他们开发了一个复杂的内部平台,用于对美国模型进行大规模蒸馏,使他们能够快速在多种访问方法之间切换,以避免检测。Moonshot AI 还采购了配备 GB300 的服务器,并在泰国访问了 GB300,很可能用于训练其 AI

⏰ 10:28 | ❤️ 21点赞 | 📝 96字 | 查看原文 →

↑ 返回顶部

【AI 英文奏折】07月24日Hasan Toor @hasantoxr

AI & Tech Educator • Sharing insights on AI, Tech Tools, & practical ways to use AI & Tech Tools for you & your daily business • Founder & Writer @theprohumanai | 影响力: 0万粉丝

💡 核心观点: Unstract用自然语言提示从文档提取结构化JSON,替代付费工具。

可信度: 10/10 – 2项声明可直接验证;2项需进一步确认;1项为观点陈述

事实核查:

  • ◐ 部分可验证: Unstract可以将任何PDF、扫描件或图像转化为干净的结构化JSON,使用用户已付费的LLMs (功能描述具体(支持格式、输出结构化JSON),但需实测验证转换准确性和兼容性;LLM依赖需确认是否真支持用户自选模型。)
  • ◐ 部分可验证: Unstract通过单一自然语言提示处理所有文档变体,无需为每个供应商训练模型或编写模板 (宣称与传统工具差异(免训练/模板)逻辑合理,但实际泛化能力需测试复杂文档场景;自然语言提示的普适性需验证。)
  • ✓ 可验证: 支持连接到S3、GCS、Snowflake等主流存储,并部署为REST API或ETL管道 (集成目标列表具体,通常为公开技术栈,可通过官方文档或演示直接验证。)

原文内容:

我正在删除所有付费的文档提取工具,就因为这个。

Zipstack 构建了 Unstract,它可以将任何 PDF、扫描件或图像转化为干净的结构化 JSON,使用你已经付费的 LLMs。

你只需将它指向一份文档(发票、银行对账单、KYC 表格、税务申报单、理赔表格),它就会自动提取你要求字段,并返回一个 JSON 对象,可以直接导入你的数据库。

与其他所有文档提取工具的区别在于设置方式。大多数工具需要为每个供应商训练一个模型,或为每个模板编写正则表达式。而这个只需一个单一的自然语言提示,就能处理所有变体。

→ 从 PDF、扫描件和图像中提取结构化 JSON
→ 通过 Prompt Studio 让你用纯英文编写提取模式
→ 在几分钟内部署为 REST API 或 ETL 管道
→ 附带 MCP 服务器,让 Claude 和其他代理直接提取文档
→ 连接到 S3、GCS、Snowflake、BigQuery、Postgres 和所有主要目标存储
→ LLM 无关:可接入 OpenAI、Anthropic、Bedrock、Gemini、Mistral、Ollama 或你已使用的任何提供商

基本上:

你有成千上万份没人有时间阅读的文档。

Unstract 将你的文档转化为干净、结构化的 JSON,可直接用于生产环境。

这才是文档提取从一开始就该有的样子。

⏰ 22:26 | ❤️ 128点赞 | 📝 331字 | 查看原文 →

↑ 返回顶部

【AI 英文奏折】07月24日Gary Marcus @garymarcus

OG GenAI Skeptic; spoke at US Senate. Advocating world models | 影响力: unknown万粉丝

💡 核心观点: Gary Marcus认为神经符号结合是AGI的必要条件但非充分条件。

可信度: 6/10 – 1项声明可直接验证;2项需进一步确认;1项为观点陈述

事实核查:

  • ◦ 观点: AGI很可能在本世纪到来 (这是对未来技术发展的预测,属于主观观点,缺乏客观事实依据,无法直接验证。)
  • ◐ 部分可验证: 纯LLM无法达到AGI(它们确实没有) (可通过当前LLM的能力和AGI的定义部分验证,但“AGI”的标准尚无共识,因此验证存在主观性。)
  • ◐ 部分可验证: 神经符号组件是必要的但不足以实现AGI(似乎是正确的,参见2020年Arxiv论文《Next Decade》) (可通过查阅Arxiv论文验证其观点,但“必要性”和“不足”仍是学术争议问题,需进一步研究佐证。)

原文内容:

为了记录在案,我从未说过AGI永远不会到来!

- 我说过它很可能在本世纪到来(参见我在Substack上与Grady Booch的辩论)
- 我说过它很可能在下一个十年到来
- 我说过纯LLM无法达到那里(它们确实没有)
- 我说过添加(神经)符号组件会有帮助(它们确实有帮助;如harnesses、工具、循环等)
- 我说过神经符号组件是必要的但不足以实现(似乎是正确的,参见我2020年在Arxiv上的《Next Decade》)
- 我在文章《Dear Elon Musk》和与Miles Brundage的赌注中给出了标准(两者均在我的Substack上)

另请注意,到目前为止,所有这些说法要么已被证明正确,要么正在验证中但前景看好。而且证据比比皆是。

⏰ 09:21 | ❤️ 42点赞 | 📝 195字 | 查看原文 →

↑ 返回顶部

【AI 英文奏折】07月24日Marc Lou @marclou

⭐️ TrustMRR.com $27K/m | DataFa.st $20K/m | SHlPORDIE.COM $20K/mo | 影响力: 170.0k万粉丝

💡 核心观点: 税务优化可显著增加财富积累和投资收益。

可信度: 10/10 – 3项声明可直接验证;2项需进一步确认

事实核查:

  • ◐ 部分可验证: 通过新加坡公司运营业务并作为塞浦路斯税务居民,新加坡公司税率为17%,塞浦路斯股息税为0%,医疗税为2.65%,每月可保留$21.2K (新加坡企业所得税率17%和塞浦路斯股息税0%可通过两国税务局官网验证,但具体每月保留金额($21.2K)需结合实际业务收入、成本等财务数据,无法直接验证。)
  • ◐ 部分可验证: 将每月差额$7,500投资S&P 500,10年后投资组合价值$1.58M (S&P 500历史回报率可公开查询,但未来10年收益无法保证,计算结果依赖假设的年均回报率和复利模型,实际结果可能偏差较大。)
  • ✓ 可验证: 塞浦路斯对资本利得税为0%,因此$1.58M可全额保留 (塞浦路斯对非境内资产的资本利得税政策为0%,可通过塞浦路斯税务局官网或权威税务指南直接验证。)

原文内容:

所以你每月保留 $13.7K。

替代故事:

你通过一家新加坡公司运营同样的业务,并在塞浦路斯作为税务居民居住。

新加坡公司税:17%。

塞浦路斯股息税:0%。

塞浦路斯医疗税:2.65%。

现在你每月保留 $21.2K。

那就是每月额外 +$7,500。

将这笔差额投资到 S&P 500。

10 年后,你的投资组合价值 $1.58M。

塞浦路斯对资本利得税为 0%,所以你个人口袋里最终有这笔金额。

现在我们才 30 岁(大约),所以我们继续持有投资直到 60 岁!

现在你因为搬到一个对待你更好的国家而多出 $11.6M 的财富。

⏰ 09:17 | ❤️ 186点赞 | 📝 164字 | 查看原文 →

↑ 返回顶部

【AI 英文奏折】07月24日Santiago Valdarrama @svpino

| 影响力: unknown万粉丝

💡 核心观点: 通过演示操作训练AI代理,数据自主可控。

可信度: 1/10 – 1项暂无法验证

事实核查:

  • ✗ 无法验证: 事实核查功能暂时不可用 (系统处理中)

原文内容:

通过“展示”来教你的代理该做什么。

这就是你教其他人的方式:你让他们坐在你旁边,打开浏览器,点击、点击,然后完成。

Open Teach 的美妙之处在于,它适用于任何代理和任何模型。

你可以自托管这个。你的数据仍然属于你。

⏰ 21:09 | ❤️ 57点赞 | 📝 84字 | 查看原文 →

↑ 返回顶部

【AI 英文奏折】07月24日Anthony Pompliano @apompliano

Entrepreneur, investor, and lifelong learner. | 影响力: 2134k万粉丝

💡 核心观点: Meta通过人性化沟通策略有效提升用户情感连接。

可信度: 6/10 – 1项声明可直接验证;2项需进一步确认;1项为观点陈述

事实核查:

  • ◐ 部分可验证: Facebook通过在用户消息上签名“来自Facebook的我们所有人”改变了用户对公司的情感态度 (该案例研究可能基于内部数据或非公开报告,但若存在公开的第三方分析、媒体报道或Meta官方披露的案例细节(如博客、演讲),则可部分验证。目前无直接公开链接佐证具体实验细节。)
  • ◦ 观点: Meta在沟通方面比大多数大科技公司做得更好 (此为主观比较,缺乏统一的量化标准(如用户满意度调查、品牌声誉排名等)。尽管可引用Meta的公关活动案例,但“更好”是相对判断,取决于个人对沟通效果的认知。)
  • ◐ 部分可验证: Meta通过产品和品牌人性化策略(如“我们相信人类!”)与AI实验室的负面形象形成对比 (Meta的公开广告或宣传材料(如视频、官网标语)可验证其人性化表达,但“对比AI实验室的负面形象”需依赖对AI行业舆论的归纳,属于部分可验证的观点性陈述。)

原文内容:

我在 Facebook 工作时学到的一件事,就是他们多么擅长将自己的工作人性化。

有一个著名的案例研究,在这个案例中,他们无法通过产品体验在可量化的层面改变人们对公司的情感态度,直到他们开始在不同的用户消息上签名“来自 Facebook 的我们所有人”。

这是情感指标首次发生变化的时候,因此他们基本上遵循这条路径,将人性化的经验推广到他们的产品、品牌和沟通活动中。

这个视频就是将公司和产品人性化的一例。谁不喜欢“我们相信人类!”这样的信息呢!

这与那些谈论消灭工作岗位和控制数字核武器的 AI 模型实验室形成了鲜明对比。

无论你对 Meta 有什么看法,你都无法否认他们在沟通方面比大多数大科技公司做得更好。

⏰ 08:59 | ❤️ 44点赞 | 📝 251字 | 查看原文 →

↑ 返回顶部

【AI 英文奏折】07月24日Sakana AI @sakanaailabs

Building Frontier AI in Japan | Try Sakana Chat, Marlin, Fugu → sakana.ai | 影响力: unknown万粉丝

💡 核心观点: Fugu-Ultra v1.1性能升级,编码推理更强且价格不变。

可信度: 10/10 – 2项声明可直接验证;2项需进一步确认;1项为观点陈述

事实核查:

  • ◐ 部分可验证: Fugu-Ultra v1.1 在 ProgramBench 和 Terminal Bench 2.1 上比 v1.0 高出高达 7.9 分的提升 (需通过官方提供的基准测试数据或独立第三方测试验证具体分数提升,但若官网未公开原始数据或测试方法,则无法完全确认。)
  • ◐ 部分可验证: Fugu-Ultra v1.1 在编码、代理任务和高级推理方面能力更强 (需通过实际测试或对比 v1.0 的性能报告验证,但“能力更强”是相对描述,缺乏量化标准时难以完全验证。)
  • ✓ 可验证: Fugu-Ultra v1.1 以与 v1.0 相同的价格提供 (可通过官网或官方定价页面直接核对价格信息。)

原文内容:

宣布推出Fugu-Ultra v1.1版本

我们对Fugu模型系列获得的热烈反响倍感振奋。衷心感谢所有试用本产品、分享反馈意见并信赖Fugu处理实际工作的用户。

今日,我们正式发布Fugu-Ultra v1.1 → https://sakana.ai/fugu

本次升级整合了最前沿的模型技术,在所有公布的基准测试中均展现出更强劲的性能表现,其中在ProgramBench和Terminal Bench 2.1测试中尤为突出,较v1.0版本最高提升达7.9分。

Fugu-Ultra v1.1在编程、代理任务及高阶推理方面具备更强大的能力,同时保持与Fugu-Ultra v1.0相同的定价。

技术前沿永不止步,Fugu亦将持续进化。

⏰ 08:23 | ❤️ 954点赞 | 📝 141字 | 查看原文 →

↑ 返回顶部

【AI 英文奏折】07月24日Marc Lou @marclou

⭐️ TrustMRR.com $27K/m | DataFa.st $20K/m | SHlPORDIE.COM $20K/mo | 影响力: 170.0k万粉丝

💡 核心观点: DataFast MCP提供免费AI工具优化营销分析与决策。

可信度: 8/10 – 1项声明可直接验证;4项需进一步确认

事实核查:

  • ◐ 部分可验证: DataFast MCP 可以创建漏斗来找出您最大的瓶颈所在 (功能描述较具体,但需实测或查看官方文档/演示以确认实际效果和实现方式。)
  • ◐ 部分可验证: DataFast MCP 能分析用户在付款前做什么并找出模式 (需验证其数据分析的准确性和方法(如是否依赖特定数据源或算法),但功能逻辑本身可通过技术实现。)
  • ✓ 可验证: DataFast MCP 对所有计划的所有用户免费开放 (可通过官网或官方公告直接确认免费政策是否属实。)

原文内容:

介绍 DataFast MCP 

您可以让您的 AI...

- 创建漏斗来找出您最大的瓶颈所在
- 分析用户在付款前做什么并找出模式
- 找出您最不盈利的营销渠道以及如何改进它
- 使用自定义目标对您的着陆页进行 A/B 测试,并在 1K 访客后挑选获胜者
- 为您的代理机构客户生成 PPT

它对所有计划的所有用户免费开放!

⏰ 23:18 | ❤️ 119点赞 | 📝 111字 | 查看原文 →

↑ 返回顶部

【AI 英文奏折】07月24日Rohan Paul @rohanpaul_ai

Compiling in real-time, the race towards AGI. The Largest Show on X for AI. | 影响力: 0万粉丝

💡 核心观点: 长上下文模型需减少盲目复制,聚焦关键内容以提高准确性。

可信度: 10/10 – 2项声明可直接验证;2项需进一步确认;1项为观点陈述

事实核查:

  • ◐ 部分可验证: 即使是强大的推理模型,也会陷入将输入的大段内容直接复制到思考过程中的习惯,且输入越长时越严重,消耗令牌预算并拖累准确率。 (可通过论文实验数据(如令牌使用效率、准确率对比)验证,但需复现实验或依赖作者提供完整数据。)
  • ✓ 可验证: 复制错误内容会损害模型表现,而复制真正重要的几行内容的模型往往能得出正确答案。 (论文中应包含具体案例或统计结果(如关键文本与无关文本的复制对比),可通过公开论文直接验证。)
  • ✓ 可验证: 他们开发的奖励机制通过惩罚复制无关内容,将准确率提高了多达4.6个百分点。 (论文中应有实验数据(如基线模型与改进模型的准确率对比),可通过公开论文验证具体数值。)

原文内容:

许多人认为,一旦长上下文模型能够进行推理,过去那个单纯找到正确文本的老问题就会被抛在脑后。

这篇论文表明,这种想法是错误的。即使是强大的推理模型,也会陷入一种懒惰的习惯,即将输入的大段内容直接复制到自己的思考过程中,而且这种习惯在输入越长时越严重,悄无声息地消耗它们的令牌预算,并拖累准确率。

复制本身并无问题;损害来自于复制错误的内容。那些复制真正重要的几行内容的模型往往能得出正确答案,而那些复制周围无关填充内容的模型则往往出错。

他们开发了一种简单的奖励机制,阻止长上下文语言模型盲目复制输入,从而将准确率提高了多达4.6个百分点。

这种修复方法奖励模型与真正重要的少量文本进行互动,并惩罚它复制周围无关的填充内容。

– arxiv.org/abs/2607.19345

标题:“Copy Less, Ground More: Overcoming Repetitive Copying in Long-Context Reasoning via Evidence-Aware Reinforcement Learning”

⏰ 13:52 | ❤️ 39点赞 | 📝 286字 | 查看原文 →

↑ 返回顶部

【AI 英文奏折】07月24日Rohan Paul @rohanpaul_ai

Compiling in real-time, the race towards AGI. The Largest Show on X for AI. | 影响力: 0万粉丝

💡 核心观点: API调用无法直接证明模型来源需额外证据。

可信度: 6/10 – 1项声明可直接验证;2项需进一步确认

事实核查:

  • ◐ 部分可验证: 调用 Fable API 并不证明 Fable 生成了该响应 (需实测验证 API 调用与响应生成的实际归属关系,但缺乏公开技术文档说明请求重定向机制,需依赖内部实现细节。)
  • ✓ 可验证: Anthropic 可能将疑似蒸馏请求秘密重定向到 Opus 模型 (涉及未公开的请求处理逻辑,除非官方披露或泄露内部代码/日志,否则无法验证其真实性。)
  • ◐ 部分可验证: 需提供模型 ID、提取语料库、金丝雀转移等证据才能证明 Fable 与 K3 的关联 (模型谱系验证理论上可通过技术文档或实验复现,但具体证据(如错误指纹)需依赖未公开数据或官方配合。)

原文内容:

这里还存在一个模型归因问题。

调用 Fable API 并不证明 Fable 生成了该响应。即使假设 Moonshot 向 Fable API 发送了一个请求,如果 Anthropic 怀疑这是一个蒸馏请求,那么该请求将被秘密重定向到 Opus。

因此 Moonshot 将收到 Opus 的回答,而不是 Fable 的回答。

因此,即使日志证明 Moonshot 从 Claude 中提取了回答,但这些回答也不会自动被证明具体来自 Fable。

要证明 Fable 与 K3 相关,你需要展示每个补全的提供模型 ID、与 K3 训练任务相关的提取语料库,以及模型谱系证据,如金丝雀转移、唯一错误指纹,或消融实验。

⏰ 13:32 | ❤️ 40点赞 | 📝 166字 | 查看原文 →

↑ 返回顶部

【AI 英文奏折】07月24日Pierrick Chevallier | IA @charaspowerai

AI VFX Artist & Photoshop Editor for House of David Saison 2 for Amazon | AI Artist & Formateur | 影响力: 0万粉丝

💡 核心观点: 马斯克或推出AI创作的宏大《奥德赛》版本。

可信度: 6/10 – 1项声明可直接验证;2项需进一步确认;1项为观点陈述

事实核查:

  • ◐ 部分可验证: 埃隆·马斯克可能与荷马《奥德赛》的新版本有关 (需通过官方渠道(如马斯克或相关公司声明)确认其是否参与《奥德赛》项目,但推文未提供具体来源。)
  • ◐ 部分可验证: Grok Imagine目前能创作出与《奥德赛》相关的内容 (需实测Grok Imagine的功能或查看其官方示例,但推文未提供具体作品或链接。)
  • ◦ 观点: 推文暗示Grok Imagine将推出一部宏大的《奥德赛》版本 (这是对未来的主观期待,无具体计划或时间表的客观依据。)

原文内容:

众神听到了埃隆·马斯克的声音。
到今年年底,我们或许终于能看到一部配得上这位传奇人物的荷马《奥德赛》版本。

从 Grok Imagine 目前能创作出的内容来看……我们大概可以期待一部宏大的作品。

你最想先看到哪个场景:独眼巨人、喀耳刻,还是塞壬?

⏰ 19:00 | ❤️ 34点赞 | 📝 94字 | 查看原文 →

↑ 返回顶部

【AI 英文奏折】07月24日Rohan Paul @rohanpaul_ai

Compiling in real-time, the race towards AGI. The Largest Show on X for AI. | 影响力: 0万粉丝

💡 核心观点: AI将加速解决所有可验证的数学问题。

可信度: 6/10 – 1项声明可直接验证;1项需进一步确认;2项为观点陈述

事实核查:

  • ◐ 部分可验证: AI 又一次在数学领域获胜。 (需核实近期是否有AI在数学领域取得突破性成果(如证伪猜想)的公开报道或论文,但“获胜”是主观表述,需明确标准。)
  • ✓ 可验证: 来自80年代的两个猜想和2002年的一个猜想本周全部被证伪。 (可通过数学期刊、预印本平台(如arXiv)或学术机构公告验证具体猜想名称、证伪时间及参与方是否为AI。)
  • ◦ 观点: 数学知识增长的速度已被计算能力取代,且计算能力会指数级增长。 (前半部分为对数学研究模式的断言,无量化标准;后半部分“指数级增长”是技术发展的常见假设,但属于预测性观点。)

原文内容:

AI 又一次在数学领域获胜。

来自 80 年代的两个猜想和 2002 年的一個猜想本周全部被证伪。

而且这是 AI 在数学领域将有的最慢速度。

任何有可验证答案的问题,都有潜力以推理速度被解决。

数学知识一直以来都以人类耐心的速度增长,但现在这已被计算能力所取代,而计算能力还会指数级增长。

⏰ 12:46 | ❤️ 89点赞 | 📝 116字 | 查看原文 →

↑ 返回顶部

【AI 英文奏折】07月24日Amira Zairi @azed_ai

AI Educator & Creator | Ambassador @Adobe @LeonardoAi & @tripoai | Partner with leading brands | Collaboration → [email protected] | 影响力: 57.13k万粉丝

💡 核心观点: 阿尔及利亚野火肆虐,致人畜伤亡,消防员奋力救援。

可信度: 6/10 – 1项声明可直接验证;2项需进一步确认;1项为观点陈述

事实核查:

  • ◐ 部分可验证: 199场野火袭击了超过22个阿尔及利亚州 (可通过阿尔及利亚政府或消防部门发布的官方灾情报告、国际灾害监测机构(如NASA FIRMS)的卫星数据验证火灾数量和波及范围,但需确认具体统计时间和数据来源的权威性。)
  • ◐ 部分可验证: 人们和动物丧生,医院和房屋被烧毁 (人员伤亡和财产损失可通过地方政府或红十字会等组织的灾情通报核实,但动物死亡数据可能缺乏系统统计,需依赖局部报道或目击者记录。)
  • ✓ 可验证: 大火今天仍在摧毁我们的绿色空间 (可通过实时卫星图像(如Copernicus EMS)或阿尔及利亚环境部门的火灾动态更新直接验证火灾是否持续。)

原文内容:

将近10天来,我的祖国一直在燃烧  

199场野火袭击了超过22个阿尔及利亚州

人们和动物丧生,医院和房屋被烧毁,而大火今天仍在摧毁我们的绿色空间

我的思念与每一个受影响的家庭同在,与每一位冒着生命危险保护我们称之为家园之地的消防员同在

⏰ 01:20 | ❤️ 24点赞 | 📝 102字 | 查看原文 →

↑ 返回顶部

【AI 英文奏折】07月24日Emily @iamemily2050

Any sufficiently advanced technology is indistinguishable from magic. | 影响力: 48.2k万粉丝

💡 核心观点: 推文指导如何用两个系统改写用户内容生成图像提示。

可信度: 10/10 – 3项声明可直接验证;1项需进一步确认;1项为观点陈述

事实核查:

  • ✓ 可验证: Capillary Record系统通过雨水、汗水、冷凝等流体条件展示后果 (该声明描述的是虚构创作系统(如AI图像生成工具)的功能逻辑,无公开技术文档或官方说明支持其具体实现方式,属于工具设计理念范畴。)
  • ✓ 可验证: Gesture Script系统通过姿势、手势、肩膀动作等定义压力表现 (同样属于AI图像生成工具的预设功能描述,未提供实际代码或算法验证途径,且“压力路径”等术语缺乏客观标准。)
  • ◐ 部分可验证: 要求保留主题、身份、服装等原始内容(for edits项) (部分可验证,需实测AI工具是否真能按此规则处理编辑请求,但具体表现可能因模型版本或输入差异而变化。)

原文内容:

系统提示:毛细序列  

将用户的文本、图像或两者重写为一个适用于GPT Image Gen V2或Nano Banana Pro的提示。除非明确提及Nano,否则默认使用GPT。使用用户的语言书写,保留原文精确内容,并维持所请求或原始比例。  

采用两套系统:  
- **姿态脚本**通过姿势、手部、肩膀、视线、裁剪、间距、重复状态和动作方向来定义压力。  
- **毛细记录**通过雨水、汗水、冷凝、湿发、潮湿布料、蒸汽、水滴、反光或其他请求支持的流体状态来展现结果。  

请勿将它们混合成一张湿漉漉的动漫肖像。需明确主体、具体动作、压力路径、湿气来源、受影响表面、可见结果,以及两到四个由压力引发的交汇点。  

保留主体、数量、身份、解剖结构、场景、服装、物品、颜色、文本和参考角色。对于编辑内容,保留所有未被要求修改的部分。风格参考仅用于姿态节奏、轮廓、湿气行为、光线衰减、裁剪和细节布局,不得复制其主体、姿势、服装或场景。  

姿态必须保持手部、关节、肩膀、脊柱、头部、视线和平衡的一致性。默认使用单一状态。仅当展示准备、发力、后坐、犹豫或释放时,才使用两到三个姿势呼应。仅在请求时使用分镜。重复必须推动动作发展。  

湿气需有来源,并遵循重力、气流、粘附、吸收、曲率和表面张力。湿发会成簇并黏附。皮肤呈现不均匀的薄膜和水滴,而非均匀光泽。布料会变暗、增重,并在压力点紧贴身体。玻璃根据角度产生雾气、条纹、反光和透光。每个水滴需具备比例、附着点、方向和停止点。  

交汇点可能包括:手部路径带出的水雾、湿发改变面部轮廓、潮湿布料显露身体转动、反光中重复的姿势、冷凝遮蔽某一区域,或移动后残留的湿润接触痕迹。每个交汇点需有物理成因。  

保持一条压力路径、一条湿气路径、一个焦点交汇点以及清晰的负空间。去除重复、赞美、情绪标签、浮夸术语、虚假技术细节、通用缺陷列表和未解决的备选方案。使用具体名词和主动动词。避免使用长破折号或短破折号。  

GPT:返回500至800字,分五段描述场景、主体、姿态、湿气、交汇点、构图、保留内容、文本及失败之处。  

NANO:仅返回有效的JSON,1000至1800个词符,包含"aspect_ratio"、"references"、"scene"、"subjects"、"gesture_script"、"capillary_record"、"junctions"、"composition"、"surface"、"text"、"avoid"。省略未使用的字段。不含元数据、ID、权重、注释或重复事实。  

仅返回完成的提示。

⏰ 05:45 | ❤️ 56点赞 | 📝 391词 | 查看原文 →

↑ 返回顶部

【AI 英文奏折】07月24日Aakash Gupta @aakashgupta

✍️ product-growth.com 💼 https://t.co/STzr4nqxnm 🤝 https://t.co/SqC3jTyP03 🎙️ https://t.co/fmB6Zf5UZv | 影响力: 278.7k万粉丝

💡 核心观点: 推文详解大语言模型原理、应用场景及优化技巧。

可信度: 10/10 – 3项声明可直接验证;2项需进一步确认

事实核查:

  • ◐ 部分可验证: 大语言模型(LLMs)实际如何工作 (LLM的工作原理(如Transformer架构、训练过程等)可通过学术论文(如原始Transformer论文)或技术博客(如OpenAI/DeepMind的官方文章)验证,但具体实现细节可能因模型和厂商保密性而部分不可公开验证。)
  • ✓ 可验证: RAG如何消除幻觉 (检索增强生成(RAG)通过结合外部知识库减少模型幻觉的机制,已在多篇研究论文(如Meta的RAG论文)和开源框架(如LangChain文档)中说明,技术原理和案例可公开验证。)
  • ✓ 可验证: 为什么模型会产生幻觉 (模型幻觉的成因(如训练数据偏差、概率生成机制等)有大量学术研究支持(如Google Brain的《Language Models are Few-Shot Learners》),可通过权威AI研究机构的公开文献验证。)

原文内容:

这些家伙真的是在技术AI基础知识上进行了一次大师级课程:

3:22 - 大语言模型(LLMs)实际如何工作
5:24 - 什么是温度(temperature)
7:05 - 什么是上下文窗口
7:59 - 从零开始构建一个工具
10:28 - 为什么MCP存在
12:03 - 什么让一个代理成为代理
12:43 - 技能的力量
16:47 - LangChain的作用
20:50 - RAG如何消除幻觉
23:36 - 什么时候你不需要框架
25:26 - 路由如何工作
28:34 - 为什么路由器能节省数百万
31:35 - 模拟面试:LLM还是ML?
35:50 - 为什么模型会产生幻觉

⏰ 05:37 | ❤️ 23点赞 | 📝 133字 | 查看原文 →

↑ 返回顶部

【AI 英文奏折】07月24日Anthony Pompliano @apompliano

Entrepreneur, investor, and lifelong learner. | 影响力: 2134k万粉丝

💡 核心观点: 讨论通胀成因、政策影响及比特币与黄金的未来前景。

可信度: 1/10 – 基于事实核查结果综合评估

事实核查:

  • ✗ 无法验证: AI、机器人、关税和驱逐出境是通缩性的
  • ✗ 无法验证: 验证状态:partially verifiable
  • ✗ 无法验证: 说明:** 该声明涉及经济学理论(通缩性影响),需结合具体数据(如关税政策对物价的实证研究、AI对生产力的影响等)验证,但不同学派可能存在争议,且“通缩性”的界定需明确标准。

原文内容:

我与@PeterSchiff展开对话,深入探讨了通货膨胀、美联储的政治动机,以及人工智能与关税政策究竟会加剧还是缓解通胀。

我们还分析了伊朗冲突对石油市场的影响、社会保障体系即将面临的崩溃危机,以及关于比特币与黄金的五年赌约。

YouTube: https://youtube.com/watch?v=KxY3-K-KRyM&t=1400s…
Spotify: https://open.spotify.com/episode/6jasEurQ6J2inBTrf5lwMA?si=VAtZIwU7T-S3URGACZcOEA…
Apple: https://podcasts.apple.com/us/podcast/bitcoin-debate-pomp-destroys-peter-schiff/id1434060078?i=1000778090154…

时间轴:
0:00 - 开场白
0:50 - 当前实际通胀率究竟多高?
14:36 - 人工智能、自动化、关税与移民政策:能否抑制通胀?
25:24 - 伊朗战事会否恶化通胀形势?
33:40 - 通胀率会突破两位数吗?(特朗普与拜登的责任归属)
40:29 - 迫在眉睫的社会保障体系崩塌
50:14 - Peter Schiff是否持有比特币?
52:43 - 比特币vs黄金:实际表现数据对比
1:00:45 - 比特币与黄金的世纪赌约
1:05:40 - "疯狂叔叔投资组合"解析
1:10:02 - Peter Schiff的真实持仓揭秘
1:18:54 - 终场

⏰ 05:28 | ❤️ 82点赞 | 📝 202字 | 查看原文 →

↑ 返回顶部

【AI 英文奏折】07月24日Rohan Paul @rohanpaul_ai

Compiling in real-time, the race towards AGI. The Largest Show on X for AI. | 影响力: 0万粉丝

💡 核心观点: 新方法通过外部适配器为冻结模型注入知识。

可信度: 10/10 – 2项声明可直接验证;3项需进一步确认

事实核查:

  • ◐ 部分可验证: @NaceAI的新论文提出了一种方法,可在不重写语言模型核心参数的情况下添加大量知识体 (需查阅论文原文或官方发布的技术细节,确认方法的具体实现和实验设计,但若论文未公开或缺乏开源代码,则验证受限。)
  • ◐ 部分可验证: 该方法通过添加低秩矩阵与基础模型并行运行,存储新知识并重定向内部计算 (需依赖论文中的数学描述或实验代码验证低秩矩阵的设计和效果,但若技术细节不足或未开源实现,则无法完全验证。)
  • ✓ 可验证: 生成的适配器更新在目标语言模型变大时泛化效果更好 (可通过论文中的实验数据(如不同规模模型的性能对比)直接验证,但需假设实验设计合理且数据透明。)

原文内容:

@NaceAI 的新论文展示了一种可能的方法,可以在不重写语言模型核心参数的情况下添加大量知识体。

这项研究推进了一个关键的持续学习目标:教模型学习新事实,同时不直接干扰其现有参数。

也就是说,这种方法可能减少了每次知识变化时反复更改数十亿基础模型参数的需求。

核心思想是,一个模型可以学会如何为另一个模型制造知识更新。

基础模型的权重从不动,但会额外添加低秩矩阵与之并行。这些矩阵承载注入的信息,并将模型的内部计算重定向到由这些事实支持的答案。

这里的知识注入成为一个可重用的过程,而不是为每个事实语料库单独进行微调任务。

该方法将存储新事实与必须对其进行推理的语言模型分开。

一个冻结的语言模型可以通过生成的适配器吸收新知识,同时保留其原始参数。

超网络就像一个编译器,将事实转换为另一个模型内部的临时变化。

最强有力的结果是,这些生成的更新在目标语言模型变大时泛化得更好。

⏰ 05:27 | ❤️ 47点赞 | 📝 350字 | 查看原文 →

↑ 返回顶部

【AI 英文奏折】07月24日levelsio @levelsio

Nomad List & Remote OK. Building in public. Solo maker. | 影响力: 320.0k万粉丝

💡 核心观点: 家庭自动化应以实体按钮为主,智能控制为辅。

可信度: 6/10 – 1项声明可直接验证;1项需进一步确认;2项为观点陈述

事实核查:

  • ◐ 部分可验证: 家中的所有设备都使用模拟开关,并通过KNX系统与Home Assistant配合工作 (需实际查看设备配置或KNX与Home Assistant的兼容性文档,但无法通过推文直接验证具体实现。)
  • ◦ 观点: 此前讨厌家庭自动化,因为不想依赖手机或iPad控制设备 (属于个人主观偏好,无客观事实依据,无法验证。)
  • ◦ 观点: 家庭自动化应以模拟按钮为先,再通过隐形方式整合(如定时调光) (属于设计理念或愿景陈述,缺乏具体技术或产品支持,无法客观验证。)

原文内容:

我家里的所有东西都是模拟开关,带KNX(欧洲系统,随房子一起来的),但它通过一个小设备与Home Assistant配合工作,这意味着所有东西都是模拟按钮,但你可以自动化控制它们

在此之前我讨厌家庭自动化,因为我不想用手机或墙上的iPad来控制东西,那真是太糟糕了

它应该始终以模拟按钮为先,然后再进行整合,你可以以一种隐形的方式添加家庭自动化(比如晚上10点把灯光调成红色)

⏰ 04:52 | ❤️ 132点赞 | 📝 150字 | 查看原文 →

↑ 返回顶部

© 版权声明

相关文章

暂无评论

暂无评论...