【AI 英文奏折】07月19日

【AI 英文奏折】2026年07月19日

共收录 22 篇深度内容


📋 今日内容速览

快速浏览,点击感兴趣的推文查看详细分析

  1. Rohan Paul: Kimi K3在法律自动化测试中表现远超Claude Fable 5。
  2. Aakash Gupta: 86岁员工被裁后转职获高薪,服务型岗位反促企业高营收。
  3. Machina: 顶尖运营者同时使用多款AI工具,按任务类型分配最优选择。
  4. Santiago Valdarrama: Linux体验不佳,仍倾向Mac的便捷稳定。
  5. levelsio: 3%安全提现率可永续维持资产并获取稳定收益。
  6. Aakash Gupta: 招聘决策受主观叙事影响,相同简历可能得出相反结论。
  7. Aakash Gupta: Taylor Farms多次卷入食品安全事件却持续盈利。
  8. Rohan Paul: Grok 4.5性价比高,性能接近顶级模型但成本大幅降低。
  9. levelsio: AI优化拨号上网速度突破200kbps。
  10. swyx: 欧洲拥有顶尖AI人才,全球竞争激烈。
  11. levelsio: 欧洲人漠视言论自由,易被剥夺权利。
  12. Ethan Mollick: 大模型用英语思考中文诗歌,凸显语言处理偏好。
  13. levelsio: 创业公司被收购后创始人年化收益与创始人数量成反比。
  14. The Turing Post: AI助手记忆越多越可能虚构用户信息。
  15. levelsio: 荷兰风车研磨的越南肉桂口感极佳,求推荐优质肉桂来源。
  16. fofr: 无人机表演技术精湛,飞行特技引人注目。
  17. levelsio: 风投融资稀释股权,创始人最终持股常仅剩5%。
  18. Rohan Paul: Kimi K3性能大幅提升,DeepSWE测试得分跃升38分。
  19. Marc Lou: 低多巴胺网站TrustMRR月访客20万且用户黏性高。
  20. SemiAnalysis: Kimi K3的KDA注意力虽降带宽,但AI网络交换机市场不会萎缩。
  21. SemiAnalysis: 增量KV缓存优化减少预填带宽占用。
  22. SemiAnalysis: 高效注意力机制推动AI应用普及,增加网络需求。

📖 详细内容

【AI 英文奏折】07月19日Rohan Paul @rohanpaul_ai

Compiling in real-time, the race towards AGI. The Largest Show on X for AI. | 影响力: 0万粉丝

💡 核心观点: Kimi K3在法律自动化测试中表现远超Claude Fable 5。

可信度: 6/10 – 3项需进一步确认;1项为观点陈述

事实核查:

  • ◐ 部分可验证: Kimi K3在自主法律工作基准测试中表现接近Claude Fable 5的两倍(26.7% vs 14.2%) (需查看具体基准测试的官方报告或实验设计,若测试方法、数据集和评分标准未公开则无法完全验证。)
  • ◐ 部分可验证: 测试涵盖24个法律领域的120项私人任务,包括备忘录和证词摘要 (需核实测试任务的具体构成和领域分布,若任务细节或样本未公开则部分可验证。)
  • ◐ 部分可验证: 模型需完全自主处理案件文件并生成法律文档,任一评分项未通过即视为任务失败 (需确认评分规则和任务流程的官方说明,但严格性描述可能依赖测试设计者的主观标准。)

原文内容:

在一项要求严苛的自主处理法律工作的基准测试中,Kimi K3以近两倍的优势领先其最接近的竞争对手Claude Fable 5。

Kimi K3得分26.7%,而Claude Fable 5为14.2%。

该测试涵盖24个法律领域的120项实务任务,包括备忘录和证言摘要撰写。

每个模型接收案件卷宗后自主处理,最终生成完整的法律文件。

所有评分项必须全部达标,任何细节疏漏都会导致整项任务失败。这种严格评分机制解释了为何即使是领先者也只能完成26.7%的任务。

但总体而言,每百项任务仅成功27项的结果表明,AI要实现完全无需监督的法律工作仍任重道远。

⏰ 09:43 | ❤️ 36点赞 | 📝 99词 | 查看原文 →

↑ 返回顶部

【AI 英文奏折】07月19日Aakash Gupta @aakashgupta

✍️ product-growth.com 💼 https://t.co/STzr4nqxnm 🤝 https://t.co/SqC3jTyP03 🎙️ https://t.co/fmB6Zf5UZv | 影响力: 278.7k万粉丝

💡 核心观点: 86岁员工被裁后转职获高薪,服务型岗位反促企业高营收。

可信度: 10/10 – 3项声明可直接验证;1项需进一步确认;1项为观点陈述

事实核查:

  • ◐ 部分可验证: Sam’s Club取消了一位86岁迎宾员的职位,该员工在该岗位工作12年。 (Sam’s Club的裁员政策及具体案例可通过公司公告或媒体报道验证,但需核实该员工的具体信息(如年龄、在职时长)是否公开披露。)
  • ✓ 可验证: Chick-fil-A每家餐厅年均收入930万美元,麦当劳每家年均收入370万美元。 (连锁餐厅的年均收入数据可通过公司财报、行业报告(如QSR Magazine)或权威商业媒体(如 Forbes)验证,但需注意是否为最新数据及统计口径差异。)
  • ✓ 可验证: Chick-fil-A设立“dining host”岗位(无收银/烹饪职责,专注清洁与互动),而沃尔玛在2019年取消了类似迎宾员岗位。 (Chick-fil-A的岗位描述可通过官网或招聘信息验证;沃尔玛2019年取消迎宾员的信息可通过历史新闻(如CNN、WSJ)核实。)

原文内容:

山姆会员店取消了一位在门口值守12年的迎宾员岗位,这位老人当时已86岁。退休两个月后他感到无聊,向福乐鸡(Chick-fil-A)提交了求职申请——这家连锁企业正以全职薪酬雇佣被山姆砍掉的同类型岗位。

这家每周日歇业的连锁品牌,单店年均营业额达930万美元。而全年无休的麦当劳单店年均营业额约为370万美元。

该岗位被称为餐厅接待员。无需操作收银台或油炸机,只需巡视用餐区、清理餐桌、与顾客交谈。按照电子表格逻辑,这应是首要削减的支出项目,沃尔玛在2019年逐步取消门店迎宾员时正是执行了这套算法。

福乐鸡却采用了相反的算法。快餐业的利润取决于复购率——同一顾客每月重复消费的次数。收银员能完成服务流程,但有空闲的餐厅接待员能让缺席一周的顾客感受到被惦记。

吉尔先生验证了这个模式。他因感冒请假两天,店主便收到数百位顾客询问他的去向。数百人与快餐店用餐区建立了人情纽带,这是任何广告预算都买不到的留存率。

山姆会员店看到86岁的迎宾员时只看到成本,福乐鸡却以相同岗位构建出全美最赚钱的餐厅模式——他们从这位老人身上看到了不同的价值。

⏰ 18:27 | ❤️ 263点赞 | 📝 230词 | 查看原文 →

↑ 返回顶部

【AI 英文奏折】07月19日Machina @exm7777

running ai-powered agencies | weeklyaiops.com | 影响力: unknown万粉丝

💡 核心观点: 顶尖运营者同时使用多款AI工具,按任务类型分配最优选择。

可信度: 6/10 – 1项声明可直接验证;2项需进一步确认;1项为观点陈述

事实核查:

  • ◐ 部分可验证: 顶级运营者同时使用Claude Code、Codex和Hermes三种工具,并根据任务类型路由到不同工具 (需实测或调查实际用户案例才能确认是否“顶级运营者”普遍采用此策略,且工具的具体分工(如Claude Code用于“人类可读内容”)需依赖官方文档或用户反馈验证。)
  • ◐ 部分可验证: Claude Code专长于生成人类可读内容(如提案、交付物),Codex用于构建工作流和内部工具,Hermes负责自动化重复任务 (各工具的功能描述可能基于官方文档(如Codex确实以代码生成为主),但“专长”划分是否为官方定位或用户共识需进一步验证,Hermes的“自动化”能力若未公开则无法确认。)
  • ✓ 可验证: 通过五个命名代理(named agents)覆盖业务五个部分,并在共享空间中互相审查 (未提供具体代理名称、业务划分逻辑或共享空间的实现方式,缺乏公开信息或案例支持,可能为推文作者的个性化方法。)

原文内容:

以下是顶尖运营者中前1%正在采用的配置方案:

他们并非仅依赖Claude Code、Codex或Hermes中的单一系统——而是同时运行这三者协同工作

每套系统各有所长,因此无需取舍,只需将每项任务定向至最适合的专用工具:

> Claude Code,文案专家:处理所有人类阅读内容——包括文案撰写、方案策划、客户交付物
> Codex,构建专家:打造维系团队协作的工作流与内部工具
> Hermes,永续引擎:自动处理周期性重复任务

随后为业务的五大板块分别配置五位命名智能体,让它们在一个共享空间内相互校验

完整协同系统的搭建方法如下:

⏰ 03:30 | ❤️ 191点赞 | 📝 118词 | 查看原文 →

↑ 返回顶部

【AI 英文奏折】07月19日Santiago Valdarrama @svpino

| 影响力: unknown万粉丝

💡 核心观点: Linux体验不佳,仍倾向Mac的便捷稳定。

可信度: 8/10 – 2项声明可直接验证;1项需进一步确认;1项为观点陈述

事实核查:

  • ✓ 可验证: 用户已使用Linux全职工作60天,并停止使用Mac (此声明基于个人经历,无公开数据或第三方记录可验证其真实性)
  • ◦ 观点: Framework 13 Pro + Omarchy组合体验良好,用户会毫不犹豫再次选择此组合 (此为个人主观偏好,无客观标准验证其“良好”或“毫不犹豫选择”的结论)
  • ◐ 部分可验证: Linux仍存在兼容性问题,应用提供商支持不足,需花费更多时间解决问题 (部分可验证(如查看应用官网是否提供Linux版本),但“花费时间”和“粗糙体验”依赖用户主观感受)

原文内容:

我全职使用Linux并放弃Mac已满60天。

我想回去了。

总体而言,Framework 13 Pro搭配Omarchy的组合给了我惊喜。这套系统充满乐趣,如果现在让我重新选择,我依然会毫不犹豫地选它——在除Mac之外的所有设备中。

简而言之,困扰我的核心问题是:Linux生态仍然粗糙,且被我的应用服务商遗忘。我不得不耗费大量时间处理那些在Mac上能直接运行的事务。

原计划是进行90天试用,现在还剩下30天。但此时此刻,我已经决定回归Mac。

⏰ 20:45 | ❤️ 268点赞 | 📝 108词 | 查看原文 →

↑ 返回顶部

【AI 英文奏折】07月19日levelsio @levelsio

Nomad List & Remote OK. Building in public. Solo maker. | 影响力: 320.0k万粉丝

💡 核心观点: 3%安全提现率可永续维持资产并获取稳定收益。

可信度: 10/10 – 3项声明可直接验证;2项需进一步确认

事实核查:

  • ◐ 部分可验证: 3%的年提取率可以保持本金净值不变或增长(即“安全提取率”) (这一声明基于金融领域的“4%规则”变体(3%版本),但具体比例是否“安全”取决于市场条件、资产配置等,需结合历史数据或学术研究验证,无法直接通过单一来源确认。)
  • ✓ 可验证: 拥有3300万美元资产可实现每年100万美元的永久提取 (通过简单数学计算(100万÷3%≈3300万)可验证,但前提是接受3%为“安全提取率”的假设。)
  • ◐ 部分可验证: 亿万富翁通常投资生物科技、长寿研究或建造新城市 (部分富豪(如贝索斯、马斯克)确有此类投资,但“通常”这一概括需统计支持,且“建造新城市”多为个别案例(如Neom项目),无法普遍验证。)

原文内容:

通常每年提取这笔资金的3%,同时保持本金净值不变或增长  

即所谓的"安全提现率"  

因此,若想每年永久获得100万美元,你需要3300万美元资产  

拥有100万美元意味着每年可永久提取3万美元  

若拥有10亿美元,则每年可永久获得3000万美元——到了这个层级往往关乎影响力,比如投资生物科技、延寿技术,或是为人类建造新城市  

至于埃隆·马斯克这种级别,就要迈向太空实现星际文明了!

⏰ 08:46 | ❤️ 225点赞 | 📝 81词 | 查看原文 →

↑ 返回顶部

【AI 英文奏折】07月19日Aakash Gupta @aakashgupta

✍️ product-growth.com 💼 https://t.co/STzr4nqxnm 🤝 https://t.co/SqC3jTyP03 🎙️ https://t.co/fmB6Zf5UZv | 影响力: 278.7k万粉丝

💡 核心观点: 招聘决策受主观叙事影响,相同简历可能得出相反结论。

可信度: 6/10 – 1项声明可直接验证;2项需进一步确认;1项为观点陈述

事实核查:

  • ◐ 部分可验证: Gal Eshel在Google的招聘委员会任职六年,负责评估Googleyness评分 (可通过LinkedIn等职业履历平台验证Gal Eshel的Google任职经历及具体职责,但“Googleyness评分”的具体标准属于内部流程,公开信息有限。)
  • ✓ 可验证: 人类大脑会自动将零散事实整合为故事(The Storytelling Animal理论) (该理论源自心理学和神经科学领域,相关研究(如Jonathan Gottschall的著作《The Storytelling Animal》)可公开查阅,属于已验证的认知机制。)
  • ◐ 部分可验证: 招聘委员会对同一份简历的两次评估可能得出相反结论,取决于候选人是否通过故事串联经历 (可通过行为实验(如向不同招聘小组提交相同简历)部分验证,但推文中的具体案例(如微软Azure候选人)缺乏公开数据支撑。)

原文内容:

同一个招聘委员会可能对同一份简历给出截然相反的评判。

加尔·埃谢尔在谷歌的招聘委员会任职六年,负责评估应聘者的"谷歌特质"是否达标。他最重要的发现无关工作经验,而关乎一个名为"叙事动物"的理论。

人类大脑无法单纯记忆原始事实。当我们看到零散信息点时,大脑会自动编织故事。走进厨房看见冰箱门敞开、牛奶洒在地上、猫咪晒太阳——没人会记住三个孤立事实,所有人都会脑补出一个场景。

面试小组同样如此。若候选人只是罗列工作经历而不建立关联,评审者并不会保持中立。他们的大脑会自动填补空白,且往往倾向于最负面的解读:频繁跳槽、缺乏方向。

加尔曾见证同一份简历因两种讲述方式获得不同结果。计算机科学专业出身,先后担任后端工程师、某云公司后端产品经理、微软Azure工程师,最后转做用户端岗位。平铺直叙时,这像在描述职业漂流。

若将其呈现为十年间持续探索用户产品体验的历程,相同的工作经历立刻成为连贯轨迹的佐证。相同的职位。相同的年份。相同的公司。不同的结论。

多数候选人准备的是事实堆砌:框架模板、要点罗列,指望面试官自行拼凑逻辑。他们不会这么做。即便做了,也只会朝着当天的主观倾向解读。

在别人替你编故事之前,先讲好自己的故事。

⏰ 08:32 | ❤️ 23点赞 | 📝 244词 | 查看原文 →

↑ 返回顶部

【AI 英文奏折】07月19日Aakash Gupta @aakashgupta

✍️ product-growth.com 💼 https://t.co/STzr4nqxnm 🤝 https://t.co/SqC3jTyP03 🎙️ https://t.co/fmB6Zf5UZv | 影响力: 278.7k万粉丝

💡 核心观点: Taylor Farms多次卷入食品安全事件却持续盈利。

可信度: 10/10 – 2项声明可直接验证;2项需进一步确认;1项为观点陈述

事实核查:

  • ◐ 部分可验证: Taylor Farms与2024年麦当劳大肠杆菌疫情(致1人死亡)、2013年沙拉混合菜环孢子虫疫情以及当前塔可钟生菜致病事件有关 (需核查FDA或州卫生部门发布的疫情调查报告、企业召回公告等公开记录,但需确认具体关联性(如是否为唯一供应商)。历史疫情记录(如2013年环孢子虫事件)可部分通过FDA档案验证,但2024年事件可能因时效性尚未完全公开。)
  • ◐ 部分可验证: Taylor Farms为私营企业,30年由同一家族全资控股,年收入73亿美元,员工2.5万人 (企业营收和员工规模可通过商业数据库(如Dun & Bradstreet)或行业报告间接验证,但私营公司无需公开详细财务数据。所有权结构需依赖公司声明或媒体报道,无强制披露要求。)
  • ✓ 可验证: FDA未对Taylor Farms在2013年环孢子虫疫情及2024年洋葱疫情后采取监管行动 (FDA的执法行动(如警告信、处罚)会公开在官网数据库,可通过检索历史记录验证。但需注意“监管行动”的明确定义(如是否包含非公开调查)。)

原文内容:

一家私营企业现已卷入多起食品安全事件:麦当劳大肠杆菌疫情(2024年致一人死亡)、2013年沙拉混合菜环孢子虫疫情,以及当前导致塔可贝尔顾客生病的生菜问题——泰勒农场。这家年收入73亿美元、拥有2.5万名员工的企业,三十年来始终由同一家族百分百控股。

本周美国食药监局已紧急通告印第安纳、肯塔基、密歇根、俄亥俄和西弗吉尼亚州居民停止食用切丝生菜。全美34州已确诊或正在调查近7000例环孢子虫感染病例,其中141人住院。这种寄生虫会导致长达数周的水样腹泻。

2013年疫情后,食药监局未对泰勒农场采取任何监管措施;2024年洋葱污染事件造成1人死亡、104人患病后,监管机构依旧无动于衷。该公司只需召回产品、发布"深切关注"声明,供应链便能迅速重启。

私有化正是其核心策略。上市公司遭遇疫情时股价必然暴跌,而泰勒农场却能避开财报电话会议——没有股价压力,无需向外部股东交代。这种封闭性既保障了长期投资能力,也使其能每隔数年消化一次食品安全危机后继续运营。

舆论炮火总由餐饮品牌承受。塔可贝尔的名字出现在每篇报道标题,种植商的名字却深埋第四段甚至只字不提。这正是塔可贝尔选择低价供应商的交易本质:他们承担品牌风险,泰勒农场坐收利润。

同一家企业。三度引发疫情。零监管问责。

⏰ 11:17 | ❤️ 260点赞 | 📝 258词 | 查看原文 →

↑ 返回顶部

【AI 英文奏折】07月19日Rohan Paul @rohanpaul_ai

Compiling in real-time, the race towards AGI. The Largest Show on X for AI. | 影响力: 0万粉丝

💡 核心观点: Grok 4.5性价比高,性能接近顶级模型但成本大幅降低。

可信度: 6/10 – 3项需进一步确认;2项为观点陈述

事实核查:

  • ◐ 部分可验证: Grok 4.5的“每美元智能指数任务”成本为0.31美元,性能接近前沿模型,成本约为Claude Fable 5的1/9、Claude Opus 4.8的1/6、GPT-5.6 Sol或Kimi K3的1/3 (需第三方平台(如Artificial Analysis)公开的基准测试和定价数据支持,但具体模型版本(如GPT-5.6 Sol)的命名和成本可能非官方披露,需进一步核实。)
  • ◐ 部分可验证: Grok 4.5在onFrontierSWE排名中接近顶尖,且使用的token数量比Fable 5少6倍 (需查看onFrontierSWE排名及token消耗的公开测试报告,但该排名是否为广泛认可的基准尚不确定,且模型对比需相同任务条件。)
  • ◦ 观点: Grok 4.5的低成本优势在实际应用中比基准测试小幅领先更重要 (属于主观价值判断,无直接数据证明“实际应用效果”优于基准测试差异。)

原文内容:

从单位美元智能成本来看,Grok 4.5表现惊艳。根据Artificial Analysis的智能指数任务测算,其单次任务成本仅0.31美元,却能提供接近前沿水平的性能——价格约为Claude Fable 5的1/9、Claude Opus 4.8的1/6,相当于GPT-5.6 Sol或Kimi K3成本的1/3。

结合令牌消耗数据更能说明问题:在onFrontierSWE排行榜保持顶尖水平的同时,Grok 4.5的令牌消耗量比Fable 5少了近六倍。

对多数现实AI应用而言,这种优势远比基准测试中的微弱领先更具价值。更低的单任务成本意味着更经济的智能体、更高的使用上限、更快的测试周期,以及规模化时更优的利润空间。

前沿模型的竞争焦点必须从"原始智能"转向"效能智能"。

⏰ 11:52 | ❤️ 88点赞 | 📝 115词 | 查看原文 →

↑ 返回顶部

【AI 英文奏折】07月19日levelsio @levelsio

Nomad List & Remote OK. Building in public. Solo maker. | 影响力: 320.0k万粉丝

💡 核心观点: AI优化拨号上网速度突破200kbps。

可信度: 5/10 – 2项需进一步确认;2项为观点陈述

事实核查:

  • ◐ 部分可验证: New 200kbps+ speed record on the dial up modem on http://pieter.com (可通过访问http://pieter.com查看是否提及该记录,但需实测或第三方工具验证速度是否属实。)
  • ◐ 部分可验证: Hacked Em-DOSBox with AI to increase speeds (需检查Em-DOSBox的官方或开源项目是否提及AI优化,或通过代码审查验证修改内容,但具体实现细节可能未公开。)
  • ◦ 观点: I think we’re hitting the limits of what’s possible (此为个人主观判断,无客观技术标准或数据支持。)

原文内容:

在http://pieter.com网站上创下拨号调制解调器200kbps+新速度纪录

通过AI技术破解增强Em-DOSBox实现提速,我认为我们正在逼近技术极限——但若能在Windows 3.11系统上实现1mbps速率将极为震撼

⏰ 07:54 | ❤️ 81点赞 | 📝 39词 | 查看原文 →

↑ 返回顶部

【AI 英文奏折】07月19日swyx @swyx

| 影响力: unknown万粉丝

💡 核心观点: 欧洲拥有顶尖AI人才,全球竞争激烈。

可信度: 4/10 – 2项需进一步确认;1项为观点陈述

事实核查:

  • ◐ 部分可验证: Europe has some of the top AI engineers in the world if you elicit the right ones. (可通过行业排名(如学术论文引用量、知名AI竞赛结果)或企业招聘数据间接验证,但“top”和“right ones”缺乏明确标准,需进一步定义。)
  • ◐ 部分可验证: Europe is running the most competitive global arena for AI talent (measured by talks and workshops). (可通过统计国际AI会议(如NeurIPS、ICML)中欧洲主办或参与的演讲/工作坊数量验证,但“most competitive”需与其他地区对比,主观性较强。)
  • ◦ 观点: WF entering the eval window will make the situation interesting to observe. (属于主观预测(“interesting”),且未明确“WF”和“eval window”具体指代内容,无法验证。)

原文内容:

那些对欧洲冷嘲热讽的人忽略了,只要方法得当,这里其实拥有全球顶尖的AI工程师群体。我们正在打造竞争最激烈的全球AI人才竞技场(以学术演讲和工作坊数量为衡量标准),随着WF进入评估阶段,后续发展将极具看点。

⏰ 07:50 | ❤️ 40点赞 | 📝 59词 | 查看原文 →

↑ 返回顶部

【AI 英文奏折】07月19日levelsio @levelsio

Nomad List & Remote OK. Building in public. Solo maker. | 影响力: 320.0k万粉丝

💡 核心观点: 欧洲人漠视言论自由,易被剥夺权利。

可信度: 6/10 – 1项声明可直接验证;1项需进一步确认;2项为观点陈述

事实核查:

  • ◦ 观点: 欧洲人对言论自由的意识非常薄弱,很容易被剥夺言论自由 (该声明是对欧洲人言论自由态度的主观评价,缺乏具体数据或可量化的标准支持,属于个人观点。)
  • ◐ 部分可验证: 35年前,欧洲有一半地区处于长达70年的共产主义独裁统治下,这些地区完全没有言论自由 (历史记录显示,东欧部分国家在冷战期间确实处于共产主义政权统治下,言论自由受到严格限制,但“一半欧洲”和“完全没有言论自由”的表述需要更精确的地理和时间范围验证。)
  • ◦ 观点: 诽谤删除是导致最终完全丧失言论自由的滑坡 (这是对诽谤删除政策后果的主观推断,属于观点陈述,缺乏直接证据证明其必然导致言论自由的完全丧失。)

原文内容:

如果你看不出诽谤删除机制如何成为一条最终导致言论自由彻底消失的滑坡,那我建议你去读读乔治·奥威尔的《1984》。

欧洲人对言论自由的观念非常淡薄,他们是最容易被剥夺言论自由的群体之一,即便有维护言论自由的意识,也往往不愿多作抗争。

这着实令人费解——毕竟就在35年前,整整半个欧洲还处于持续近70年的共产主义独裁统治之下,那种体制下显然不存在任何言论自由。

⏰ 07:12 | ❤️ 293点赞 | 📝 93词 | 查看原文 →

↑ 返回顶部

【AI 英文奏折】07月19日Ethan Mollick @emollick

Professor @Wharton studying AI, innovation & startups. Democratizing education using tech. Author of Co-Intelligence | 影响力: unknown万粉丝

💡 核心观点: 大模型用英语思考中文诗歌,凸显语言处理偏好。

可信度: 6/10 – 4项需进一步确认

事实核查:

  • ◐ 部分可验证: 当用户用中文要求Kimi K3挑选两首非陈词滥调的中文诗歌时,其思维链(chain-of-thought)中95.5%的字符是英文 (需实测相同请求,统计Kimi输出的思维链语言比例,但结果可能因模型版本或随机性变化,且“思维链”定义需明确(如是否包含隐藏推理过程)。)
  • ◐ 部分可验证: 当用户用中文要求Kimi K3挑选两首非陈词滥调的中文诗歌时,其思维链中88%的单词是英文 (同上,需实测并分词统计,但“单词”划分标准(如标点、中英文混合词处理)可能影响结果。)
  • ◐ 部分可验证: Kimi K3在明确为中文读者考虑中文诗歌时,思维链仍以英文为主 (可复现请求观察输出语言倾向,但“明确考虑”是主观描述,模型内部逻辑未公开。)

原文内容:

有趣的是,当我用中文要求Kimi K3挑选两首适用于大语言模型(LLM)的非陈词滥调诗歌时,其思维链中95.5%的字符(88%的词汇)仍为英文——即便它明确知道这是在为中文读者筛选中国古诗。

⏰ 07:24 | ❤️ 166点赞 | 📝 46词 | 查看原文 →

↑ 返回顶部

【AI 英文奏折】07月19日levelsio @levelsio

Nomad List & Remote OK. Building in public. Solo maker. | 影响力: 320.0k万粉丝

💡 核心观点: 创业公司被收购后创始人年化收益与创始人数量成反比。

可信度: 6/10 – 1项声明可直接验证;2项需进一步确认;1项为观点陈述

事实核查:

  • ◐ 部分可验证: “Median expected outcome for a startup that gets acquired in annualized earnings: Single founders: ~$4.27 million/year” (需依赖第三方统计数据(如并购案例库或行业报告)验证中位数,但具体数据来源未注明,且”annualized earnings”的计算方法未明确。)
  • ◐ 部分可验证: “15% odds of getting acquired in annualized earnings: One of four co-founders: ~$160,000/year” (收购概率和收益分配比例需结合具体行业数据验证,但推文未提供统计依据或样本范围,计算假设(如6年折现)可能影响结果。)
  • ◦ 观点: “Oddly close to tech salaries right? That’s how expected value in economics works!” (对比科技薪资与创业预期收益是主观推论,未提供薪资数据来源或经济学模型细节,属于个人解读。)

原文内容:

@sungamma 提出的绝妙建议:"将高于薪资的年化收益除以中位收购时间6年"

一家被收购初创企业的年化收益中位预期值:

单人创始人:约427万美元/年
一位联合创始人:约213万美元/年
四位联合创始人之一:约107万美元/年

15%被收购概率下的年化收益:

单人创始人:约64万美元/年
两位联合创始人之一:约32万美元/年
四位联合创始人之一:约16万美元/年

奇怪地接近科技行业薪资对吧?这就是经济学中期望值的运作方式!

⏰ 07:03 | ❤️ 159点赞 | 📝 81词 | 查看原文 →

↑ 返回顶部

【AI 英文奏折】07月19日The Turing Post @theturingpost

| 影响力: unknown万粉丝

💡 核心观点: AI助手记忆越多越可能虚构用户信息。

可信度: 10/10 – 2项声明可直接验证;3项需进一步确认

事实核查:

  • ◐ 部分可验证: LLMs在记忆用户信息后更容易产生幻觉(虚构内容),实验中幻觉率从接近0%上升到11.7% (需查阅原始论文验证实验设计、样本量和具体数据,但推文未提供论文标题或作者信息,需额外检索确认。)
  • ◐ 部分可验证: 研究者通过强制模型追踪已知和未知信息,显著改善了幻觉问题 (推文未说明具体方法或实验结果,需依赖论文细节验证干预措施的有效性,目前信息不完整。)
  • ✓ 可验证: AI助手仅能通过聊天窗口获取用户部分生活信息(如年龄、职业),无法感知外部状态(健康、情绪等) (符合当前LLMs技术原理(无实时感知能力),可通过公开技术文档(如Transformer架构限制)验证。)

原文内容:

"大语言模型并不了解提示词背后的真实个体"

我们始终无法停止思考这篇论文。
它揭示了个人化AI中一个非常诡异的缺陷模式。

-> 你的AI助手对你记忆得越多,就越可能开始自信地编造内容。

论文将此称为"割裂问题":助手只能看到你生活中进入聊天界面的片段。
它或许知道你的年龄、职业或过往偏好,但对窗口之外的真实世界——你的健康状况、财务压力、情绪状态,或是打开应用前五分钟发生的事情——毫无概念。

但可悲的是,记忆功能会让情况恶化。
实验显示,个性化记忆会降低模型对未知领域的觉察能力。由于模型开始自行填补空白,幻觉率从近乎零值飙升到11.7%。

研究者随后强制模型追踪两个维度:
• 已知信息
• 关于用户的未知领域

这彻底改变了模型行为。
在五大模型系列中,模型提出了更优质的问题,产生的有害建议、谄媚内容和幻觉输出显著减少。

但这里存在更深刻的命题。

我们构建个人化AI的底层逻辑是"记忆越多,个性化越强"。然而当记忆碎片积累到某个临界点,会形成理解的假象而非真正的认知。

那么个人助手究竟该优化什么?是尽可能多地掌握你的信息?
还是始终保持清醒:无论记忆多少,你生活的主体始终在聊天窗口之外?

你怎么看?

⏰ 21:57 | ❤️ 96点赞 | 📝 254词 | 查看原文 →

↑ 返回顶部

【AI 英文奏折】07月19日levelsio @levelsio

Nomad List & Remote OK. Building in public. Solo maker. | 影响力: 320.0k万粉丝

💡 核心观点: 荷兰风车研磨的越南肉桂口感极佳,求推荐优质肉桂来源。

可信度: 6/10 – 1项声明可直接验证;2项需进一步确认;1项为观点陈述

事实核查:

  • ◐ 部分可验证: 购买的肉桂粉是在荷兰风车磨坊研磨的 (可通过联系风车磨坊或查看产品包装信息验证研磨地点,但需实际调查确认。)
  • ◐ 部分可验证: 肉桂粉产自越南但未添加糖,味道天然甜美 (产地和成分可通过产品标签或检测报告验证,但“味道甜美”涉及主观感受,无法完全客观验证。)
  • ◦ 观点: 这是作者尝过的最好的肉桂粉 (基于个人味觉体验,属于主观评价,无客观标准验证。)

原文内容:

上个月我像个疯狂游客似的在荷兰风车里买了这款超棒的肉桂粉——虽然我本来就是荷兰人啦。

这绝对是我们尝过最棒的肉桂,包装上写着原料来自越南但在风车磨坊研磨的,超酷。

它尝起来真的带甜味,但绝对没加糖,是纯肉桂,比我之前尝过的所有品种都棒。

所以问题来了:你们的肉桂都是从哪儿搞的?货源是哪?我需要线报,需要那种《拜金一族》级别的顶级肉桂线报。

⏰ 06:24 | ❤️ 142点赞 | 📝 103词 | 查看原文 →

↑ 返回顶部

【AI 英文奏折】07月19日fofr @fofrai

Head of Engineering @ growth-stage AI company. Scaling models and teams toward AGI. Notes and thoughts along the way. | 影响力: 0万粉丝

💡 核心观点: 无人机表演技术精湛,飞行特技引人注目。

可信度: 6/10 – 1项声明可直接验证;2项需进一步确认;1项为观点陈述

事实核查:

  • ◐ 部分可验证: cheerleaders in flight-suits perform acrobatics on drones flying over a fun fair (需核实是否存在无人机搭载真人进行特技表演的公开活动记录或官方报道,但若无具体时间、地点或主办方信息,验证可能受限。)
  • ✓ 可验证: they end with a human pyramid (该描述缺乏具体活动名称、举办方或视频来源,仅凭推文中的业余拍摄者(amateur film maker)难以追溯原始素材,无法独立验证。)
  • ◐ 部分可验证: footage from an amateur film maker on the ground, it’s day time (若推文附带了视频链接或拍摄者公开的影像资料,可部分验证;但若无直接来源,则依赖第三方上传内容,可靠性存疑。)

原文内容:

这些无人机表演越来越精彩了

> 身穿飞行服的拉拉队员在游乐场上空的无人机上表演特技,最终以人体金字塔造型收尾。画面来自地面业余摄影师的白天拍摄,镜头略微推近并重新对焦。

(SD2)

⏰ 06:22 | ❤️ 54点赞 | 📝 45词 | 查看原文 →

↑ 返回顶部

【AI 英文奏折】07月19日levelsio @levelsio

Nomad List & Remote OK. Building in public. Solo maker. | 影响力: 320.0k万粉丝

💡 核心观点: 风投融资稀释股权,创始人最终持股常仅剩5%。

可信度: 10/10 – 2项声明可直接验证;3项需进一步确认

事实核查:

  • ◐ 部分可验证: VC资助的初创公司在最终阶段创始人通常拥有约5%的所有权 (该声明引用了未明确来源的统计数据(如@cartainc),需进一步核实其数据采集方法和样本范围。类似研究(如Crunchbase或学术论文)可能提供部分支持,但具体比例因行业和案例而异。)
  • ◐ 部分可验证: 单创始人在种子轮、A轮至E轮的所有权中位数分别为56%、36%、23.5%、16.5%、10%、<10% (数据标注为来自@cartainc,但未提供原始链接或方法论。类似报告(如Y Combinator或CB Insights的融资研究)可部分验证趋势,但“中位数”需特定数据集支持。)
  • ✓ 可验证: 每轮融资中,创始人通过出售公司股份换取资金以促进增长 (这是风险投资的基本运作机制,可通过公开的融资案例(如SEC文件或公司公告)或权威金融资料(如《风险投资手册》)直接验证。)

原文内容:

你可能觉得这个比例低得离谱,但~5%的最终持股比例恰恰是大多数获得风投的初创公司在成功退出时创始人常见的状态——尤其当你还有联合创始人时。  

融资并非没有代价,投资人不会出于慈善给你钱。每次融资都意味着你要出售一部分公司股权换取资金,再用这些资金推动增长,以期剩余的股权价值能超过你让渡的部分。  

以下是单创始人各轮融资后的中位持股比例(数据来源@cartainc):  
种子轮:~56%  
A轮:~36%  
B轮:~23.5%  
C轮:~16.5%  
D轮:~10%  
E轮:<10%  

若有一位联合创始人(多数初创公司如此):  
种子轮:~28%  
A轮:~18%  
B轮:~11.75%  
C轮:~8.25%  
D轮:~5%  
E轮:<5%  

若是四位联合创始人之一:  
种子轮:~14%  
A轮:~9%  
B轮:~5.875%  
C轮:~4.125%  
D轮:~2.5%  
E轮:<2.5%  

假设公司在某轮融资后以10亿美元被收购(10亿可不是小数目!),创始人能获得多少?  

单创始人10亿美元收购案中的收益:  
种子轮:~5.6亿美元  
A轮:~3.6亿美元  
B轮:~2.35亿美元  
C轮:~1.65亿美元  
D轮:~1亿美元  
E轮:<1亿美元  

一位联合创始人的情况:  
种子轮:~2.8亿美元  
A轮:~1.8亿美元  
B轮:~1.175亿美元  
C轮:~8250万美元  
D轮:~5000万美元  
E轮:<5000万美元  

四位联合创始人之一的情况:  
种子轮:~1.4亿美元  
A轮:~9000万美元  
B轮:~5900万美元  
C轮:~4100万美元  
D轮:~2500万美元  
E轮:<2500万美元  

但更现实的情况是:风投支持的初创公司中位收购价约为7100万美元。  

单创始人:  
种子轮:~3980万美元  
A轮:~2560万美元  
B轮:~1670万美元  
C轮:~1170万美元  
D轮:~710万美元  
E轮:<710万美元  

一位联合创始人:  
种子轮:~1990万美元  
A轮:~1280万美元  
B轮:~830万美元  
C轮:~590万美元  
D轮:~355万美元  
E轮:<355万美元  

四位联合创始人之一:  
种子轮:~995万美元  
A轮:~640万美元  
B轮:~420万美元  
C轮:~290万美元  
D轮:~180万美元  
E轮:<180万美元  

最后关键数据(篇幅所限简写):1)中位收购时点通常在A轮(其实相当早);2)中位收购价7100万美元。由此可得被收购初创公司的预期中位收益:  
单创始人:~2560万美元  
一位联合创始人:~1280万美元  
四位联合创始人之一:~640万美元  

但需注意:被收购本身已是小概率事件——根据定义,多数初创公司注定失败,仅约15%能被收购。因此计入概率后的预期收益为:  
单创始人:~384万美元  
两位联合创始人之一:~192万美元  
四位联合创始人之一:~96万美元  

PS:上述数据未计入税收和清算优先权(投资人可能优先于普通股东获得回报,创始人实际所得更少),但为公平起见也未计入创始人在前期轮次中的套现行为,二者大致抵消。  

说明:这并非负面评价,只是风投游戏的规则。但将其明确写出来有助于理解运作逻辑。  

风投支持的初创公司志在登月——这是极少数能让你获得巨额回报、成为真正亿万富翁的途径。若仅靠自有资金创业,这种机会几乎不存在!

⏰ 06:15 | ❤️ 638点赞 | 📝 561词 | 查看原文 →

↑ 返回顶部

【AI 英文奏折】07月19日Rohan Paul @rohanpaul_ai

Compiling in real-time, the race towards AGI. The Largest Show on X for AI. | 影响力: 0万粉丝

💡 核心观点: Kimi K3性能大幅提升,DeepSWE测试得分跃升38分。

可信度: 7/10 - 1项声明可直接验证;3项需进一步确认

事实核查:

  • ◐ 部分可验证: Kimi K3 ranks #3 on DeepSWE, head to head with Claude Fable & GPT-5.6 Sol. (需查看DeepSWE官方排名或测试报告以确认Kimi K3的排名及对比模型名称,但未提供直接链接或数据来源。)
  • ✓ 可验证: Kimi moved from 31 points with K2.7-code to 69 points with K3, a 38-point gain. (未提供具体测试版本(K2.7-code与K3)的公开得分记录或测试环境详情,无法独立验证分数变化。)
  • ◐ 部分可验证: DeepSWE tests whether a coding agent can take a short real-world request, explore an unfamiliar codebase, make substantial changes, and deliver working code. (可通过查找DeepSWE官方文档或研究论文验证其测试方法,但推文未提供具体来源,需额外检索确认。)

原文内容:

目前Kimi K3在DeepSWE榜单上位列第三,与Claude Fable和GPT-5.6 Sol形成鼎立之势。

但真正引人注目的是其性能跃升幅度——Kimi从K2.7-code版本的31分飙升至K3版本的69分,实现了38分的跨越式增长。

DeepSWE评估的是编码智能体能否根据简短的真实需求,探索陌生的开源代码库,跨多个文件实施实质性修改,最终交付能通过隐藏测试的工作代码。

这些测试任务均为原创性课题,在纯净隔离环境中进行长时间运行评估。该体系能有效检测真正的端到端软件工程能力,而非简单的代码生成或记忆性修复。

⏰ 05:52 | ❤️ 46点赞 | 📝 98词 | 查看原文 →

↑ 返回顶部

【AI 英文奏折】07月19日Marc Lou @marclou

⭐️ TrustMRR.com $27K/m | DataFa.st $20K/m | SHlPORDIE.COM $20K/mo | 影响力: 170.0k万粉丝

💡 核心观点: 低多巴胺网站TrustMRR月访客20万且用户黏性高。

可信度: 6/10 - 3项需进一步确认;2项为观点陈述

事实核查:

  • ◐ 部分可验证: TrustMRR每月有20万独立访客 (需通过网站分析工具(如Google Analytics)或官方公开的流量报告验证,但若数据未公开则无法直接确认。)
  • ◐ 部分可验证: 50%的访客是回头客 (回头客比例需依赖网站后台统计数据,若未公开则需内部权限验证,普通用户无法直接核实。)
  • ◐ 部分可验证: 访客平均停留时间为3.5分钟 (类似流量数据,需通过分析工具验证,但公开数据的缺失可能限制外部验证。)

原文内容:

TrustMRR创下历史最高访问量:

月均独立访客达20万人次

其中50%为回头客,平均停留时长为3.5分钟

这尤其令我自豪,因为在当今这个为即时快感而优化的世界里,TrustMRR是一个低多巴胺型网站

⏰ 20:49 | ❤️ 244点赞 | 📝 42词 | 查看原文 →

↑ 返回顶部

【AI 英文奏折】07月19日SemiAnalysis @semianalysis_

In-depth research on semiconductors, AI infra & hardware | 影响力: unknown万粉丝

💡 核心观点: Kimi K3的KDA注意力虽降带宽,但AI网络交换机市场不会萎缩。

可信度: 6/10 - 1项声明可直接验证;2项需进一步确认;1项为观点陈述

事实核查:

  • ◐ 部分可验证: Panicans可能认为AI networking switch TAM(Total Addressable Market)会因Kimi K3使用KDA Attention而大幅缩小 (需验证Kimi K3是否确实采用KDA Attention技术,以及该技术对KV-transfer networking带宽的具体影响。此类技术细节通常需官方白皮书或实测数据支持,目前公开信息有限。)
  • ◐ 部分可验证: KDA Attention技术可将KV-transfer networking带宽减少高达10倍 (需查阅KDA Attention的技术文档或第三方测试报告,验证其带宽压缩效果。若技术未公开或缺乏独立测试,则无法完全验证。)
  • ◦ 观点: AI networking switch TAM不会缩小,反而会扩大(与Panicans的担忧相反) (属于市场预测或观点,依赖对技术趋势和行业发展的主观判断,无直接客观数据可验证。)

原文内容:

与2025年1月的DeepSeek情况类似,Panicans可能认为AI网络交换机的总可用市场(TAM)将大幅萎缩,因为Kimi K3采用了KDA注意力机制,能将KV传输网络带宽降低高达10倍。但事实恰恰相反,具体原因如下。1/8

⏰ 05:35 | ❤️ 558点赞 | 📝 40词 | 查看原文 →

↑ 返回顶部

【AI 英文奏折】07月19日SemiAnalysis @semianalysis_

In-depth research on semiconductors, AI infra & hardware | 影响力: unknown万粉丝

💡 核心观点: 增量KV缓存优化减少预填带宽占用。

可信度: 8/10 - 2项声明可直接验证;1项需进一步确认

事实核查:

  • ◐ 部分可验证: incremental KV-cache transfers优化技术可以减少prefill阶段需要传输的数据量 (需查阅技术文档或实测验证该优化技术的具体实现和效果,但缺乏公开的直接数据支持)
  • ✓ 可验证: KV transfer占用的网络带宽相对于WideEP较少 (缺乏WideEP和KV transfer的具体带宽对比数据,且未提供测试环境或基准)
  • ✓ 可验证: 在KDA之前,KV transfer的网络带宽占用已经较低 (未明确KDA的具体定义或技术背景,且缺乏量化数据支持带宽占用情况)

原文内容:

此外,通过增量KV缓存传输等优化手段,预填充阶段只需传输非解码实例缓存的KV部分。因此,即使未启用KDA(键值注意力机制),相较于WideEP系统,KV传输所占用的网络带宽也大幅减少——降幅达7/8。

⏰ 05:35 | ❤️ 25点赞 | 📝 37词 | 查看原文 →

↑ 返回顶部

【AI 英文奏折】07月19日SemiAnalysis @semianalysis_

In-depth research on semiconductors, AI infra & hardware | 影响力: unknown万粉丝

💡 核心观点: 高效注意力机制推动AI应用普及,增加网络需求。

可信度: 6/10 - 3项需进一步确认;1项为观点陈述

事实核查:

  • ◐ 部分可验证: More efficient attention will further push context lengths from 1M to 5M+ (需依赖具体AI模型的技术文档或实测数据验证当前和未来的上下文长度扩展能力,但“进一步推动”属于预测性表述,部分依赖技术发展。)
  • ◐ 部分可验证: Less context rot with more efficient attention (“context rot”(上下文衰减)是未明确定义的术语,需技术文献或实验证明其与注意力效率的关系,目前缺乏公开标准验证。)
  • ◦ 观点: Jevons’ Paradox implies that efficient attention will lead to wider AI adoption (杰文斯悖论在此处的应用是主观推论,未提供具体数据或案例证明AI采用率与注意力效率的直接因果关系。)

原文内容:

更高效注意力机制将推动上下文长度从100万扩展到500万以上,同时减少信息衰减。杰文斯悖论意味着:注意力效率的提升将加速AI普及,进而催生更大的网络需求。8/8

⏰ 05:35 | ❤️ 52点赞 | 📝 33词 | 查看原文 →

↑ 返回顶部

© 版权声明

相关文章

暂无评论

暂无评论...