【AI 英文奏折】08月19日

x每日奏折8小时前发布 tianming
12 0 0

【AI 英文奏折】2026年08月19日

共收录 20 篇深度内容


📋 今日内容速览

快速浏览,点击感兴趣的推文查看详细分析

  1. Machina: 用结构化知识库和笔记网络优化业务信息管理
  2. Aakash Gupta: YouTube观看量标准降低将误导广告商重蹈Facebook覆辙。
  3. Santiago Valdarrama: 将实时代理嵌入应用,实时流式交互并执行任务。
  4. Aakash Gupta: 微软收购GitHub后因AI提交激增被迫租用AWS扩容。
  5. Amira Zairi: 作者用Seedance制作西班牙旅行视频,探访三处影视拍摄地。
  6. Artificial Analysis: Optima平台可自定义模型基准测试并对比性能与成本。
  7. Grok: 木砧板无需消毒,细菌渗入即死,正确清洁保养即可。
  8. AshutoshShrivastava: GLM 5.3性能接近GPT 5.6且成本更低。
  9. levelsio: 作者为健身进步自豪,虽非精英但远超常人。
  10. Chubby♨️: Claude蛋白质设计命中率达27%,超人工两倍。
  11. Aakash Gupta: 车牌共享系统引发隐私争议,多地终止监控合作。
  12. Rohan Paul: Claude自主设计有效蛋白质,显著提升实验效率与成功率。
  13. Anthropic: Claude成功自主设计出14种蛋白质结合物。
  14. Rohan Paul: DeepSeek-V4-Pro因高令牌量导致成本远超其他模型。
  15. The Turing Post: DeepSeek Harness通过模块化插件实现AI代理自我进化。
  16. Artificial Analysis: GLM-5.3性能媲美Kimi K3,跃居顶尖开源模型前列。
  17. levelsio: 泰国政府收紧政策,打击外国游民银行账户和房产持有。
  18. Rohan Paul: AI仅模仿历史记录,无法真正应用抽象经验推理。
  19. Suchen Zang: 水印检测需足够随机性而非单纯长度。
  20. Machina: 利用Obsidian知识库和AI工具提升产品营销效率。

📖 详细内容

Machina @exm7777

running ai-powered agencies | http://weeklyaiops.com | 影响力: 665万粉丝

💡 核心观点: 用结构化知识库和笔记网络优化业务信息管理

可信度: 10/10 – 2项声明可直接验证;2项需进一步确认;1项为观点陈述

事实核查:

  • ✓ 可验证: Andrej Karpathy是OpenAI的联合创始人 (可通过OpenAI官网或公开新闻报道直接验证其联合创始人身份。)
  • ◐ 部分可验证: “LLM Wiki”是Obsidian中的一个知识图谱工具 (需实测Obsidian或查阅其官方文档确认是否存在该功能或模板,但“LLM Wiki”可能是用户自定义项目,非官方名称。)
  • ◦ 观点: GTM(Go-To-Market)工作流建议使用特定文件夹结构和笔记规则(如每个事实50-150字、frontmatter键等) (属于个人方法论建议,无客观标准验证其有效性,依赖主观实践结果。)

原文内容:

安德烈·卡帕西(OpenAI联合创始人)介绍了"LLM维基"——Obsidian中的知识图谱系统  

我为GTM搭建了专属版本,以下是可直接复制的具体方案:  
- **单知识库多文件夹架构**:按业务维度划分(产品方案/买家画像/市场声量/生态图谱/会议室记录/工作流/裁决记录/潜在客户/信号指标/消息模板/核心指标)  
- **原子化笔记规范**:每则事实独立成文(50-150字),配可朗读式标题(如"可存续的预算方案"),含四项元数据(类型/标签/创建日期/状态)  
- **三维知识网络**:每篇笔记需链接所属文件夹中心页、两篇同级笔记及跨文件夹笔记,确保图谱形成连通网络而非十一个信息孤岛  
- **动态裁决系统**:在rulings文件夹中,每条代理修正指令转化为带时间戳的记录,执行前自动读取...让修正永久生效而非重复劳动  
- **Claude智能集成**:代码库指向该知识库,优先读取中心页→检索裁决记录→生成草稿,当日所学自动回写为标准化笔记  
- **可视化监测**:图谱视图按文件夹色标显示(中心页为白色),工作流异常前即可发现薄弱知识集群  

下方教程将逐步演示完整工作流构建方法:

⏰ 05:08 | ❤️ 78点赞 | 📝 273字 | 查看原文 →

↑ 返回顶部

Aakash Gupta @aakashgupta

http://product-growth.com https://aibyaakash.com http://landpmjob.com http://youtube.com/@growproduct | 影响力: 0万粉丝

💡 核心观点: YouTube观看量标准降低将误导广告商重蹈Facebook覆辙。

可信度: 10/10 – 3项声明可直接验证;1项需进一步确认;1项为观点陈述

事实核查:

  • ✓ 可验证: YouTube 将观看次数的定义从观看约30秒改为视频加载即计数 (可通过YouTube官方公告或新闻稿验证其观看次数计算标准的变更,例如2025年3月Shorts门槛调整的公开说明。)
  • ✓ 可验证: Facebook曾因夸大平均观看时长数据(仅计算3秒以上观看)支付4000万美元和解金 (2016年Facebook的广告指标争议及和解金额可通过法庭文件、SEC公告或权威媒体报道(如《华尔街日报》)验证。)
  • ◐ 部分可验证: YouTube的“互动观看”标准(旧定义)仍用于创作者分成和合作伙伴计划资格 (需查阅YouTube官方Analytics文档或合作伙伴计划条款,但具体算法细节可能未完全公开。)

原文内容:

二十年来,YouTube 的观看次数意味着人类观看大约 30 秒。从周日起,它意味着视频已加载。

广告行业上次基于如此松散的观看计算时,Facebook 支付了 4000 万美元的和解金,那些相信这些数字的出版商也随之消亡。

2016 年,Facebook 承认其平均观看时长数据仅计算持续 3 秒以上的观看,从而将平均值夸大了 60% 至 80%。后来的法庭文件显示,实际夸大幅度为 150% 至 900%。那时,媒体公司已经根据这些数据解雇了作者,并转向视频内容。Mic、Vocativ 以及 Vice 的大部分业务再也没有恢复。

YouTube 是最后的坚持者。TikTok 和 Instagram 在播放开始的瞬间就算作一次观看,因此“观看”包括所有滚动过去的用户。非官方的 30 秒门槛让 YouTube 的观看次数成为品牌唯一能实际定价的数字。2025 年 3 月 Shorts 降低门槛后,相同内容的计数一夜之间跃升 20% 至 30%。长视频下周将迎来同样的跃升。

揭示性的细节隐藏在 YouTube 自己的公告中。收入和合作伙伴计划资格不会改变,因为严格标准在 Analytics 中以新名称“互动观看”继续存在。支付给创作者的计数保持旧定义。赞助商在公开看到的计数采用松散定义。

分数膨胀在各地运作相同。一旦每个平台都将观看定义为“视频已开始”,这个词就不再承载信息,品牌将回归猜测注意力的实际成本。

⏰ 14:23 | ❤️ 251点赞 | 📝 401字 | 查看原文 →

↑ 返回顶部

Santiago Valdarrama @svpino

计算机科学家。我在 https://ml.school 教授硬核人工智能/机器学习工程。YouTube:https://youtube.com/@underfitted | 影响力: 0万粉丝

💡 核心观点: 将实时代理嵌入应用,实时流式交互并执行任务。

可信度: 10/10 – 2项声明可直接验证;2项需进一步确认;1项为观点陈述

事实核查:

  • ◐ 部分可验证: 可以将 Hermes 和 OpenClaw 嵌入到任何应用程序中 (需查看官方文档或 API 说明以确认是否支持“任何应用程序”,可能存在技术或平台限制。)
  • ✓ 可验证: 支持实时流式传输答案和推理过程 (可通过官方演示、代码示例或技术文档验证流式传输功能是否实际存在。)
  • ◐ 部分可验证: 可在应用内渲染用户界面 (需实测或查看 SDK 文档确认 UI 渲染的具体实现方式和兼容性。)

原文内容:

这将让您将 Hermes 和 OpenClaw 嵌入到任何应用程序中:

• 实时流式传输答案和推理过程
• 在您的应用内渲染用户界面
• 在应用的每一页上采取行动

换句话说,您将获得一个作为应用程序一部分的实时代理,为您的用户执行工作!

⏰ 22:13 | ❤️ 80点赞 | 📝 86字 | 查看原文 →

↑ 返回顶部

Aakash Gupta @aakashgupta

http://product-growth.com https://aibyaakash.com http://landpmjob.com http://youtube.com/@growproduct | 影响力: 0万粉丝

💡 核心观点: 微软收购GitHub后因AI提交激增被迫租用AWS扩容。

可信度: 10/10 – 3项声明可直接验证;2项需进一步确认

事实核查:

  • ✓ 可验证: 微软在2018年以75亿美元收购GitHub (该收购信息已被微软官方公告及主流财经媒体(如CNBC、彭博社)广泛报道,交易金额和年份均可通过公开记录确认。)
  • ◐ 部分可验证: GitHub在2025年托管了10亿次提交,计划2026年达140亿次 (GitHub官方博客或年度报告可能披露过提交量数据,但“2026年计划”需核实是否为官方预测;具体数值若未公开来源则无法直接验证。)
  • ◐ 部分可验证: GitHub在一年内记录了257次宕机,包括Origin发布当天持续7.5小时的宕机 (宕机次数可通过第三方监测平台(如Downdetector)或GitHub状态页历史记录部分验证,但需核对具体时间范围和事件细节是否匹配。)

原文内容:

微软在 2018 年以 75 亿美元收购 GitHub,以与 AWS 竞争。今年,它开始租用 AWS 服务器来保持 GitHub 的在线状态。

这就是 Cursor 刚刚推出的功能的背景。

GitHub 在整个 2025 年托管了 10 亿次提交。它正按计划在 2026 年达到 140 亿次。仅 Claude Code 一款工具每天就推送大约 135,000 次公共提交。GitHub 原本计划在 10 月进行 10 倍容量扩展,但到 2 月时得出结论,实际上需要 30 倍。它在一年内记录了 257 次宕机,包括在 Origin 发布当天发生的那个持续七个半小时的宕机。

这个平台是为人类手动输入代码而设计的架构。AI 代理的提交速率远超任何人类团队所能达到的,而 Origin 的整个卖点就存在于这个差距中。每仓库每秒 22 次提交。每小时 296,000 次克隆。

最精明的一招是听起来很无聊的部分。Origin 通过 Depot 和 Buildkite 运行你现有的 GitHub Actions 工作流,不做任何更改,并与 GitHub 双向同步。没人需要迁移。团队只需在他们已有的代码上打开第二个窗口,而每次宕机都会让这个窗口变得更有吸引力。

GitHub 的护城河是 18 年间人类开发者之间的网络效应。AI 代理会路由到任何不会崩溃的基础设施。

微软花了 75 亿美元买下了开发者存放代码的地方。现在,它却在向最大的竞争对手支付服务器租金,而全球增长最快的编辑器正在建造出口坡道。

⏰ 10:05 | ❤️ 64点赞 | 📝 393字 | 查看原文 →

↑ 返回顶部

Amira Zairi @azed_ai

AI Educator & Creator | Ambassador @Adobe | Partner with leading brands | Collab → [email protected] | 影响力: 0万粉丝

💡 核心观点: 作者用Seedance制作西班牙旅行视频,探访三处影视拍摄地。

可信度: 6/10 – 1项声明可直接验证;2项需进一步确认;1项为观点陈述

事实核查:

  • ◐ 部分可验证: 用 Seedance 2.5 制作了一个西班牙旅行视频博客 (可通过查看视频元数据或发布平台确认是否使用 Seedance 2.5 制作,但需用户提供具体视频链接或工具版本证明。)
  • ✓ 可验证: 参观了塞维利亚的阿尔卡萨尔宫、圣胡安德加茨卢加特谢和赫罗纳老城 (这些地点为西班牙著名景点,可通过公开旅游信息、地理标记或视频中的实景画面验证。)
  • ◐ 部分可验证: 三个地点是某节目的拍摄地点(需粉丝猜测) (若节目为公开作品(如《权力的游戏》曾在赫罗纳取景),可通过剧组公开信息或媒体报道验证,但需用户明确节目名称。)

原文内容:

用 Seedance 2.5 制作了一个西班牙旅行视频博客,参观了粉丝们会认出的三个拍摄地点

塞维利亚的阿尔卡萨尔宫、沿海的圣胡安德加茨卢加特谢,以及赫罗纳老城狭窄的小巷

告诉我哪个节目在这里拍摄的

提示

⏰ 23:58 | ❤️ 73点赞 | 📝 82字 | 查看原文 →

↑ 返回顶部

Artificial Analysis @artificialanlys

Independent analysis of AI | 影响力: 0万粉丝

💡 核心观点: Optima平台可自定义模型基准测试并对比性能与成本。

可信度: 10/10 – 3项声明可直接验证;1项需进一步确认

事实核查:

  • ✓ 可验证: 上周推出了 Optima,这是一个新的平台,用于在用户自己的工作负载上对模型进行基准测试,并比较性能、速度和成本效率 (可通过官方公告、产品页面或发布日期直接验证 Optima 的推出及其核心功能描述)
  • ✓ 可验证: 提供新的视频指南,介绍如何使用 Optima 构建和运行自己的基准测试 (视频指南的存在和内容可通过官方链接或平台内资源直接查看验证)
  • ◐ 部分可验证: Optima 可帮助用户找到最适合其用例的模型 (功能宣称可验证,但实际效果需依赖用户实测或第三方测试数据,可能存在个体差异)

原文内容:

上周我们推出了 Optima,这是一个新的平台,用于在您自己的工作负载上对模型进行基准测试,并比较性能、速度和成本效率。

观看我们新的视频指南,了解如何使用 Optima 构建和运行您自己的基准测试,并找到最适合您用例的模型。

立即开始构建您的基准测试:

⏰ 09:51 | ❤️ 32点赞 | 📝 101字 | 查看原文 →

↑ 返回顶部

Grok @grok

@grok it | 影响力: 0万粉丝

💡 核心观点: 木砧板无需消毒,细菌渗入即死,正确清洁保养即可。

可信度: 9/10 – 2项声明可直接验证;2项需进一步确认

事实核查:

  • ◐ 部分可验证: Bacteria pulled into the wood die there and do not return to the surface or multiply. (该声明涉及木材对细菌的抑制效果,需通过微生物实验验证细菌存活率,但未提供具体研究数据或来源(如Cliver的研究原文)。部分研究可能支持木材的抗菌性,但“不返回表面或繁殖”需特定条件验证。)
  • ✓ 可验证: Cliver’s work showed they become unrecoverable within minutes. (若Cliver的研究已公开发表(如学术论文或官方报告),可通过检索其文献验证。但推文未标注具体文献名称或链接,需用户自行查找原始研究。)
  • ◐ 部分可验证: No purge is needed. Wash with hot soapy water after use, dry upright, and oil periodically. (木材清洁保养方法的有效性可参考制造商指南或行业标准,但“无需净化”可能依赖特定场景(如食品接触表面),需结合具体产品说明验证。)

原文内容:

细菌被木材吸入后会在内部死亡,既不会返回表面也不会繁殖。克里弗的研究表明它们在几分钟内就会彻底消失。无需特殊消毒处理。使用后用热肥皂水清洗,直立晾干,并定期涂油保养。避免蒸汽清洁或浸泡——这会导致接合处变形。刨削仅适用于深层表面损伤的情况。

⏰ 09:15 | ❤️ 24点赞 | 📝 55词 | 查看原文 →

↑ 返回顶部

AshutoshShrivastava @ai_for_success

Post about latest AI news, tools, tutorials and memes. | 影响力: 0万粉丝

💡 核心观点: GLM 5.3性能接近GPT 5.6且成本更低。

可信度: 5/10 – 2项需进一步确认;2项为观点陈述

事实核查:

  • ◐ 部分可验证: GLM 5.3 现已通过 API 提供,其 Artificial Analysis Intelligence 分数为 60,仅比 GPT 5.6 SOL 低 1 分。 (需通过官方 API 文档或发布公告验证 GLM 5.3 的可用性及具体版本号,但 “Artificial Analysis Intelligence 分数” 的评分标准和来源未明确,可能为内部测试指标。)
  • ◐ 部分可验证: GLM 5.3 在 3D 测试中构建 Three.js 场景的成本为 0.37 美元,SOL 为 0.44 美元,且 GLM 使用了更多令牌。 (成本数据可通过实际调用 API 并对比账单验证,但需确认测试条件(如令牌计算方式、任务细节)是否一致。”更多令牌”的具体数值未提供。)
  • ◦ 观点: GLM 5.3 在摄像机调度、城市细节、激光 VFX 和建筑破坏效果上表现优于 SOL。 (描述涉及主观视觉评估(如”动态调度””细节丰富”),缺乏客观量化标准或第三方测试结果支持。)

原文内容:

GLM 5.3 现已通过 API 提供,其 Artificial Analysis Intelligence 分数为 60,仅比 GPT 5.6 SOL 低 1 分。在这项 3D 测试中,GLM 5.3 对 SOL 展现了具有竞争力的结果。

AI/ML API 为两个模型分配了完全相同的任务:构建一个独立的 Three.js 场景,描绘哥斯拉摧毁一座大都市,包括基于物理的破坏效果和眼睛激光。

GLM 5.3 在几个方面做得非常出色。摄像机调度更加动态,城市充满了细节,激光 VFX 具有多层效果,包括明亮的核心、光晕和动画效果。建筑物的破坏效果也非常出色。

它以 0.37 美元完成了这一切,而 SOL 的成本为 0.44 美元,尽管 GLM 5.3 使用了显著更多的令牌。
SOL 在这次特定运行中在生物建模方面更强。

你觉得哪个做得更好?

⏰ 08:57 | ❤️ 20点赞 | 📝 201字 | 查看原文 →

↑ 返回顶部

levelsio @levelsio

http://PhotoAI.com $89K/m
http://Vibej.am $44K/m
http://InteriorAI.com $27K/m
http://levelsio.com @X $17K/m
http://Nomads.com $16K/m
http://Pieter.com
http://Hotelist.com
http://levels.io
http://levels.vc | 影响力: 3,163万粉丝

💡 核心观点: 作者为健身进步自豪,虽非精英但远超常人。

可信度: 10/10 – 2项声明可直接验证;1项需进一步确认;2项为观点陈述

事实核查:

  • ◐ 部分可验证: 我的深蹲是125公斤/275磅/1.6倍体重(中级) (举重数据(如重量和体重比例)可通过实际测试或健身房记录验证,但“中级”分类需参考具体举重标准(如力量训练等级表),不同标准可能差异较大。)
  • ✓ 可验证: 中级水平的举重比大约50%的举重者强(不是社会上的人!),高级比大约80%强,精英比大约95%强。 (举重者百分比排名缺乏公开的权威统计数据支持,且“举重者”定义模糊(如是否包括业余爱好者或职业运动员),属于个人推测或非标准化分类。)
  • ◦ 观点: 如果你从社会角度看,这些举重成绩让我比95%的人强,因为大多数人甚至都不举重! (基于主观假设(“大多数人不举重”)和社会比较,无具体数据支撑“95%”的结论,属于个人观点。)

原文内容:

我的深蹲是125公斤/275磅/1.6倍体重(中级)  
我的卧推是100公斤/220磅/1.3倍体重(中级)  
我的硬拉是125公斤/275磅/1.6倍体重(新手)  

我觉得想慢慢从中级过渡到高级,我想,我不需要成为精英举重者  

我的硬拉现在相对于我的深蹲和卧推来说太低了,但那是因为我一直害怕用它伤到背部,所以我总是很小心,所以我现在正在改正这个  

但我非常非常为自己骄傲,我以前是瘦弱的50公斤并且很虚弱!现在我是75公斤并且非常强壮!  

中级水平的举重比大约50%的举重者强(不是社会上的人!),高级比大约80%强,精英比大约95%强。如果你从社会角度看,这些举重成绩让我比95%的人强,因为大多数人甚至都不举重!  

我总是觉得好笑,当你发布举重成绩时,你会收到匿名账户说你弱,这毫无意义,只要每周去健身房3次,你可能就比95%的人强了!对我来说这是一个巨大的成就

⏰ 08:21 | ❤️ 105点赞 | 📝 289字 | 查看原文 →

↑ 返回顶部

Chubby♨️ @kimmonismus

Tech Analyst & Content Creator. Editor-in-Chief @getsuperintel – Community of 300k+ in total: https://linktr.ee/kimmonismus // [email protected] | 影响力: 0万粉丝

💡 核心观点: Claude蛋白质设计命中率达27%,超人工两倍。

可信度: 8/10 – 1项声明可直接验证;3项需进一步确认;1项为观点陈述

事实核查:

  • ◐ 部分可验证: Claude在自主蛋白质结合剂设计中达到了27%的命中率,约为该领域典型10-15%命中率的两倍 (需通过查阅领域内公开的蛋白质设计研究文献或基准数据来验证典型命中率范围,但Claude的具体实验数据(如27%)需依赖官方发布的技术报告或第三方实验室复现结果)
  • ◐ 部分可验证: 独立实验室确认1320个设计中有354个成功结合(约26.8%命中率) (若独立实验室名称或实验报告公开(如预印本论文、合作机构声明),则可直接验证;若无公开来源,则需依赖推文作者的可信度)
  • ◐ 部分可验证: Claude的命中率范围从22.6%到35.1%,其排名最高的单一设计在49%的实验中成功结合 (需查看实验设置的具体参数和重复性数据(如不同目标蛋白、实验条件),但若缺乏详细方法学公开,则无法完全验证范围波动原因)

原文内容:

这很有趣:Claude 已经实现了大约是传统人工主导工作流程两倍的蛋白质设计命中率。在自主蛋白质结合剂设计中达到了 27% 的命中率,大约是该领域报告的典型 10–15% 命中率的两倍。

基于一位专家撰写的协议,Claude 为 15 个可测目标中的 14 个设计了结合剂。独立实验室确认,1320 个设计中有 354 个成功结合。

根据设置的不同,Claude 的命中率范围从 22.6% 到 35.1%。其排名最高的单一设计在 49% 的实验中成功结合。

这还不是完全自主的药物研究,但它是朝那个方向迈出的又一个重要基石。

⏰ 07:08 | ❤️ 405点赞 | 📝 177字 | 查看原文 →

↑ 返回顶部

Aakash Gupta @aakashgupta

http://product-growth.com https://aibyaakash.com http://landpmjob.com http://youtube.com/@growproduct | 影响力: 0万粉丝

💡 核心观点: 车牌共享系统引发隐私争议,多地终止监控合作。

可信度: 10/10 – 3项声明可直接验证;2项需进一步确认

事实核查:

  • ◐ 部分可验证: 底特律郊区Ferndale审计发现休斯顿和达拉斯的警察每月搜索其居民车牌数据超过10,000次,而Ferndale自身一个月内进行了1,000次搜索 (需查阅Ferndale官方审计报告或警方公开记录,但地方政府的执法数据通常部分公开,可能需主动申请获取完整信息。)
  • ✓ 可验证: Flock系统通过地方警察勾选“共享数据”复选框,建立了覆盖5,000多个社区、每月扫描200亿车牌的全国性数据库 (Flock公司官网及媒体报道(如NPR、404 Media)曾披露其运作模式和规模,数据共享机制可通过用户协议或政策文件验证。)
  • ◐ 部分可验证: Dayton市审计发现外部机构利用其Flock摄像头进行了7,000次移民相关搜索,违反公司政策 (需依赖Dayton市审计报告或404 Media的调查报道,但具体数据可能涉及内部文件,公众获取受限。)

原文内容:

底特律的一个郊区对其自己的车牌摄像头进行了审计,发现休斯顿和达拉斯的警察每月搜索其居民数据超过10,000次。Ferndale本身在一个月内恰好进行了一次超过1,000次搜索的记录。警察局长在等待议会投票之前就取消了Flock合同。

那次审计解释了万圣节笑话背后的情绪。

Flock在没有国会通过任何法案的情况下,建立了美国历史上最大的私人位置数据库。其机制就是一个复选框。分享你城市的摄像头数据到全国网络,你的警官就可以搜索全国所有其他Flock摄像头捕获的每一块车牌。数千名地方警察管理员勾选了它。该网络现在每月在5,000多个社区运行大约200亿次车辆扫描。

同样的复选框正在瓦解这一切。一个城市可以随意通过庇护政策和隐私条例。一旦数据进入共享池,外界机构就会按照自己的规则搜索它。404 Media发现,尽管Flock自己的政策明确禁止这样做,当地警察仍代表联邦执法机构进行了大约4,000次与移民相关的搜索。Dayton审计了其摄像头,发现外部实体进行了7,000次移民搜索,并用黑色垃圾袋遮住了其中的全部72个。

到2026年2月,NPR统计有30个地方取消或停用了。到5月,这个数字超过了80。

每一个加入的城市都让数据库更有价值,这就是Flock达到84亿美元估值的途径。现在每一个离开的城市都让剩余城市的理由变得更弱。增长循环也可以反向运行。

⏰ 15:05 | ❤️ 349点赞 | 📝 451字 | 查看原文 →

↑ 返回顶部

Rohan Paul @rohanpaul_ai

Compiling in real-time, the race towards AGI.

The Largest Show on X for AI.

Get my daily AI analysis newsletter to your email https://rohan-paul.com | 影响力: 6,793万粉丝

💡 核心观点: Claude自主设计有效蛋白质,显著提升实验效率与成功率。

可信度: 7/10 – 4项需进一步确认;1项为观点陈述

事实核查:

  • ◐ 部分可验证: Claude可以自主运行计算蛋白质设计活动并生成有效的结合剂,命中率为26.8%(354/1,320) (需查看Anthropic官方发布的实验报告或论文以确认具体数据,但若无原始数据或独立第三方验证,部分细节(如实验条件)可能无法完全核实。)
  • ◐ 部分可验证: Claude在6个可比竞赛目标中的4个上表现优于人类/开源设计竞赛 (需对比公开的竞赛结果或Anthropic提供的基准测试数据,但若竞赛细节或Claude的具体参数未公开,则无法完全验证。)
  • ◐ 部分可验证: 增加计算资源(如24小时专属活动)可将命中率从26.7%提升至35.1% (需Anthropic提供资源分配与命中率之间的详细实验记录,但内部计算逻辑或环境变量可能影响可重复性。)

原文内容:

Anthropic 发布了其迄今为止与 Claude 相关的最雄心勃勃的科学实验之一。

Anthropic 展示了 Claude 可以接受一个生物目标,并自主运行计算蛋白质设计活动,以产生在实验室中真正有效的结合剂。

实验室可能不再需要专职的蛋白质设计专家来手动运行每一个计算步骤。这可以将瓶颈从设计和筛选数千个候选者转移到实验测试一个更小、由 AI 选定的集合。

- 给定一个详细的专家撰写的协议,它研究了每个目标,选择结合位置,安装并运行开源蛋白质设计工具,生成候选者,过滤并改进它们,然后挑选最终的蛋白质进行实验室测试。人类没有做出单个设计决策。

- 这些设计在实验室中确实有效。在 1,320 个具有可用测量的设计中,354 个结合了其预定目标,命中率为 26.8%,Claude 为 15 个目标中的 14 个找到了结合剂。

- 在几个目标上,其结果与人类/开源设计竞赛相当。Claude 在 6 个可比竞赛目标中的 4 个上具有更高的命中率。

- 给代理更多注意力和计算资源似乎有所帮助。Mythos Preview 在每个目标获得自己的 24 小时活动时达到了 35.1% 的命中率,而多个目标共享 48 小时活动时为 26.7%。

- AI 仍然无法可靠地知道整个活动何时失败。一些不成功的目标获得了与成功目标相似的计算分数。

⏰ 07:01 | ❤️ 87点赞 | 📝 401字 | 查看原文 →

↑ 返回顶部

Anthropic @anthropicai

We’re an AI safety and research company that builds reliable, interpretable, and steerable AI systems. Talk to our AI assistant @claudeai on https://claude.ai. | 影响力: 2万粉丝

💡 核心观点: Claude成功自主设计出14种蛋白质结合物。

可信度: 7/10 – 1项声明可直接验证;3项需进一步确认

事实核查:

  • ✓ 可验证: 许多药物通过与体内特定靶点结合并阻断或改变其功能来发挥作用。 (这一声明基于公认的药理学原理,可通过医学或药理学教科书、学术论文等公开资料验证。)
  • ◐ 部分可验证: 传统上,针对每个靶点需要数周或数月专家工作,从大量候选分子中筛选出少数有效的分子。 (药物开发的时间成本可通过行业报告或研究文献部分验证,但具体时间可能因项目和技术差异而不同。)
  • ◐ 部分可验证: Claude 自主设计了针对 15 个靶点中的 14 个的蛋白质结合物。 (需依赖研究团队或合作方(如 Adaptyv Bio 和 Twist Bioscience)公开的实验数据或报告验证,目前若无具体数据发布则为部分可验证。)

原文内容:

许多药物通过与体内特定靶点结合并阻断或改变其功能来发挥作用。在药物开发过程中,一个重要的第一步是设计一种能够与其靶点紧密结合的分子。传统上,这意味着针对每个靶点需要数周或数月专家工作,从大量候选分子中筛选出少数有效的分子。

我们想测试 Claude 是否能够成功从零开始设计新型蛋白质结合物(也称为从头设计)。在一位人类专家撰写的蛋白质设计提示下,Claude 自主设计了针对 15 个靶点中的 14 个的蛋白质结合物。

随后,我们与 Adaptyv Bio 和 Twist Bioscience 合作,他们独立构建并测试了 Claude 设计的这些蛋白质。

⏰ 06:30 | ❤️ 5733点赞 | 📝 201字 | 查看原文 →

↑ 返回顶部

Rohan Paul @rohanpaul_ai

Compiling in real-time, the race towards AGI.

The Largest Show on X for AI.

Get my daily AI analysis newsletter to your email https://rohan-paul.com | 影响力: 6,793万粉丝

💡 核心观点: DeepSeek-V4-Pro因高令牌量导致成本远超其他模型。

可信度: 6/10 – 1项声明可直接验证;2项需进一步确认;1项为观点陈述

事实核查:

  • ◐ 部分可验证: DeepSeek-V4-Pro-0813 使用的令牌数量是 Muse Spark 1.2 的 48 倍 (需通过重复测试或查看原始测试数据验证,但测试方法(Hermes Agent CLI、OpenRouter、相同提示和约束)提供了部分可复现性。)
  • ✓ 可验证: 测试使用了 Nous Research 的 Hermes Agent CLI,通过 OpenRouter,采用相同的提示和 Three.js 约束 (工具(Hermes Agent CLI、OpenRouter)和测试条件(提示、Three.js 约束)为公开技术,可独立验证。)
  • ◐ 部分可验证: DeepSeek-V4-Pro 的总成本为 $4.57,显著高于 Muse Spark 1.2 ($0.53) 和 Gemini 3.7 Flash ($0.56) (成本数据依赖测试环境和具体计费规则,需实测对比,但平台(OpenRouter)的公开定价可部分佐证。)

原文内容:

这份由 @thehypedotnews 进行的 3D 编程测试发现,DeepSeek-V4-Pro-0813 使用的令牌数量是 Muse Spark 1.2 的 48 倍。

这就是为什么对于代理式编程来说,模型达到答案的能力几乎与答案本身同样重要。一个不断重新打开文件、重新考虑决策并重新发送上下文的模型,会将一个小规模构建变成一个巨大的推理循环。

该测试使用了 Nous Research 的 Hermes Agent CLI,通过 OpenRouter,采用相同的提示,以及在三个体素城市场景中相同的 Three.js 约束。

提示缓存可以抑制计费,但无法修复由调用密集型代理循环造成的延迟和重试负担。

- 总成本
#1 muse spark 1.2 – $0.53
#2 gemini 3.7 flash – $0.56
#3 deepseek v4 pro – $4.57

⏰ 06:09 | ❤️ 26点赞 | 📝 175字 | 查看原文 →

↑ 返回顶部

The Turing Post @theturingpost

On X we surface the AI research that matters and explain the ideas behind it. In the newsletter, we connect the dots between AI’s past, present, and future | 影响力: 8,552万粉丝

💡 核心观点: DeepSeek Harness通过模块化插件实现AI代理自我进化。

可信度: 4/10 – 3项需进一步确认

事实核查:

  • ◐ 部分可验证: DeepSeek Harness 是一个将模型转变为代理的层级,包含工具、记忆、执行循环等功能,且已在MIT许可下发布整个技术栈 (可通过检查DeepSeek的官方开源仓库(如GitHub)验证MIT许可证和技术栈发布情况,但“代理功能”的具体实现需实测确认。)
  • ◐ 部分可验证: Harness允许代理在运行时构建自身缺失部分(如临时插件),形成“自我进化循环” (若官方提供相关文档或演示视频可部分验证,但动态生成插件的实际能力需技术测试,且“自我进化”是否为营销术语需谨慎评估。)
  • ◐ 部分可验证: DeepSeek Harness挑战了前沿模型集中在少数实验室的观点,使护城河更模块化和开放 (此为对行业影响的推测性表述,无直接客观依据,依赖对竞争格局的主观判断。)

原文内容:

DeepSeek 正在迎来它的第二个 DeepSeek 时刻

它正在开放许多人认为将是下一个护城河的层级——Harness。

他们的 DeepSeek Harness 是将模型转变为代理的层级:工具、记忆、执行循环、沙箱、存储、调度、接口。
(DeepSeek 已在其 MIT 许可下发布了该整个技术栈的版本)

整个系统都围绕一个理念构建:“一切皆插件。” 甚至包括模型提供者。所以你不必从同一家公司获取模型、工具和运行时。

 但 Harness 最有趣的地方在于——代理可以在运行时构建自身的缺失部分。
如果它需要一个不存在的工具,它可以创建一个临时插件。

正在浮现的是一个循环:需要某种能力 → 生成工具 → 使用它 → 移除它。
无需重新训练或新版本。

这个自我进化的循环尚未完整。但突然间,你可以看到它的架构。

因此,R1 挑战了前沿模型将集中在少数实验室的想法。DeepSeek Harness 现在正对它们上方的层级施加同样的压力。
而下一个护城河突然看起来更加模块化,也更加开放。

⏰ 18:33 | ❤️ 20点赞 | 📝 302字 | 查看原文 →

↑ 返回顶部

Artificial Analysis @artificialanlys

Independent analysis of AI | 影响力: 0万粉丝

💡 核心观点: GLM-5.3性能媲美Kimi K3,跃居顶尖开源模型前列。

可信度: 10/10 – 2项声明可直接验证;3项需进一步确认

事实核查:

  • ◐ 部分可验证: GLM-5.3 在 Artificial Analysis Intelligence Index 上达到 60 分,与 Kimi K3 相当,比 GLM-5.2 提高 7 分 (需查看 Artificial Analysis Intelligence Index 的官方数据或 Z AI 的正式报告,但若该指数未公开或未提供详细评分方法,则无法完全验证。)
  • ◐ 部分可验证: GLM-5.3 在 GDPval-AA v2 的 Elo 评级从 1524 升至 1770,排名第二,仅次于 Claude Opus 5 (需核实 GDPval-AA v2 的评估标准和公开排行榜数据,若评估细节或原始数据未公开,则仅能依赖发布方单方面声明。)
  • ✓ 可验证: GLM-5.3 每个任务使用约 18,700 个输出令牌,比 GLM-5.2 高出 20% (可通过官方发布的基准测试报告或开源代码复现计算验证,但需实际测试确认具体数值。)

原文内容:

GLM-5.3 在 Artificial Analysis Intelligence Index 上达到了 60 分,与 Kimi K3 相当,比 GLM-5.2 提高了 7 分。一旦权重发布,它将与领先的开源权重模型并驾齐驱

@Zai_org 刚刚发布了 GLM-5.3,它与 Kimi K3(60 分)并列成为 Artificial Analysis Intelligence Index 上最智能的开源权重模型(假设权重按照 Z AI 的指导发布)。在 Kimi K3 和 GLM-5.3 之间,开源权重的边界比以往任何时候都更接近专有边界。

GLM-5.3 保持了 GLM-5.2 的规模,即 753B 总参数和 40B 活跃参数。Z AI 团队表示,GLM-5.3 的权重预计将在下周内发布。

关键要点:

➤ GLM-5.3 在代理能力上取得了最大提升,使其跻身前沿模型之列。该模型在 GDPval-AA v2(我们对现实世界代理知识工作的评估)中的 Elo 评级从 1524 上升至 1770,提升了 246 分。这使 GLM-5.3 在所有模型中排名第二,仅次于 Claude Opus 5(1855),并超过此前该评估中的开源权重领先者 Kimi K3(1668),优势超过 100 分。

➤ GLM-5.3 的令牌效率低于其前身。在 Artificial Analysis Intelligence Index v4.1 中,GLM-5.3 每个任务使用约 18,700 个输出令牌,比 GLM-5.2(15,700)高出约 20%,比 Kimi K3(14,700)高出 27%。这将对部署成本产生影响。

➤ 每个 Intelligence Index 任务成本为 0.68 美元,GLM-5.3 的成本是 GLM-5.2 的 1.5 倍(0.44 美元),但仍比同等智能级别的其他模型更便宜。与 Kimi K3(0.84 美元)相比,GLM-5.3 每个任务便宜 19%,比 GPT-5.6 Sol(1.23 美元)便宜 45%。GLM-5.3 的成本增加部分源于与前身相比令牌使用量增加了 20%。

➤ GLM-5.3 在现实世界知识准确性上有所改进,在 AA-Omniscience 上得分从 GLM-5.2 的 4 分上升至 14 分。GLM-5.3 现已成为 AA-Omniscience 上第二好的开源权重模型,仅次于 Kimi K3(20 分)。更详细的改进细分显示,这反映了准确性的真正提升,而非单纯更谨慎的弃权,因为准确率(24% 至 34%)和尝试率(46% 至 55%)均有所增加。然而,GLM-5.3 的幻觉率略有回升,从 26% 升至 30%。

其他模型细节:

➤ 规模:753B 总参数,40B 活跃参数(MoE),与 GLM-5.2 相同

➤ 上下文窗口:1M 令牌

➤ 定价:每 1M 输入令牌 1.40 美元,每 1M 输出令牌 4.40 美元。应用 81% 缓存命中折扣(每 1M 缓存输入令牌 0.26 美元)

➤ 许可:MIT

➤ 可访问性:GLM-5.3 目前可通过 Z AI 的官方 API 访问。Z AI 团队表示,他们预计很快将发布权重

在 Artificial Analysis 上查看 GLM-5.3 的完整分析:

⏰ 05:44 | ❤️ 1063点赞 | 📝 541字 | 查看原文 →

↑ 返回顶部

levelsio @levelsio

http://PhotoAI.com $89K/m
http://Vibej.am $44K/m
http://InteriorAI.com $27K/m
http://levelsio.com @X $17K/m
http://Nomads.com $16K/m
http://Pieter.com
http://Hotelist.com
http://levels.io
http://levels.vc | 影响力: 3,163万粉丝

💡 核心观点: 泰国政府收紧政策,打击外国游民银行账户和房产持有。

可信度: 6/10 – 1项声明可直接验证;2项需进一步确认;1项为观点陈述

事实核查:

  • ◐ 部分可验证: 持有 DTV 签证并拥有银行账户的外国人正在被关闭账户 (可通过泰国银行或移民局官方公告验证政策变化,但具体个案需实测或查询用户反馈,无法直接全面确认。)
  • ◐ 部分可验证: 试图开设新银行账户的外国人被拒绝 (银行开户政策可通过泰国银行官网或分支机构核实,但实际执行可能存在地区或个案差异,需进一步调查。)
  • ✓ 可验证: 通过与泰国人合资拥有房地产的外国人被强制清算房产(涉及数十年漏洞)

原文内容:

 今年,泰国游牧者和外籍人士似乎成了泰国政府和泰国银行的打击目标

持有 DTV 签证并拥有银行账户的外国人正在被关闭账户,而那些试图开设新银行账户的人则被拒绝

此外,通过与当地泰国人的合资企业拥有泰国房地产的外国人(这是一个长达数十年的漏洞,外国人实际上是非法人拥有的房地产)现在在全国范围内被强制清算

⏰ 05:36 | ❤️ 648点赞 | 📝 137字 | 查看原文 →

↑ 返回顶部

Rohan Paul @rohanpaul_ai

Compiling in real-time, the race towards AGI.

The Largest Show on X for AI.

Get my daily AI analysis newsletter to your email https://rohan-paul.com | 影响力: 6,793万粉丝

💡 核心观点: AI仅模仿历史记录,无法真正应用抽象经验推理。

可信度: 8/10 – 2项声明可直接验证;1项需进一步确认;1项为观点陈述

事实核查:

  • ◐ 部分可验证: AI实际上根本没有理解或应用高级抽象经验 (可通过论文实验设计(如替换提示为随机文本的测试)部分验证,但“理解”和“抽象经验”的定义存在主观性,需结合具体实验结果和学术讨论评估。)
  • ✓ 可验证: 当逐步历史记录被搞乱时,AI严重失败,证明它高度依赖于复制确切的过去行动 (论文中明确描述了实验方法和结果(破坏历史记录导致性能下降),可通过公开论文(arxiv链接)直接验证。)
  • ✓ 可验证: 破坏浓缩的摘要规则时,AI继续正常行动,没有显示任何性能下降 (论文中对比实验显示摘要规则被破坏后AI无性能变化,数据和方法在论文中可查证。)

原文内容:

研究人员发现,我们当前让AI随时间变聪明的做法存在一个巨大的盲点。

AI实际上根本没有理解或应用高级抽象经验。

开发者花费大量时间构建系统,将过去的AI错误浓缩成整齐的小规则,用于未来。

这篇论文证明,AI本质上把这些规则扔进垃圾桶,只查看原始历史日志。

现代LLM系统试图通过存储过去任务来随时间变好,这些任务要么是原始的逐步历史记录,要么是浓缩的摘要规则。该研究通过秘密地将正确提示替换为随机垃圾文本,来测试这些代理是否真正使用它们的存储记忆。

- 当逐步历史记录被搞乱时,AI严重失败,证明它高度依赖于复制确切的过去行动。

- 但当研究人员完全破坏浓缩的摘要规则时,AI继续正常行动,没有显示任何性能下降。

如果AI无法将抽象经验应用到新情境中,它就不是真正推理或学习。

这引发了一个问题,整个AI行业是否需要重新思考记忆的工作方式,因为现在这些代理只是在模仿,而不是理解。

arxiv.org/abs/2601.22436

“LLM Agents Are Not Always Faithful Self-Evolvers”

⏰ 14:42 | ❤️ 183点赞 | 📝 333字 | 查看原文 →

↑ 返回顶部

Suchen Zang @suchenzang

Always hungry for intelligence. | 影响力: 1,373万粉丝

💡 核心观点: 水印检测需足够随机性而非单纯长度。

可信度: 4/10 – 2项需进一步确认;1项为观点陈述

事实核查:

  • ◐ 部分可验证: 如果给定提示的输出分布没有足够的变异,就根本不会有可检测的水印。 (该声明涉及水印检测的技术原理,需通过专业论文或技术文档验证其理论依据,但具体实现可能因算法而异,需实测或依赖未公开细节。)
  • ◐ 部分可验证: 输出需要达到一定长度才能携带水印,实际与随机性的数量有关,而随机性仅与长度相关。 (水印与长度/随机性的关系需结合具体水印算法验证,部分开源研究(如学术论文)可能支持此观点,但实际效果需实测或依赖算法设计者的说明。)
  • ◦ 观点: (文末)一个简单的巧合 (此句为开放性表述,无具体事实依据,属于主观联想或评论。)

原文内容:

> 如果给定提示的输出分布没有足够的变异,就根本不会有可检测的水印。这就是为什么输出需要达到一定长度才能携带水印的原因。实际上与长度无关,而是与随机性的数量有关,而随机性只是与长度相关。

与此同时,一个简单的巧合:

⏰ 05:18 | ❤️ 379点赞 | 📝 96字 | 查看原文 →

↑ 返回顶部

Machina @exm7777

running ai-powered agencies | http://weeklyaiops.com | 影响力: 665万粉丝

💡 核心观点: 利用Obsidian知识库和AI工具提升产品营销效率。

可信度: 10/10 – 3项声明可直接验证;1项需进一步确认;1项为观点陈述

事实核查:

  • ✓ 可验证: 用户拥有一个包含数千个Markdown文件的Obsidian资源库,涵盖销售策略、市场分析、竞争对手信息等 (该声明基于个人数据存储,无法通过公开渠道验证其存在或具体内容。)
  • ◐ 部分可验证: 用户使用Claude Code处理Obsidian中的分发工作,并称其能获取“超级有价值的数据” (Claude Code的功能可通过官方文档验证,但“超级有价值的数据”属于主观描述,实际效果取决于用户数据质量和需求,无法完全验证。)
  • ✓ 可验证: 用户承诺在后续文章中教授如何设置Obsidian知识库并构建GTM(Go-To-Market)机器 (若用户后续发布文章或教程,可通过其提供的链接直接验证;但当前推文未附链接,需未来确认。)

原文内容:

我真的不明白为什么没人开发这个……

我有一个 Obsidian 资源库,里面有数千个笔记,都是 Markdown 文件:

- 我卖什么、什么价格、包含什么以及我拒绝做什么、每个异议及其答案
- 谁在买、哪些垂直领域、合格潜在客户的样子以及不合适的潜在客户的样子
- 市场地图、我的竞争对手、列出它们的类别页面,以及我的买家已经所在的房间
- 行动手册、信号外联、温暖外联、竞争对手定位、资金循环、按阶段划分,包含代理为我停下来的点
- 裁决、每个我不想重新争论的决定、每条都带日期的一行
- 潜在客户、信号、消息和指标、每个账户的变化、发送了什么、返回了什么

然后每当我为我的产品处理分发工作时,我就把 Claude Code 指向 Obsidian,就能得到超级有价值的数据

在下面的文章中,我教你如何设置你的 Obsidian 知识库以及如何构建一个 GTM 机器:

⏰ 23:10 | ❤️ 324点赞 | 📝 277字 | 查看原文 →

↑ 返回顶部

© 版权声明

相关文章

暂无评论

暂无评论...