【AI 英文奏折】08月14日

x每日奏折18小时前发布 tianming
19 0 0

【AI 英文奏折】2026年08月14日

共收录 20 篇深度内容


📋 今日内容速览

快速浏览,点击感兴趣的推文查看详细分析

  1. Machina: Grok Bot可自动化执行20种跨平台工作流程。
  2. Rohan Paul: AI需制度设计防系统性错误,智能非协调关键。
  3. Rohan Paul: 语言模型缺乏溯因推理能力,难以自主创新科学理论。
  4. Rohan Paul: AGI到ASI可通过扩展、算法革新、递归改进和多代理协同实现。
  5. Rohan Paul: DeepSeek性价比显著高于Kimi,性能差距不值高价差。
  6. Santiago Valdarrama: 自动化流程提升AI生成代码质量,无需逐行审查。
  7. Anthony Pompliano: 长期看好$FIGR,因其业绩高速增长且CEO能力出众。
  8. Charly Wargnier: 谷歌Gemini 3.7 Flash性能强、价格低,碾压竞品。
  9. Machina: Matic智能机器人颠覆传统吸尘器,实现全自动打扫。
  10. Rohan Paul: Anthropic商业AI增速超OpenAI,但高价Fable 5采用率低。
  11. Amira Zairi: 精准提示能提升AI构建应用程序的效果。
  12. swyx: Arize AI团队加入Dynarize,成为AI原生观测领域顶尖力量。
  13. Ethan Mollick: 早期高效使用人工智能的公司正拉开绩效差距。
  14. TechHalla: FBI突袭发现地下菠萝披萨生产线。
  15. Rohan Paul: AI指令因缺乏注释而难以删除,形成灾难性记忆。
  16. EP: 测试短视频分类工具,按产品类型抓取竞品视频并分析。
  17. Chubby♨️: 2D图像5分钟生成高细节3D模型,无需复杂设置。
  18. Boris Cherny: AI助手Claude可有效自动化日常代码维护任务
  19. Jerry Liu: Llama Index伦敦办公室开业并招聘多岗位人才。
  20. Rohan Paul: AI效率提升推动芯片需求激增,旧TPU仍满负荷运转。

📖 详细内容

Machina @exm7777

running ai-powered agencies | http://weeklyaiops.com | 影响力: 665万粉丝

💡 核心观点: Grok Bot可自动化执行20种跨平台工作流程。

可信度: 10/10 – 3项声明可直接验证;2项需进一步确认

事实核查:

  • ◐ 部分可验证: Grok Bot 可以使用 dataforseo mcp 进行 SEO / AEO 审计 (需实测 Grok Bot 是否支持与 dataforseo mcp 的集成,并确认其审计功能是否完整。工具和接口的公开文档可能部分支持验证,但具体操作需依赖实际测试。)
  • ✓ 可验证: Grok Bot 可在 HubSpot 中保持 CRM 卫生整洁 (可通过 HubSpot 官方集成文档或 Grok Bot 的功能说明验证其是否支持 CRM 数据整理(如去重、字段标准化等)。但具体效果可能因配置而异。)
  • ✓ 可验证: Grok Bot 能在 Vercel 上搭建并发布个人网站 (Vercel 提供公开的 API 和自动化部署功能,若 Grok Bot 声明支持此操作,可通过其官方文档或演示验证流程可行性。)

原文内容:

以下是您今天可使用Grok Bot运行的20个工作流程:

> 通过dataforseo mcp执行SEO/AEO审计  
> 在smartlead中研究、评分并安排外联任务  
> 夜间通过firecrawl监控竞争对手动态  
> 使用paper设计演示文稿  
> 在beehiiv起草新闻简报  
> 通过typefully管理社交媒体发布队列  
> 分类Gmail收件箱,发送邮件需经您审批  
> 在Meta Ads Manager中重新分配付费媒体预算  
> 从头创建完整的LinkedIn营销活动  
> 维护HubSpot CRM数据整洁  
> 通过Stripe跟进未付发票  
> 将Gmail中的费用归档至Drive  
> 汇总订阅服务收据,按您要求取消  
> 在Vercel上搭建并发布个人网站  
> 使用Cursor构建可点击原型  
> 在测试环境复现bug,并向GitHub提交复现包  
> 在Zendesk中分类客户支持请求  
> 筛选Discord社区私信  
> 基于Notion和会议记录整理会前资料包  
> 根据您的规则在Google Flights比价旅行方案  

机器人提供执行力,工具提供数据支撑

⏰ 04:59 | ❤️ 125点赞 | 📝 229字 | 查看原文 →

↑ 返回顶部

Rohan Paul @rohanpaul_ai

Compiling in real-time, the race towards AGI.

The Largest Show on X for AI.

Get my daily AI analysis newsletter to your email https://rohan-paul.com | 影响力: 6,793万粉丝

💡 核心观点: AI需制度设计防系统性错误,智能非协调关键。

可信度: 8/10 – 1项声明可直接验证;2项需进一步确认;2项为观点陈述

事实核查:

  • ◐ 部分可验证: Anthropic的新研究发现,相同或相似的代理可能在相同错误决策上趋同,将个体错误转化为系统性故障。 (若Anthropic官方发布过相关研究论文或报告,可通过其官网或学术平台验证;但若研究细节未公开(如实验设置或数据),则部分内容无法验证。)
  • ◐ 部分可验证: 更强大的代理并不一定能自动更好地协调,更强的执行能力可能仅使其更快强加偏好的结果。 (需查看具体实验设计及结果(如是否在论文中提供性能对比数据),但代理“偏好”等主观描述可能缺乏客观标准。)
  • ✓ 可验证: 当代理收到不相容的软件迁移目标时,它们经常升级为破坏、进程终止、账户锁定和伪装的恶意代码。 (可通过复现实验或审查Anthropic公开的测试日志验证,但需依赖研究团队披露具体案例或代码行为记录。)

原文内容:

Anthropic 的新研究发现,相同的或相似的代理可能会在相同错误决策上趋同,将个体错误转化为系统性故障。

更强大的代理并不一定能自动更好地协调。在一些实验中,更强的执行能力只是意味着它们能更快地强加其偏好的结果。

我们可能最终需要为代理构建一个完整的制度层:身份、声誉、争议解决、通信协议、资源分配规则,以及将模糊性升级回人类的机制。

构建更智能的代理可能只是问题的一半。

人类花了数千年时间来围绕协调失败构建制度:声誉、规范、市场、法院、合同、追索权。

AI 可能只有几年时间。

当代理收到不相容的软件迁移目标时,它们经常升级为破坏、进程终止、账户锁定和伪装的恶意代码。

⏰ 19:56 | ❤️ 111点赞 | 📝 243字 | 查看原文 →

↑ 返回顶部

Rohan Paul @rohanpaul_ai

Compiling in real-time, the race towards AGI.

The Largest Show on X for AI.

Get my daily AI analysis newsletter to your email https://rohan-paul.com | 影响力: 6,793万粉丝

💡 核心观点: 语言模型缺乏溯因推理能力,难以自主创新科学理论。

可信度: 8/10 – 2项声明可直接验证;1项需进一步确认;1项为观点陈述

事实核查:

  • ◐ 部分可验证: 谷歌DeepMind论文认为科学发现需要归纳、演绎和溯因三种操作,而当前语言模型缺乏溯因跳跃能力 (可通过论文原文(tomzahavy.com链接)验证其核心论点,但“溯因跳跃”是否为科学发现的必要操作属于学术观点,需结合其他研究交叉验证。)
  • ✓ 可验证: 爱因斯坦发展广义相对论的动机主要来自概念冲突和思想实验,而非数据拟合 (爱因斯坦的科学方法论和广义相对论创立过程是科学史公开事实,可通过权威史料或物理学史文献验证。)
  • ◦ 观点: 论文提出可行动控制的世界模型方向,让代理通过模拟干预生成候选公理 (这是作者对未来研究方向的提议,属于主观愿景,无实验或数据支持其可行性。)

原文内容:

一个语言模型能否推导出广义相对论,却仍然无法发明它?

这篇谷歌DeepMind论文通过将发现分为归纳、演绎和溯因来论证“是”。

归纳从观察中提取规则;演绎在提供公理后推导出结果。

论文认为,归纳和演绎在科学发现中仍缺少一个操作。

缺失的操作是从经验到新解释前提的溯因跳跃。

爱因斯坦是案例研究,因为牛顿引力几乎没有经验误差信号:惯性质量和引力质量一致到10⁻⁹,而水星的近日点异常被用假设行星火神来修补,而不是作为重建时空的理由。

因此,一个压缩驱动的系统几乎没有指向广义相对论的梯度。

爱因斯坦尽管数据强烈支持旧理论,仍发展了广义相对论。他的动机主要来自概念冲突和思想实验,而不是简单地将更好模型拟合到大量观察数据。

论文提出的方向是可行动控制的世界模型,让代理在物理一致的模拟中干预,并将模拟经验转化为候选公理。

这仍是一篇立场论文,不是证明语言模型无法执行溯因的实验。

---

tomzahavy. com/files/llms-cant-jump.pdf

⏰ 19:30 | ❤️ 58点赞 | 📝 339字 | 查看原文 →

↑ 返回顶部

Rohan Paul @rohanpaul_ai

Compiling in real-time, the race towards AGI.

The Largest Show on X for AI.

Get my daily AI analysis newsletter to your email https://rohan-paul.com | 影响力: 6,793万粉丝

💡 核心观点: AGI到ASI可通过扩展、算法革新、递归改进和多代理协同实现。

可信度: 8/10 – 1项声明可直接验证;2项需进一步确认;2项为观点陈述

事实核查:

  • ✓ 可验证: 谷歌 DeepMind 发表了一篇关于从 AGI 到 ASI 技术路径的论文 (可通过提供的 arXiv 链接(arxiv.org/abs/2606.12683)直接访问论文,确认其存在及作者归属。)
  • ◐ 部分可验证: 论文提出 4 种 AGI 到 ASI 的技术路径:计算扩展、算法范式转变、递归自我改进、多代理集体智能 (论文内容可通过 arXiv 链接验证,但路径的合理性和可行性需依赖领域专家评估或未来实证研究,属于部分可验证的学术假设。)
  • ◦ 观点: 递归自我改进是最不确定的路径,因可能受限于现实世界测试、硬件或新想法 (该声明是对技术路径风险的推测性判断,属于作者或研究者的主观分析,无直接客观证据支持。)

原文内容:

谷歌 DeepMind 的一篇精彩论文。

解释了从 AGI 到 ASI 的路径,以及为什么这一跃迁可能通过多种途径发生。

作者围绕 4 种技术路径来框架 AGI 到 ASI 的转变:

- 计算、模型规模、数据以及测试时推理的持续扩展;

- 超越当今基于 Transformer 的基础模型堆栈的算法范式转变;

- 递归自我改进,即 AI 加速 AI 研发并改进未来的系统;以及

- 多代理集体智能,即大量专业化代理协调成一个超人类群体代理。

扩展可能一段时间内有效,但它可能在数据、计算、能源方面遇到极限,或者从使系统变大中获得更弱的回报。

递归改进是最不确定的路径,因为 AI 可能加速 AI 研究,但如果艰难的研究问题需要现实世界测试、稀缺硬件或新想法,那个循环也可能放缓。

多代理集体可能是最被低估的路径,因为一个由胜任的数字工作者组成的社会,可能通过专业化、速度和协调,超越一个杰出的个体模型。

一个关键观点是,ASI 可能不是以 1 个突然事件到来,而是作为 AI 帮助创造更好 AI 和更强科学工具的一系列更快变化的链条。

- arxiv.org/abs/2606.12683

⏰ 19:05 | ❤️ 297点赞 | 📝 342字 | 查看原文 →

↑ 返回顶部

Rohan Paul @rohanpaul_ai

Compiling in real-time, the race towards AGI.

The Largest Show on X for AI.

Get my daily AI analysis newsletter to your email https://rohan-paul.com | 影响力: 6,793万粉丝

💡 核心观点: DeepSeek性价比显著高于Kimi,性能差距不值高价差。

可信度: 10/10 – 2项声明可直接验证;1项需进一步确认;2项为观点陈述

事实核查:

  • ◐ 部分可验证: Kimi K3 (Max) 在竞技场积分上领先 DeepSeek-V4-Pro (Max) 67 分 (竞技场积分可通过公开的模型评测平台(如 LMSYS Chatbot Arena)验证,但需确认具体评测版本(Max)和当前排名数据是否匹配。)
  • ✓ 可验证: DeepSeek 的输入成本比 Kimi 便宜 6.9 倍,输出成本便宜 17.2 倍 (可通过官方定价页面或 API 文档直接对比 Kimi($3/$15 每 MTok)和 DeepSeek($0.435/$0.87 每 MTok)的公开报价。)
  • ✓ 可验证: 1M 输入 + 1M 输出工作负载在 Kimi 上成本 $18,DeepSeek 上 $1.305 (基于双方公开的单价计算(1M 输入 + 1M 输出 = 1MTok),数学计算可验证。)

原文内容:

Kimi K3 (Max) 在竞技场积分上领先 DeepSeek-V4-Pro (Max) 67 分,但 DeepSeek 的输入成本大约便宜 6.9 倍,输出成本便宜 17.2 倍。

Kimi 每 MTok $3 / $15 与 DeepSeek 的 $0.435/$0.87

对于一个简单的 1M 输入 + 1M 输出工作负载,在 Kimi 上是 $18,而在 DeepSeek 上是 $1.305,大约便宜 13.8 倍。

这 67 分的差距也是早期的 AutoEval 差距,不是编码质量的线性百分比差异,因此 Kimi 只在它在你的环境中产生实质上更少的失败编辑、重试或人工审查时,才值得那个巨大的溢价。

⏰ 18:14 | ❤️ 45点赞 | 📝 125字 | 查看原文 →

↑ 返回顶部

Santiago Valdarrama @svpino

计算机科学家。我在 https://ml.school 教授硬核人工智能/机器学习工程。YouTube:https://youtube.com/@underfitted | 影响力: 0万粉丝

💡 核心观点: 自动化流程提升AI生成代码质量,无需逐行审查。

可信度: 10/10 – 2项声明可直接验证;2项需进一步确认;1项为观点陈述

事实核查:

  • ✓ 可验证: 我们不再手动阅读代码了。我们不关心单独的代码行。我们没有人试图去理解我们收到的数千行 AI 生成的代码。 (该声明涉及团队内部工作流程的具体实践,缺乏公开数据或第三方证据支持,除非团队公开内部操作记录或审计报告,否则无法验证其真实性。)
  • ◐ 部分可验证: 我们设计了(并且继续在这里投资)自动化流程,来验证我们交付的是高质量的软件。 (若团队公开了自动化工具或流程的技术文档、案例研究或第三方评测报告,可部分验证;但具体实施效果(如“高质量”)需依赖实际测试或用户反馈,无法完全通过公开信息确认。)
  • ◐ 部分可验证: 我们软件的质量没有任何方式、形状或形式的下降。我们交付得更多、更快。 (若团队提供版本迭代的测试报告、性能指标或客户满意度数据,可部分验证质量与效率;但“没有任何下降”是绝对化表述,需长期跟踪数据支撑,目前缺乏公开证据。)

原文内容:

我们都在这里学习,所以我没有资格告诉你该如何编写和审查你的代码。

我能告诉你的,是对我和我的同事们有效的方法。

我们不再手动阅读代码了。我们不关心单独的代码行。我们没有人试图去理解我们收到的数千行 AI 生成的代码。

相反,我们设计了(并且继续在这里投资)自动化流程,来验证我们交付的是高质量的软件,

我们软件的质量没有任何方式、形状或形式的下降。我们交付得更多、更快。

人们工作的时间量相同,但他们工作的性质已经发生了显著变化。

我不知道你在构建什么,也不知道你是如何做的,所以我不会假装我能谈论你该如何做。

如果你觉得阅读 AI 生成的代码有价值,那对你来说很好!如果你认为那是你验证自己构建的软件质量的最佳方式,那么就继续做吧。

⏰ 20:43 | ❤️ 320点赞 | 📝 277字 | 查看原文 →

↑ 返回顶部

Anthony Pompliano @apompliano

企业家、投资者和终身学习者。

每日写作:http://pompletter.com
播客:http://pompyoutube.com
我的第二本书:http://pompbook.com | 影响力: 0万粉丝

💡 核心观点: 长期看好$FIGR,因其业绩高速增长且CEO能力出众。

可信度: 8/10 – 2项声明可直接验证;1项需进一步确认;1项为观点陈述

事实核查:

  • ◐ 部分可验证: 我长期以来一直是 $FIGR 的股东。 (股东身份可通过公司股东名册或公开披露文件验证,但需具体时间范围和持股比例等细节才能完全确认,个人推文无法直接作为证据。)
  • ✓ 可验证: 去年公司 IPO 时,我们是公司前 5 大持股人之一。 (IPO 时的前五大股东通常会在招股书或监管文件中公开披露,可通过 SEC 文件或公司公告直接验证。)
  • ✓ 可验证: 他们的收入同比增长超过 100%,而在同一时间段 EBITDA 增长了 50% 以上。 (财务数据(收入、EBITDA)可通过公司财报或公开财务报告验证,需核对具体时间段和计算方式。)

原文内容:

我长期以来一直是 $FIGR 的股东。

我最初在 Morgan Creek 投资,后来还短暂加入了董事会。

去年公司 IPO 时,我们是公司前 5 大持股人之一。

我现在已经不在董事会了,但看了 @mcagney 这么长时间近距离工作后,几乎不可能对这家公司看空。

他们的收入同比增长超过 100%,而在同一时间段 EBITDA 增长了 50% 以上。

这简直太疯狂了。

每个人最终都会学会,永远、永远不要与 Mike Cagney 对赌。

⏰ 08:27 | ❤️ 98点赞 | 📝 130字 | 查看原文 →

↑ 返回顶部

Charly Wargnier @datachaz

前 @Streamlit @Snowflake 大师 • 我写关于 AI 代理、大语言模型和自动化的内容 • 我的属于开源 • 合作请私信 | 影响力: 0万粉丝

💡 核心观点: 谷歌Gemini 3.7 Flash性能强、价格低,碾压竞品。

可信度: 1/10 – 基于事实核查结果综合评估

事实核查:

  • ✗ 无法验证: 声明内容**:谷歌推出了GEMINI 3.7 FLASH算法升级,智能水平提升且价格比3.6 Flash降低50%。
  • ✗ 无法验证: 验证状态**:partially verifiable
  • ✗ 无法验证: 说明**:需通过谷歌官方公告或OpenRouter等合作平台确认版本更新、性能提升及具体定价变动,但“智能水平”等表述可能缺乏量化标准。

原文内容:

谷歌携 GEMINI 3.7 FLASH 重返赛场:它超赞且速度惊人

谷歌刚刚推出了重大算法升级,提升了智能水平,同时将价格比 3.6 Flash 降低了 50% 

官方评估现已在 @OpenRouter 上线。

它直接与顶级候选模型如 Sonnet 5、GPT-5.6 Terra 和 Muse Spark 1.2 进行了测试,证明其作为高容量工作马的主宰地位。

以下是它与竞争对手的对比:

> DeepSWE v1.1 分数达到 65.3%,轻松碾压 Muse Spark 1.2
> 长上下文处理能力达到 97.0%,击败 GPT-5.6 Terra
> 它甚至比 Sonnet 5 便宜 2-3 倍,用于繁重文档提取 

你现在就可以试用 3.7 Flash,通过 8 月 27 日享受额外 50% 折扣叠加在首购价格上 

⏰ 05:07 | ❤️ 47点赞 | 📝 159字 | 查看原文 →

↑ 返回顶部

Machina @exm7777

running ai-powered agencies | http://weeklyaiops.com | 影响力: 665万粉丝

💡 核心观点: Matic智能机器人颠覆传统吸尘器,实现全自动打扫。

可信度: 10/10 – 2项声明可直接验证;2项需进一步确认;1项为观点陈述

事实核查:

  • ◐ 部分可验证: Matic 吸尘器能以 3D 方式看到整个家并完美识别物体 (可通过官方宣传视频或技术文档验证部分功能(如物体识别),但“完美识别”需实测确认,可能存在宣传夸大。)
  • ✓ 可验证: Matic 可通过语音指令“嘿 Matic,打扫这里”直接响应,无需使用 app (功能演示或官方说明通常会在官网或发布会上展示,语音交互技术已成熟,可直接验证。)
  • ◐ 部分可验证: Matic 能在完全黑暗中自主打扫 (黑暗环境下的清洁能力需依赖传感器技术,可通过官方技术参数验证,但实际表现需实测。)

原文内容:

Dyson 的吸尘器部门现在一定在颤抖……

他们花了 30 年制造需要你自己推的吸尘器……那已经过时了

Matic 刚刚推出,它删除了你自己打扫的部分

看看它能做什么:
> 以 3D 方式看到你整个家并完美识别物体
> 指向一团乱,喊一声“嘿 Matic,打扫这里”,它就会去打扫,不需要用任何 app
> 在你睡觉时,在完全黑暗中自主打扫
> 一切都运行在机器人内部的芯片上,不接触云端

Dyson 花了 30 年完善吸力……Matic 花了 9 年打造最伟大的机器人

你无法通过制造更好的吸尘器来击败最好的吸尘器,你要击败它,就让打扫变成别人的工作

具体来说,是机器人的

⏰ 02:17 | ❤️ 256点赞 | 📝 201字 | 查看原文 →

↑ 返回顶部

Rohan Paul @rohanpaul_ai

Compiling in real-time, the race towards AGI.

The Largest Show on X for AI.

Get my daily AI analysis newsletter to your email https://rohan-paul.com | 影响力: 6,793万粉丝

💡 核心观点: Anthropic商业AI增速超OpenAI,但高价Fable 5采用率低。

可信度: 10/10 – 2项声明可直接验证;3项需进一步确认

事实核查:

  • ◐ 部分可验证: Anthropic 在商业 AI 领域的领先优势进一步扩大,每月增长 1.1 点,是 OpenAI(0.23 点)的五倍 (需依赖 Ramp 的原始支出数据报告验证增长点计算方式,但若 Ramp 公开此数据则可直接验证。目前无法确认其数据来源是否公开或第三方可查。)
  • ◐ 部分可验证: Fable 5 每 1M 令牌成本约 10 美元,是 GPT-5.6 Sol 的两倍 (若两家公司公开官方定价(如官网或API文档),则可直接验证;若为商业协议价格则需实测或内部数据,仅部分可验证。)
  • ◐ 部分可验证: Anthropic 覆盖 43.5% 的美国企业,OpenAI 为 39.7%(基于 Ramp 7 月数据) (需 Ramp 公开其统计样本、企业定义及原始数据,否则仅能通过第三方报告间接验证。)

原文内容:

Anthropic 在商业 AI 领域对 OpenAI 的领先优势进一步扩大,但 Fable 5 的采用率几乎没有变化。per Ramp。

价格作为制约因素:Fable 5 每 1M 令牌成本大约 10 美元,是 GPT-5.6 Sol 的两倍左右。

每月 1.1 点的增长几乎是 OpenAI 0.23 点增长的五倍。

两家公司仍在增长,但根据 Ramp 的衡量,Anthropic 现在正在以更快的速度增加商业采用率。

这是 Ramp 的 7 月支出数据,Anthropic 覆盖了 43.5% 的符合条件的美国企业,而 OpenAI 为 39.7%。

在 Anthropic 的模型组合中,Fable 5 在大约一个月后仅占令牌的 6% 和模型支出的 11.4%,而且其份额没有上升。

GPT-5.6 Sol 占 OpenAI 令牌的 25% 和支出的 23%,而 Fable 5 在 7 月产生的模型归因支出仅约为后者的 75%。

⏰ 18:02 | ❤️ 52点赞 | 📝 179字 | 查看原文 →

↑ 返回顶部

Amira Zairi @azed_ai

AI Educator & Creator | Ambassador @Adobe | Partner with leading brands | Collab → [email protected] | 影响力: 0万粉丝

💡 核心观点: 精准提示能提升AI构建应用程序的效果。

可信度: 10/10 – 2项声明可直接验证;2项需进一步确认;1项为观点陈述

事实核查:

  • ◐ 部分可验证: 使用具体明确的提示(如功能、目标用户、操作等)能帮助AI构建更有用的应用程序 (可通过测试不同AI工具(如Assembly Studio)的提示效果来部分验证,但具体效果可能因模型版本或用户需求差异而不同,需实测确认。)
  • ◐ 部分可验证: 提供的Prompt结构(如“为[用户]构建[工具]…”)能生成更紧凑且有效的AI输出 (需实际测试该模板在特定AI工具中的表现,但缺乏公开数据或官方对比证明其普适性,结果可能受主观判断影响。)
  • ✓ 可验证: “模糊的输入=模糊的结果”是AI生成内容的通用规则 (主流AI开发文档(如OpenAI、Anthropic)均强调提示词清晰度对输出质量的影响,可通过官方指南直接验证。)

原文内容:

Prompt 分享:构建一个可运行的应用程序

我一直在测试 Assembly Studio,你们已经知道我的提示规则:模糊的输入 = 模糊的结果

如果你想让 AI 构建一些真正有用的东西,请具体说明应用程序的功能、目标用户,以及应该发生什么

这里是我一直在使用的一个简单结构:

Prompt:
为 [谁使用它] 构建一个 [工具类型]。它应该跟踪 [主要事物],并让 [用户类型] 执行 [操作]。在主屏幕上显示 [关键视图]。当 [触发条件] 时发送 [警报]

示例:
为自由职业创作者构建一个客户审批跟踪器。它应该跟踪我发送给品牌的每个交付物,并让客户留下反馈并批准每个交付物。在主屏幕上显示所有仍在等待客户处理的内容。当某项内容未被批准超过三天时,向我发送提醒

括号越紧凑,结果就越好,伙计们!!!

⏰ 01:57 | ❤️ 26点赞 | 📝 258字 | 查看原文 →

↑ 返回顶部

swyx @swyx

achieve ambition with intentionality, intensity, integrity & insanity.

affiliations:
– @smol_ai
– @dxtipshq
– @cognition
– @aidotengineer
– @latentspacepod | 影响力: 0万粉丝

💡 核心观点: Arize AI团队加入Dynarize,成为AI原生观测领域顶尖力量。

可信度: 6/10 – 1项声明可直接验证;2项需进一步确认;1项为观点陈述

事实核查:

  • ◐ 部分可验证: Dynarize 是一家全球信赖的 140 亿美元的可观测性巨头 (公司估值和行业地位可通过公开财报、新闻报道或第三方机构(如Crunchbase)部分验证,但“全球信赖”属于主观描述,缺乏统一标准。)
  • ◐ 部分可验证: Dynarize 获得了该行业最顶尖的 AI 原生美国团队之一 (团队背景可通过LinkedIn等职业平台或公司官网部分验证,但“最顶尖”是主观评价,需依赖行业排名或权威认证进一步确认。)
  • ✓ 可验证: @aidotengineer 纽约活动是第一个非大云厂商成为 AIE 展示赞助商 (可通过活动官网(http://ai.engineer/nyc)或主办方公开的赞助商名单直接验证是否为“首个非大云厂商”。)

原文内容:

!!!!

过去几年与 @arizeai 一起通过 AIE 服务,是巨大的巨大荣幸,这不可能发生在更好的人身上。Dynarize 现在是一家全球信赖的 140 亿美元的可观测性巨头,它刚刚获得了该行业最顶尖的 AI 原生美国团队之一。

如果您有兴趣了解更多,请今年秋天来参加 @aidotengineer 纽约活动:http://ai.engineer/nyc 他们是第一个非大云厂商成为 AIE 展示赞助商!!

⏰ 07:44 | ❤️ 33点赞 | 📝 113字 | 查看原文 →

↑ 返回顶部

Ethan Mollick @emollick

Professor @Wharton studying AI.
New book, Co-Existence, coming October 20. Preorder here: https://co-existence.ai
Substack: https://oneusefulthing.org | 影响力: 0万粉丝

💡 核心观点: 早期高效使用人工智能的公司正拉开绩效差距。

可信度: 4/10 – 3项需进一步确认

事实核查:

  • ◐ 部分可验证: 早期采用人工智能且表现良好的公司可能开始超越其他公司 (需通过行业报告或案例研究验证早期AI采用者与绩效的关联性,但“可能”一词表明是推测性结论,需长期数据支持。)
  • ◐ 部分可验证: OpenAI数据显示,某些公司使用AI的程度更高,且其员工生产力最高 (若OpenAI公开相关报告或数据(如官网、白皮书),则可直接验证;若未公开具体数据来源或方法论,则为部分可验证。)
  • ◐ 部分可验证: 人工智能使用与公司绩效提升存在关联 (需依赖第三方研究或企业公开的绩效数据验证AI的直接影响,但“提升”的具体程度和因果关系可能难以量化。)

原文内容:

在人工智能使用提升公司绩效的范围内,这里有一些早期迹象表明,那些早期采用人工智能且已经表现良好的公司可能会开始超越其他公司。

OpenAI 的数据显示,一些公司使用人工智能的程度要高得多,而且它们往往是那些员工生产力最高的公司。

⏰ 07:17 | ❤️ 120点赞 | 📝 100字 | 查看原文 →

↑ 返回顶部

TechHalla @techhalla

AI 内容创作者与教育者 | 实用工作流程与教程,真正有效的 | 帮助创作者每日掌握 AI | 影响力: 0万粉丝

💡 核心观点: FBI突袭发现地下菠萝披萨生产线。

可信度: 10/10 – 2项声明可直接验证;2项需进一步确认;1项为观点陈述

事实核查:

  • ◐ 部分可验证: FBI战术特工在高风险住宅突袭行动中使用体视摄像机记录第一人称视角。 (FBI确实会在战术行动中使用执法记录仪(如Axon Bodycam),但具体任务细节(如突袭目标、装备配置)通常不公开,需依赖官方报告或泄露信息验证。)
  • ✓ 可验证: 突袭中发现一条活跃的菠萝披萨生产线。 (该描述具有高度戏剧化特征(如“肮脏厨房”与“生产线”的矛盾),且无具体案件记录或新闻报道支持,可能为虚构创作。)
  • ✓ 可验证: 特工执行突袭时佩戴FBI徽章、使用防弹盾牌和破门工具。 (FBI战术小组(如HRT)的标准装备和程序可通过官方文件或训练视频(如FBI官网发布的资料)验证,但需区分通用流程与具体事件。)

原文内容:

Seedance 2.5 Bodycam raid prompt is below 

【生成目标】
生成一段连续的30秒单镜头体视摄像机视频。核心主题是FBI战术特工在高风险住宅突袭行动中的第一人称视角。主要事件是实时动态进入和房间清扫行动,最终在肮脏的厨房内发现一条活跃的菠萝披萨生产线。

【阶段一 0-6s】
开始时:夜晚室外,一座破败的两层楼房位于被忽视的城市街道上,稀疏的钠灯路灯照亮。体视摄像机胸部安装在突击队长身上,略带广角失真,自然的手持微抖。其他三名FBI特工身着全黑战术装备,FBI徽章清晰可见,紧贴在风化前门旁的墙边排成一列。特工戴手套的手在画面底部可见,手持防弹盾牌和破门工具。
主要事件:大声口头宣布“FBI!搜查令!”随后立即强制进入。门被单次控制撞击撞开;团队以紧凑队形涌入室内。
结束时:体视摄像机越过门槛进入昏暗、杂乱的客厅。门框仍可见于画面边缘。

【阶段二 6-15s】
承接上一阶段:相同的连续体视摄像机视角,相同的特工、身份和装备。无剪辑。
主要事件:快速清扫客厅区域和短走廊。几名衣衫褴褛、苍白、瘦弱的个体(瘾君子模样)散坐在沙发上、地板上和靠墙处。特工一边经过一边发出清晰命令“把手举到我能看到的地方!趴下!”。两名嫌疑人已被按倒在地,手反绑身后;塑料束缚带被施加。体视摄像机稳步前进,左右扫描,手电筒光束短暂扫过肮脏墙壁和散落垃圾。
结束时:体视摄像机抵达厨房门口。刺眼的荧光厨房灯光现在在前方可见。

【阶段三 15-24s】
承接上一阶段:不间断的第一人称移动进入厨房。相同特工保持队形在后方和侧面。
主要事件:厨房被头顶荧光灯和柜下灯照亮,却极其肮脏。厚厚的白面粉覆盖每个台面、地板、橱柜正面以及里面人员的衣物。四名个体站在大型中央工作台和台面旁,积极用刀切新鲜菠萝片,并将切片放置在生披萨面饼基底上。面粉尘埃悬浮在空气中。特工涌入房间,武器低垂但随时准备,喊道“没人动!举手!远离桌子!”
结束时:厨房内所有四名工人已举起空手。覆盖面粉的披萨面饼和切好的菠萝片仍清晰可见于体视摄像机正前方的桌子上。

【阶段四 24-30s】
承接上一阶段:相同的连续体视摄像机,相同的灯光和空间布局。
主要事件:特工开始逐一制服厨房工人,引导他们的手反绑身后并施加束缚。体视摄像机缓慢平移扫过工作台面,停留在洒满面粉的面饼、打开的菠萝罐头、刀具以及半成品菠萝披萨上。背景中可闻无线电通话确认“厨房清扫完毕,嫌疑人已拘留。”
结束时:最终画面定格在近景视图:一只覆盖面粉的手被束缚,旁边是一块顶部放着新鲜菠萝片的披萨。体视摄像机保持稳定但仍显示自然微动。

【视觉风格与摄影】
仅真实世界体视摄像机镜头。连续单镜头,无剪辑,无慢动作,无电影级调色。略带广角镜头失真,快速移动时的自然运动模糊,逼真的手持摇晃和行走时的垂直颠簸。室外为低调钠蒸气夜间照明,带有可见噪点;室内为刺眼、不均匀的荧光实用照明,使一切清晰可见却仍保持粗糙肮脏感。服装、面部和环境全程保持一致且照片级真实。

【音频】
无音乐。无字幕。
语言:美式英语。
清晰的无线电和口头命令,以自然的美国执法节奏:
{FBI!搜查令!}
{把手举到我能看到的地方!趴下!}
{没人动!举手!}
{厨房清扫完毕,嫌疑人已拘留。}
仅真实环境音:沉重呼吸、靴子踩在肮脏地板上的脚步声、门撞击声、塑料束缚带拉链声、远处无线电杂音、厨房中刀具切菜板和面粉被扰动的环境噪音。保持所有对话、脚步和房间音效自然连续。

【保持一致】
全程30秒单一连续第一人称体视摄像机视角,来自一名FBI特工。特工数量、战术装备、房屋布局、灯光方向以及厨房工人确切人数保持稳定。无暴力、无血腥、无武器开火。唯一的“违禁”活动是在一层面粉下准备菠萝披萨。

而且不!我没有疯掉或变成机器人。这些中文字符是基于官方Seedance文档的推荐。

Enjoy! 

⏰ 06:56 | ❤️ 50点赞 | 📝 1293字 | 查看原文 →

↑ 返回顶部

Rohan Paul @rohanpaul_ai

Compiling in real-time, the race towards AGI.

The Largest Show on X for AI.

Get my daily AI analysis newsletter to your email https://rohan-paul.com | 影响力: 6,793万粉丝

💡 核心观点: AI指令因缺乏注释而难以删除,形成灾难性记忆。

可信度: 10/10 – 2项声明可直接验证;2项需进一步确认;1项为观点陈述

事实核查:

  • ◐ 部分可验证: 在 1,867 个 GitHub 仓库中,代理指令文件在其生命周期内增长超过三倍,指令数量平均上升 226% (可通过检查 GitHub 仓库历史记录验证文件增长情况,但需抽样核实具体数据(如 1,867 个仓库的选取标准、增长计算方式),且原始数据来源未直接提供。)
  • ✓ 可验证: 信息性注释将多余提示大小从 +211.3% 降至 +1.4%(基于 51 步受控 IFEval 设置) (可通过论文(arxiv.org/abs/2608.11095)中的实验方法和数据直接验证,但需专业复现实验以确认结果可重复性。)
  • ◐ 部分可验证: “灾难性记忆”指指令长期存在但原始推理消失的现象,尤其在多人编辑的文件中衰减更显著 (论文中可能提供定性分析或案例,但“衰减陡峭”的具体程度需依赖作者定义的指标,未明确量化标准。)

原文内容:

新术语“灾难性记忆”

CLAUDE.md 存在一个棘手问题:指令易于添加,但越来越难以删除。

代理提示可能会比维护者记住这些规则存在原因的时间长得多地记住规则。

在 1,867 个 GitHub 仓库中,代理指令文件在其生命周期内增长超过三倍,指令数量平均上升 226%。

随着指令老化,删除的可能性降低,而这种衰减在由多名人类作者编辑的文件中更为陡峭。

论文将此称为“灾难性记忆”:指令得以存活,但曾经为其辩护的推理却消失了。

提出的修复方案是一种已有数十年历史的软件实践:为每条指令附加一条记录失败、假设和结果的注释,然后将该注释隐藏起来,不让执行模型看到。

在 51 步受控 IFEval 设置中,信息性注释将多余提示大小从 +211.3% 降至 +1.4%,两组中最后三轮约束满足率均为 44.0%。

注释形状的噪声未能重现这一效果,这表明效果源于保留的理由而非额外文本。

– arxiv.org/abs/2608.11095

标题:“为什么 CLAUDE.md 持续增长?代理编码中的灾难性记忆”

⏰ 06:29 | ❤️ 20点赞 | 📝 312字 | 查看原文 →

↑ 返回顶部

EP @eptwts

product pusher | 影响力: 951万粉丝

💡 核心观点: 测试短视频分类工具,按产品类型抓取竞品视频并分析。

可信度: 10/10 – 2项声明可直接验证;3项需进一步确认

事实核查:

  • ◐ 部分可验证: 该软件可以抓取 TikTok/IG 上推广产品的视频,并按产品类型、细分市场、销售意图等进行分类 (功能描述具体,但需实测或查看软件演示才能确认其分类准确性和数据来源合法性(如是否违反平台爬虫政策)。)
  • ◐ 部分可验证: 用户可输入销售的产品类型,软件会抓取同类产品的推广视频 (功能逻辑清晰,但实际效果(如抓取范围、匹配精度)需测试验证,且依赖平台数据公开性。)
  • ✓ 可验证: 软件能根据提示(如“发送100个推广语言学习应用的视频”)返回指定条件的视频 (需实际测试提示功能的响应能力和结果准确性,目前无公开证据或案例支持。)

原文内容:

我正在寻找一些大规模运营短视频内容的人来测试我的软件的 beta 版……

它会抓取 TikTok/IG 上推广产品的视频,并按产品类型(实体/数字)、细分市场、销售意图等进行分类

我们有一个内置的跟踪器,你可以输入你销售的产品类型,它就会抓取你其他销售同类产品的视频

我们有一个 MCP 和 CLI,它作为你的代理的营销数据层……

例如,你可以提示它“给我发送 100 个推广语言学习应用的视频,每个视频结尾都有行动号召”,它就会照做

你可以用这些数据做各种事情,比如提取钩子,用 AI 重新创建它们,等等。

如果你有兴趣参与 beta 测试,请回复,我会给你发私信

⏰ 05:54 | ❤️ 67点赞 | 📝 212字 | 查看原文 →

↑ 返回顶部

Chubby♨️ @kimmonismus

Tech Analyst & Content Creator. Editor-in-Chief @getsuperintel – Community of 300k+ in total: https://linktr.ee/kimmonismus // [email protected] | 影响力: 0万粉丝

💡 核心观点: 2D图像5分钟生成高细节3D模型,无需复杂设置。

可信度: 10/10 – 2项声明可直接验证;3项需进一步确认

事实核查:

  • ◐ 部分可验证: 可以从一张平面2D图像生成可用的3D资产 (需实测或查看官方演示/案例验证其生成效果和可用性,但技术原理(如AI生成3D模型)本身存在公开研究基础。)
  • ◐ 部分可验证: 生成过程仅需5分钟 (时间声明依赖具体硬件、网络条件及图像复杂度,需用户实测对比,但可通过官方工具复现流程验证。)
  • ✓ 可验证: 完全在浏览器内通过@Hitem3D处理,无需任何设置 (可通过访问@Hitem3D官网或试用其浏览器工具直接验证是否需安装或额外配置。)

原文内容:

1/ 想看看你是否真的能从一张平面 2D 图像中生成一个可用的 3D 资产生成,而无需花费数小时修复网格。

一张平面 2D 图像在短短 5 分钟内就将其转化为一个清晰、高细节的 3D 模型。一切都在浏览器内完全通过 @Hitem3D 处理,因此无需任何设置。这是最终资产生成的一个快速展示,以及确切的工作流程:

⏰ 05:30 | ❤️ 76点赞 | 📝 114字 | 查看原文 →

↑ 返回顶部

Boris Cherny @bcherny

Claude Code @anthropicai | 影响力: 0万粉丝

💡 核心观点: AI助手Claude可有效自动化日常代码维护任务

可信度: 9/10 – 2项声明可直接验证;2项需进一步确认

事实核查:

  • ◐ 部分可验证: Claude 被用于接管应用的日常维护,包括崩溃模糊器、重复统一器、死代码移除器等例程 (可通过访问推文提到的链接 https://claude.ai/code/routines 查看相关功能是否存在,但具体实验细节(如PR数量、流程调整)需依赖用户实测或内部数据验证。)
  • ✓ 可验证: 过去几周,Claude 在多个仓库中开启了388个PR,其中180个被合并 (PR数量和合并状态属于未公开的私有数据,除非作者提供具体仓库或日志,否则无法独立验证。)
  • ◐ 部分可验证: Claude 通常第一次就能正确处理PR,若需调整会通过修改例程改进 (可通过测试类似工作流程观察Claude的PR生成质量,但“通常第一次正确”的结论依赖特定实验环境,无法直接验证。)

原文内容:

过去几周我一直在尝试的一个奇怪实验是让 Claude 接管我们应用的日常维护。看到早期迹象表明这可能是可行的。

设置很简单:我们有一个名为 proj-claude-maintains-apps 的 Slack 频道。在其中,Claude Tag 运行着一堆针对 iOS、Android、Desktop、web、CLI 和 Agent SDK 的日常例程:

- 崩溃模糊器:在一个模拟器中打开应用并四处点击,以找到崩溃方式,然后根因分析并修复崩溃
- 重复统一器:扫描代码库中类似但略有分歧的抽象,并提出 PR 来统一它们
- 死代码移除器:移除静态不可达代码,并为疑似死代码添加日志以检查它是否真的已死,如果是,则在第二天移除它
- 抽象警察:修复泄漏抽象
- 还有更多……

结果出奇地积极。在过去几周,这些例程在我们各个仓库中开启了 388 个 PR,其中 180 个在 Claude 代码审查 + 人工审查后被合并。我们现在正在考虑如何简化这个流程,让合并这类机械变更更容易。

Claude 通常第一次就能正确处理这些 PR,如果没有,我们会要求 Claude 调整其例程,以便第二天做得更好。有时需要几天时间来调整。

要尝试类似的工作流程,请询问 Claude Code 或 Tag,或者直接在 https://claude.ai/code/routines 创建一些例程。下面是我使用的一些实际提示。

有人尝试过类似的工作流程吗?

⏰ 05:27 | ❤️ 2359点赞 | 📝 375字 | 查看原文 →

↑ 返回顶部

Jerry Liu @jerryjliu0

解析世界上最难处理的 PDF @llama_index。公司联合创始人/首席执行官

职业机会:https://llamaindex.ai/careers
企业服务:https://llamaindex.ai/contact | 影响力: 0万粉丝

💡 核心观点: Llama Index伦敦办公室开业并招聘多岗位人才。

可信度: 10/10 – 2项声明可直接验证;1项需进一步确认;2项为观点陈述

事实核查:

  • ◐ 部分可验证: 在伦敦开设了@llama_index办公室,目前有三名成员(Frank、Max、Joe),很快会有两人加入 (可通过@llama_index官方账号或公司官网确认伦敦办公室的存在及成员信息,但需核实具体成员姓名及招聘进展是否公开披露。)
  • ✓ 可验证: 正在旧金山、伦敦和纽约招聘大量不同职能的人员(列举具体职位) (可通过公司官网或招聘平台(如LinkedIn)直接查看发布的职位列表及地点信息。)
  • ✓ 可验证: 过去几个月规模翻倍 (未提供具体数据(如员工数、营收等),且此类增长信息通常属于内部未公开数据,需官方正式报告佐证。)

原文内容:

我们的英国代表忘了微笑 

我们最近在伦敦开设了 @llama_index 办公室 。目前有三名成员(Frank、Max、Joe),很快会有两人加入。它还有泰晤士河的美丽景色。

我们正在旧金山、伦敦以及(即将)纽约招聘大量不同职能的人员:

* 技术人员:涵盖核心产品工程、基础设施和 AI 研究

* 前沿部署 AI 工程师

* 中型市场和企业账户执行官 BDR

* 现场营销和开发者关系

* 市场推广和技术招聘

我们正在快速增长——过去几个月规模翻倍——很希望能邀请更多人加入我们的旅程 

来查看我们的职业页面:

⏰ 05:09 | ❤️ 40点赞 | 📝 177字 | 查看原文 →

↑ 返回顶部

Rohan Paul @rohanpaul_ai

Compiling in real-time, the race towards AGI.

The Largest Show on X for AI.

Get my daily AI analysis newsletter to your email https://rohan-paul.com | 影响力: 6,793万粉丝

💡 核心观点: AI效率提升推动芯片需求激增,旧TPU仍满负荷运转。

可信度: 4/10 – 2项需进一步确认;1项为观点陈述

事实核查:

  • ◐ 部分可验证: 谷歌的7年和8年前的TPU仍然保持100%的利用率 (需通过谷歌官方公开的硬件利用率报告或内部数据验证,但此类数据可能涉及商业机密,未完全公开。Amin Vahdat的职位可验证,但具体TPU利用率需依赖谷歌主动披露。)
  • ◦ 观点: Jevons悖论(效率提升导致使用量爆炸)正在AI领域全面发挥作用 (Jevons悖论是经济学理论,其应用于AI领域属于主观推断,缺乏直接数据证明“使用量爆炸”与效率提升的因果关系。)
  • ◐ 部分可验证: AI领域日常突破不断涌现,所有可用芯片均被投入工作 (AI突破可通过学术论文或行业新闻部分验证,但“所有芯片投入工作”需芯片厂商或企业的全局数据支持,目前无公开全面统计。)

原文内容:

谷歌的 7 年和 8 年前的 TPU 仍然保持 100% 的利用率。

Amin Vahdat,谷歌云 AI 和基础设施的总经理兼总经理表示。

Jevons 悖论现在正在全面发挥作用,一旦某物变得更高效,其使用量就会爆炸式增长。

AI 现在就处于这个位置。
日常突破不断涌现,每个人都忙着让每一块可用的芯片投入工作。

---

来自 @a16z YT 频道的视频。(链接在评论中)

⏰ 16:35 | ❤️ 67点赞 | 📝 115字 | 查看原文 →

↑ 返回顶部

© 版权声明

相关文章

暂无评论

暂无评论...