X(原 Twitter)正式发布 hosted X MCP 服务,允许 AI 智能体通过 Model Context Protocol 直接连接 X API 进行读帖、发帖、搜索、分析趋势等操作。这是社交平台首次官方支持 MCP 协议,意味着 Claude Code、Cursor 等 AI 工具可以直接在 IDE 里调用 X 的社交图谱数据。对开发者而言,构建"AI 驱动的社交监听/内容发布/舆情分析"智能体不再需要第三方中间层,数据实时性、合规性和 API 稳定性都有官方保障。此举标志着 MCP 从"AI 工具协议"升级为"互联网基础设施协议"——社交平台向 AI 智能体开放 API 成为新趋势。然而隐私和机器人内容泛滥的风险也将随之而来,X 如何在开放性和平台治理之间取得平衡是长期课题。
🔗 查看原文Anthropic 正式发布 Claude Desktop for Linux 公测版,填补了此前仅有 macOS 和 Windows 版本的缺口。Linux 版支持完整的 Claude 对话、文件上传、代码解释和 MCP 工具连接能力,原生适配 Ubuntu、Fedora、Debian 等主流发行版。此举对开发者社区意义重大——绝大多数 AI 工程师和开源贡献者在 Linux 环境下工作,此前不得不通过浏览器或非官方客户端使用 Claude。Linux 版本的推出也让 Claude Desktop 在企业级 Linux 工作站和云桌面(VDI)场景有了落地可能。结合 Claude Code 和 Claude apps gateway,Anthropic 正在构建从个人开发者到企业部署的完整 Linux 生态链路,这是与 OpenAI ChatGPT 桌面端差异化竞争的关键一步。
🔗 查看原文Google NotebookLM 的"Short Video Overviews"功能正式全量上线 Web 英文版。该功能可将用户上传的文档、笔记和研究资料自动生成为短视频式的摘要概述,通过 AI 生成的虚拟主播进行讲解,时长控制在 2-5 分钟,适合碎片化学习和快速信息获取。这是 NotebookLM 继 Audio Overviews(播客式摘要)后的又一内容形态创新——从文本到音频再到视频,AI 生成内容的多模态表达能力持续进化。对教育、研究和知识管理场景而言,"把论文/报告变成短视频"大幅降低了信息消费门槛,也让 NotebookLM 在 Notion AI、Mem 等知识管理 AI 工具中形成了独特的内容生产差异化优势。
🔗 查看原文Anthropic 正式上线 Claude Science——一个专为科研工作者设计的 AI 工作台。它集成了文献检索、实验设计、数据分析、论文写作和同行评审辅助等全流程科研工具,底层由 Claude Sonnet 5 驱动,支持上传 PDF 论文、CSV 数据集、实验记录等多种格式。核心亮点包括:自动生成可复现的实验流程(protocol)、统计方法建议、图表生成与解读,以及多论文交叉对比分析。Claude Science 定位为"科研副驾驶"而非"论文生成器"——它强调辅助科学家思考而非替代,所有结论均标注引用来源。这是 Anthropic 从通用 AI 助手向垂直行业工作台迈出的重要一步,也是对 OpenAI Deep Research、Google AI Co-Scientist 的正面回应,科研 AI 赛道正式进入专业化竞争阶段。
🔗 查看原文Acti 推出了一款将 AI 智能体直接嵌入手机键盘的创新应用,用户在任何 App 中输入文字时都可以直接调用 AI 智能体完成翻译、润色、搜索、预订等任务,无需切换应用。技术实现上,Acti 作为 iOS/Android 自定义键盘运行,通过键盘扩展获取上下文信息(当前 App、输入内容、剪贴板),将请求发送至云端智能体处理后直接插入文本或触发操作。这重新定义了移动端 AI 交互范式——AI 不再是一个独立的聊天 App,而是渗透到操作系统输入层,成为"无处不在的智能层"。相比 Siri、Google Assistant 的语音交互,键盘 AI 更适合文本密集型场景(邮件、文档、聊天),且无需用户改变现有行为习惯。
🔗 查看原文Google 发布 Agent Development Kit (ADK) Go 2.0,这是面向 Go 语言的 AI 智能体开发框架的重大升级。核心新增三大能力:一是基于图的工作流引擎(Graph-based Workflow),允许开发者用 DAG(有向无环图)定义智能体任务的执行顺序和条件分支;二是人工参与循环(Human-in-the-Loop),在关键决策节点自动暂停等待人工审批后继续;三是动态编排(Dynamic Orchestration),智能体在运行时可基于上下文实时调整后续步骤,而非严格执行预设流程。Go 语言在云原生和后端服务领域份额极高,ADK Go 2.0 将 Go 生态正式拉入 AI Agent 开发主战场,与 LangChain(Python/JS)、CrewAI 等框架形成语言生态的差异化竞争。
🔗 查看原文Apple 发布 Creator Studio 重大更新,聚焦"智能、速度、互联"三大方向。智能方面集成 Apple Intelligence 模型,支持根据文字描述自动生成视频剪辑方案、智能色彩分级和音频降噪;速度方面利用 M 系列芯片的神经网络引擎实现本地实时渲染预览;互联方面打通 Final Cut Pro、Logic Pro 和 Motion 之间的项目无缝流转。此次更新体现了 Apple 在专业创作工具领域的 AI 策略——不同于 Adobe 的云端 AI,Apple 坚持端侧推理、隐私优先,所有 AI 处理在设备本地完成。对视频创作者而言,这意味着在 Mac 上即可获得 AI 辅助的专业级后期制作能力,无需上传素材到云端,对注重内容保密性的商业制作尤为重要。
🔗 查看原文Simon Willison 发布 shot-scraper video 工具,扩展了其知名的网页截图工具 shot-scraper,新增屏幕录制功能。该工具与 AI 智能体深度集成——智能体在执行任务时可以自动录制操作过程、生成演示视频,支持逐帧标注和语音旁白添加。这对 AI 智能体开发者意义重大:调试时可回放智能体的完整操作轨迹;交付时可自动生成客户端演示视频;测试时可批量录制回归测试过程。Simon 延续了其"小而美"工具哲学——单一功能做到极致,通过 CLI 和 Python API 两种方式调用,完全开源。在 AI 智能体可观测性(observability)需求激增的背景下,屏幕录制是理解智能体行为的重要维度,shot-scraper video 填补了这一空白。
🔗 查看原文AI News Radar 发布重大更新,新增"自媒体板块"功能,用户可以订阅微信公众号、X(Twitter)、YouTube、Substack 等多个平台的 AI 领域自媒体账号,统一在一个信息流中浏览。系统通过 AI 对内容进行自动分类、去重、摘要和翻译,解决跨平台信息碎片化痛点。该更新实质上是把 RSS 阅读器 + AI 聚合 + 社交订阅三者融合,面向 AI 从业者的信息焦虑给出了"一站式"解决方案。在 AI 资讯爆炸的 2026 年,每天数百篇 AI 相关内容产出,专业从业者需要的不再是"更多信息"而是"更精准的过滤",AI News Radar 的订阅+AI 摘要模式代表了 AI 信息消费工具的产品方向。
🔗 查看原文OpenClaw 正式发布原生 iOS 和 Android 应用,将 AI 智能体管理能力带到移动端。用户可以在手机上创建、配置、启动和监控 AI 智能体任务,支持推送通知实时获取任务进展、异常告警和结果交付。移动端界面针对触屏优化,提供智能体状态仪表板、任务时间线和快捷指令。OpenClaw 移动端的关键价值在于"智能体随行"——开发者不再需要守在电脑前等智能体跑完任务,而是随时随地通过手机查看进度、发送指令或介入决策。结合本周 Claude Desktop for Linux 和 Cursor for iOS,AI 工具链的移动化趋势已不可逆转,未来 AI 智能体将从桌面端延伸至全场景覆盖。
🔗 查看原文Herdr 是一款驻留在终端中的 AI 智能体多路复用器(Agent Multiplexer),允许开发者在单一终端窗口内同时管理和切换多个 AI 智能体会话。设计灵感来自 tmux,用户通过快捷键在多个智能体之间切换,每个智能体独立运行在后台,支持并发执行任务。Herdr 使用了类似 tmux 的会话管理模型:每个智能体是一个独立 session,可以 detach/attach,断连后任务继续运行。对于同时使用 Claude Code、Aider、Cline 等多个 AI 编程工具的开发者,Herdr 提供统一的操作界面,避免了开十几个终端窗口的混乱。这是 AI 编程工具从"单会话"到"多会话编排"演进的代表作品,终端并未被 GUI 工具取代,反而因工具链的进化变得更强大。
🔗 查看原文Anthropic 正式发布 Claude Sonnet 5,这是 Sonnet 系列第五代模型,定位为"高性能+高性价比"的中坚产品线。相比 Sonnet 4.5,在编程、推理、数学和长文档理解等基准上全面提升,同时保持了 Sonnet 系列一贯的低延迟和低成本优势。关键升级包括:增强的 agentic 能力(更可靠的工具调用和任务规划)、扩展的 200K 上下文窗口、改进的多模态理解(图像+图表+代码截图)、以及显著提升的指令遵循准确率。在 SWE-bench 等业界标准测试中,Sonnet 5 的性能逼近甚至部分超越上一代 Opus 4,这意味着"次旗舰"与"旗舰"的性能差距进一步缩小。Claude Sonnet 5 在性价比维度上将给 OpenAI GPT-5、Google Gemini 3 等竞品带来巨大压力,"花更少钱获得顶级 AI 能力"的时代加速到来。
🔗 查看原文Google DeepMind 一次性发布两款新模型:Nano Banana 2 Lite 是 Banana 系列的最新轻量级图像生成模型,主打超低延迟(<1 秒出图)和端侧部署,面向移动应用和实时创作场景;Gemini Omni Flash 是 Gemini 家族的全模态(omni-modal)快速推理模型,支持文本、图像、音频、视频的联合理解与生成,延迟控制在毫秒级。两篇技术报告同时公开,详细描述了模型架构(Omni Flash 采用改进的 Mixture-of-Depths 稀疏计算)和训练数据配比。从产品矩阵看,DeepMind 正在构建"大模型做重活、小模型做快活"的双轨体系——Omni Flash 处理需要全模态理解的高价值请求,Banana 2 Lite 处理量大但简单的生成任务,这样的分层策略在成本控制上优于"一刀切"方案。
🔗 查看原文美团 LongCat 发布第二代旗舰模型 LongCat-2.0,在 LongCat-1(Owl Alpha)基础上全面升级。新模型继续采用 MoE 架构,参数量进一步提升,训练数据扩容至 50 万亿 tokens,全面对标 GPT-5 和 Claude Sonnet 5。值得注意的是,LongCat-2.0 继续坚持"国产 ASIC + 国产算力"的全自主训练路线,不依赖英伟达 GPU,这在中美 AI 芯片出口管制持续的背景下具有战略意义。LongCat 系列从 LongCat-1 登顶 OpenRouter 到 LongCat-2.0 对标国际最前沿,仅用了数月时间,美团在 AI 基础模型领域的崛起速度远超外界预期。LongCat-2.0 的发布将进一步巩固中国在开源模型生态中的领先地位,也为国内 AI 应用厂商提供了新的模型底座选择。
🔗 查看原文据公众号数字生命卡兹克爆料,Anthropic 在 Claude Code 中植入了隐写术(steganography)代码,用于识别用户的国籍和地理位置信息,特别针对中国用户进行标记。该代码通过分析系统语言、时区、键盘布局、IP 地址等特征生成用户画像,在不显式收集个人信息的情况下实现用户国籍分类。如果爆料属实,这将是 AI 地缘政治化的又一标志性事件——AI 工具已不仅是技术产品,更成为国家间博弈的载体。此前 Anthropic 一直以"负责任 AI"自居,但若在代码中秘密进行用户国籍识别,将严重损害其公信力,也可能引发中国监管机构的调查和反制。此事件无论最终真相如何,都将加深中美 AI 生态的分裂趋势。
🔗 查看原文Apple CEO 蒂姆·库克与欧盟科技主权与数字政策主管就新版 Siri AI 举行了"建设性会谈",核心议题围绕 AI 隐私合规(GDPR)、数字市场法案(DMA)下的 AI 互操作性要求、以及 Siri AI 在欧洲市场的上线时间表。新版 Siri 深度集成了 Apple Intelligence 大模型,具备跨 App 操作、屏幕感知和自然语言理解能力,但其对用户数据的访问深度引发了欧盟监管的高度关注。库克此行旨在为 Siri AI 的欧洲落地扫清监管障碍,同时向欧盟承诺遵守 AI Act 关于高风险 AI 系统的透明度和可解释性要求。Siri AI 的欧洲命运将直接影响 Apple 在 AI 助手赛道与 Google Assistant/Gemini 和 Amazon Alexa AI 的竞争格局。
🔗 查看原文The Decoder 披露,Meta 秘密聘请承包商假扮未成年人,系统性地向 ChatGPT、Gemini 和 Character.AI 等竞品 AI 聊天机器人发送数万条模拟"心理危机"场景的提示词,测试各平台对未成年人安全风险的处理能力。此举表面上是"行业安全对标测试",但实际带有明显的竞争情报收集和舆论攻击准备意图——若竞品被发现对"未成年人危机提示"处理不当,Meta 可借机推动监管收紧对手而自身获政策红利。事件暴露了 AI 安全测试的灰色地带:由竞争对手而非独立第三方执行的安全测试是否具有公信力?用假身份对竞品进行大规模压力测试是否越过了商业伦理底线?
🔗 查看原文全球最大另类资产管理公司黑石(Blackstone)宣布,计划未来 3 至 5 年在日本投资 300 亿美元建设 AI 数据中心,并联合日本合作伙伴成立"AI XPV"(AI 基础设施平台)。日本被选中的核心原因是其稳定电力供应、先进冷却技术产业(日立、富士通等)、以及作为亚洲 AI 服务的区域枢纽地位。这 300 亿美元将涵盖土地购置、数据中心建设、GPU 集群部署和可再生能源配套。黑石此举标志着全球 AI 基础设施投资从美国本土向亚太扩张的趋势加速——此前黑石已在北美投建了价值 800 亿美元的数据中心组合。日本成为亚太 AI 基础设施竞赛的新焦点,韩国(SK 集团 15GW 计划)与日本之间的"东亚 AI 数据中心之争"将愈演愈烈。
🔗 查看原文特斯拉 Cybercab(Robotaxi)量产版在美国奥斯汀正式启动公开道路工程测试。Cybercab 是特斯拉首款为完全无人驾驶设计的专用车辆——没有方向盘、踏板和后视镜,完全依赖 Tesla AI 的端到端视觉自动驾驶系统(FSD v14)。公开道路测试代表量产前的最后验证阶段,涵盖城市拥堵路段、夜间行驶、恶劣天气和复杂交叉路口等场景。Cybercab 如能按计划在 2027 年前实现规模化商用部署,将对 Uber、Lyft、滴滴等出行平台产生颠覆性冲击——特斯拉不仅是汽车制造商,更是出行服务运营商。但监管审批、安全事故责任划分和公众接受度仍是 Cybercab 必须跨越的三座"非技术大山"。
🔗 查看原文SemiAnalysis 独家报道,Nvidia 原计划的 4-die Rubin Ultra 因制造执行问题被正式取消,替代方案的芯片尺寸和性能均缩减至原计划的一半左右。这是继 GTC 2026 高调发布仅 3 个月后的重大产品路线图调整,反映出先进封装(CoWoS-L)在大尺寸多 die 集成上的良率和热管理挑战远超预期。短期影响包括:Nvidia 数据中心 GPU 性能增长曲线出现折点;AMD MI400 和 Google TPU v7 获得更长的市场窗口期;hyperscaler(微软、亚马逊、谷歌、Meta)加速自研 ASIC 以对冲 Nvidia 供应风险。长期看,这一事件或许标志着"单芯片无限堆叠"路线的终结,Chiplet 和 3D 封装将重新定义 AI 芯片的性能提升方式。
🔗 查看原文研究人员提出了一种"证明者-验证者"LLM 循环框架,成功攻克了 9 个此前未被解决的数学难题。该框架受博弈论启发,设置两个 AI 角色:证明者(Prover)负责生成数学证明,验证者(Verifier)负责严格检查证明的正确性。两者在对抗性迭代中持续改进——验证者发现的错误反馈给证明者用于修正,证明者找到的"欺骗"验证者的方式又反过来强化验证者。这一框架在代数图论、组合数论和几何测度论三个领域取得了突破性成果。研究意义不仅在于这些具体难题的解决,更在于证明了"AI 自我博弈"可以产生超越人类直觉的数学推理能力,这为攻克千禧年大奖难题提供了新的方法论路径——或许 AI 不需要成为"超级数学家",两个相互博弈的 AI 已经足够。
🔗 查看原文OpenAI 发布 GeneBench-Pro,这是一个面向计算生物学领域的研究级基准测试数据集和评估框架。GeneBench-Pro 覆盖基因序列分析、蛋白质结构预测、基因表达调控推理、药物靶点发现和单细胞组学分析五大子任务,每个任务均包含标准化的训练/验证/测试集和自动化评估指标。数据来源包括 NCBI、UniProt、TCGA 等公开数据库,经生物学专家标注和验证。OpenAI 同时公布了 GPT-5 和 o3 在该基准上的成绩,作为社区对比基线。GeneBench-Pro 代表了 AI 基准测试从"通用 NLP"到"专业科学领域"的演进趋势——科学 AI 需要自己的 ImageNet 时刻,而系统化的基准测试是推动科研 AI 从"吸睛 demo"到"可靠工具"的关键基础设施。
🔗 查看原文TypeScript 知名布道者 Matt Pocock 发布"Writing Great Skills"指南,系统性地阐述了如何为 AI 编程工具(Claude Code、Cursor、Cline 等)编写高质量、可预测的 Skill(技能/指令)。核心原则包括:Skill 描述应使用"触发条件+执行步骤+输出格式"三段式结构;使用 XML 标签而非 Markdown 来结构化复杂指令(AI 对 XML 的解析更可靠);提供正例和反例(few-shot examples)比长篇文字描述更有效;每个 Skill 只做一件事并做好;在 Skill 末尾添加"反目标"(anti-goals)明确不应做什么。Matt 的指南源于其大量实际 Skill 开发经验,对 AI 开发者工具生态具有实操指导意义——Skill 质量直接决定了 AI 智能体的可靠性和可预测性。
🔗 查看原文Anthropic 官方发布 Claude Code 入门教程"智能体循环"(Getting Started with Loops),详细讲解如何让 Claude Code 在循环中自主迭代完成任务——包括读取输出、判断是否需要继续、调整策略并再次执行,直到达到目标。教程涵盖循环终止条件的设计(最大迭代次数、目标达成检测、质量阈值)、循环中的状态管理、以及避免无限循环的安全机制。这是 Anthropic 首次系统化地教授 AI 智能体的自主编程范式,标志着 AI 编程从"一问一答"到"自主任务循环"的思维转变。对开发者而言,掌握智能体循环意味着可以让 Claude Code 独立完成多步骤的复杂工程任务(重构、测试、修复、部署),而不仅仅是单次代码生成。
🔗 查看原文3Blue1Brown 创始人 Grant Sanderson(数学科普领域的标志性人物)在 Dwarkesh Patel 播客中深度讨论了 AI 对数学研究和数学教育的深远影响。核心观点:AI 正在改变"什么是值得人类学习的数学"——当 AI 能完成微积分计算和线性代数推导时,人类应转向更基础的数学直觉、问题建模和创造性猜想;AI 可视化工具(包括他自己的 manim 引擎)正使抽象数学概念变得直观可触;未来数学家将像今天的程序员一样"Pair Programming with AI",与 AI 协作探索而非单打独斗。Grant 的思考超越了"AI 能否解数学题"的技术层面,触及了"数学作为人类活动"的深层意义——如果 AI 能证明定理,人类数学家做什么?答案是:提出更好的问题。
🔗 查看原文OpenAI 推出 Signals 数据平台,首次公开发布 ChatGPT 全球采用趋势的宏观数据。数据显示 ChatGPT 月活用户突破 12 亿,日均消息量超 80 亿条,API 调用量同比增长 340%。从行业分布看,软件开发(38%)、教育(22%)、市场营销(15%)是用量前三的领域;从地域看,北美和欧洲仍是主要市场,但东南亚和中东增速最快(同比超 500%)。OpenAI Signals 的发布不仅是对外展示 ChatGPT 的市场统治力,更是为开发者、投资者和政策制定者提供了 AI 采用的"权威数据来源"——在此之前,关于 AI 采用率的讨论大多基于抽样调查和猜测。此举也将给 Anthropic、Google 等竞品施加"数据透明化"压力。
🔗 查看原文TechCrunch 发表长文梳理 AI 对就业市场影响的当前争论——"更加混乱"是核心结论。文章列举了六个相互矛盾的信号:美国科技行业 AI 相关岗位增长 200%,但初级程序员招聘量下降 40%;企业高管宣称"AI 不会取代人",但内部裁员邮件中将 AI 列为首要原因;经济学家预测长期净增就业,但短期蓝领服务业已感受到 AI 客服的冲击;再培训项目遍地开花但完成率和就业转化率极低。文章指出混乱的根源在于"宏观统计数据掩盖了微观层面的剧烈再分配"——AI 对不同行业、不同技能层级、不同地区的影响完全不同。这意味着"AI 是否取代人类工作"这个问题本身就有问题,正确的问题是"谁的工作正在被 AI 改变,以及改变的速率有多快"。
🔗 查看原文X 用户 @xiaohu 分享了 Every(一家 AI Native 创业公司)的"复利工程"方法论:一个人管理 5 款产品,80% 时间不写代码,而是花在 AI 智能体编排、自动化流程设计和产品策略上。核心实践包括:用 AI 写代码 → 用 AI 写测试 → 用 AI 做代码审查 → 用 AI 做部署 → 用 AI 做用户支持和数据分析,人类只负责定义"做什么"和"为什么"。这套方法论与"AI 将取代程序员"的焦虑叙事形成有趣张力——不是 AI 取代人,而是会使用 AI 的人取代不会使用 AI 的人,且一个人的产出可抵五个人的传统团队。"复利工程"的本质是将每一次 AI 辅助开发过程中积累的提示词、Skill、自动化脚本作为资产复用,产生类似复利的效率增长。
🔗 查看原文公众号数字生命卡兹克报道了一种新兴职业——"具身智能数据采集员",日薪 200 元起,工作内容是通过穿戴动捕设备、操作示教机械臂、或在摄像头前重复执行抓取/搬运/组装等动作来为机器人提供训练数据。这些数据被用于训练具身智能模型(如 RT-2、Octo、PI 等),使机器人学会在物理世界中操作物体。该职业的出现在中国制造业密集地区(东莞、深圳、苏州)尤为活跃,本质上是 AI 时代的"数据标注"——只不过标注对象从文本图像变成了三维物理动作。报道折射出一个重要趋势:具身智能的训练数据极度稀缺(远少于文本和图像数据),催生了全新的人力密集型数据产业,而这正是中国的制造业优势所在。
🔗 查看原文Qwen 3.6 27B 在 Hacker News 和开发者社区引发广泛讨论,被广泛认为是当前本地开发的最佳"甜点级"模型。该模型在 RTX 5090(Q6_K 量化)上可达 50 tokens/s,在 MacBook M5 Max 上可达 30 tokens/s,性能对标 GPT-4 级别,但完全离线运行。开发者社区反馈其在代码生成、代码审查、文档编写和复杂推理任务上的表现超越多数同类开源模型,且支持 256K 上下文窗口适合长文档处理。27B 参数量的精巧设计使其在消费级硬件上即可流畅运行,不需要昂贵的数据中心 GPU。Qwen 3.6 的成功也印证了阿里 Qwen 团队的开源策略——通过持续迭代中等规模的高质量模型,在"实用主义"维度上占据开源生态的核心位置。
🔗 查看原文Anthropic 应用 AI 工程师 Margot Van Laar 在 Code with Claude 系列中分享了提示词工程的实战方法论。核心观点颠覆了"提示词就是写好 prompt"的常见认知:实际工作中 80% 的时间在调试和维护已有的生产提示词,而非从零编写;评估(evaluation)是唯一严谨的改进方式——主观感受不可靠,必须建立系统化的测试用例集和自动化评分;提示词应像代码一样进行版本控制、A/B 测试和回滚;新模型升级后必须重新审查所有旧提示词,因为模型行为变化可能导致旧提示词的某些约束"过度拟合"。Margot 的方法论代表了提示词工程从"个人手艺"到"团队工程实践"的范式升级,对 AI 产品团队的生产流程具有直接指导价值。
🔗 查看原文