← Back to Reports

AI 热报

模型 · 产品 · 行业 · 论文 · 观点
2026-06-30 · 共 22 条
📦

产品发布/更新

8 条
1

Claude apps gateway:企业自托管控制平面登陆 Bedrock 与 GCP

Claude Blog · 6月29日 21:22

Anthropic 推出 Claude apps gateway,是一款自托管控制平面,让企业能在 Amazon Bedrock 和 Google Cloud 上运行 Claude Code。架构上 gateway 作为单个无状态容器部署在 Linux 上,后端使用 PostgreSQL 存储配置。核心亮点是企业级 SSO 接入(OIDC 协议对接 Google Workspace、Microsoft Entra ID、Okta 等),集中式策略管理、角色权限控制、跨区域路由(含故障转移)以及按日/周/月、按组织/群组/用户的消费上限。遥测通过 OTLP 协议发送至用户配置的收集器;除非用户显式启用 Claude API,否则 gateway 不会向 Anthropic 发送推理流量或使用数据,隐私边界清晰。对于受合规约束的金融、医疗、政务客户而言,gateway 把 Claude Code 从一个云端 IDE 工具变成了一个可以内网部署、可审计、可治理的企业平台,与 Cursor、Cline 等客户端 IDE 形成上下游关系,Anthropic 在企业市场的护城河进一步加深。

🔗 查看原文
2

OpenClaw 推出原生 iOS / Android 应用:口袋里的智能体

X · OpenClaw · 6月29日 20:11

OpenClaw 正式登陆 iOS 与 Android,原生应用支持频道管理、任务追踪和实时回复推送,定位是"把智能体装进口袋"。配合云端 agent 调度,用户在手机上可以启动、监控、终止任务并接收结果通知,移动端不再是简单聊天窗口,而是任务编排入口。这与近期 Cursor for iOS、Anthropic Claude mobile 的移动化趋势一脉相承——智能体正在脱离桌面 IDE 形态,向随身设备扩张。对开发者生态而言,移动端渠道打开后 Agent 使用频次将显著上升,开发者需要重新思考任务时长、推送语义和离线能力的设计。

🔗 查看原文
3

Claude Opus 4.8 / Haiku 4.5 登陆 Microsoft Foundry,跑在 GB300 上

Claude Blog · 6月29日 18:22

Claude 在 Microsoft Foundry 正式可用,托管于 Azure 数据中心,运行在 NVIDIA GB300 GPU 上。首批提供 Claude Opus 4.8 和 Claude Haiku 4.5 两款模型,通过 Messages API 调用,支持提示缓存(prompt caching)和扩展思考(extended thinking)。用户可以指定推理处理位置(含美国数据区域),由 Anthropic 负责推理运营。Azure 用户可直接使用现有承诺消费额度结算。此举意味着 Anthropic 完成了"三大云全覆盖":AWS Bedrock、Google Cloud、Azure Foundry 同时在售,Claude 不再绑定单一云生态,对微软生态的 Azure OpenAI 用户来说多了一个新的高端模型选项,也加剧了 OpenAI 与 Anthropic 在云分发渠道上的正面竞争。

🔗 查看原文
4

Herdr:终端里的 AI 智能体多路复用器

GitHub · ogulcancelik · 6月29日

Herdr 是一个驻留在终端中的 AI 智能体多路复用器(agent multiplexer),允许用户在单一终端界面内管理和切换多个 AI 智能体会话。开发者日常工作常常需要同时与多个模型/会话交互(例如一边让模型 A 写代码、一边让模型 B 评审、一边让模型 C 翻译),传统做法是开多个 tab 或多个终端窗口,Herdr 把这些会话统一在一个 TUI 内通过快捷键切换,类似 tmux + Claude Code 的结合体。这类工具体现了 AI 编程工具从单会话到多会话编排的演进,也暗示着终端作为 AI 交互入口并未被 GUI 工具取代,反而被工具链改造得更强大。

🔗 查看原文
5

Cursor for iOS 公测:手机上也能指挥云端智能体写代码

Cursor Blog · 6月29日 12:00

Cursor 推出 iOS 原生公测版,所有付费计划可用。开发者可以在手机上启动始终在线的云端智能体,或远程操控电脑端智能体。支持语音输入、斜杠命令、选择前沿模型;智能体运行后,锁屏 Live Activities 和推送通知实时更新状态,完成或需要输入时提醒。云端智能体在隔离虚拟机中运行,可自动迭代生成合并就绪的 PR,并输出演示、截图和日志。本地与云端智能体支持双向切换,移动端 Composer 界面针对触屏优化。这把"vibe coding"从桌面延展到通勤、外出等碎片化场景,移动开发工作流被重新定义;不过云端沙箱的成本控制和长时间任务的电量消耗仍是未知数。

🔗 查看原文
6

小红书 RedKnot:把 KV Cache 按注意力头拆解,长文本推理提速 3.5×

小红书技术 · 6月29日 11:00

RedKnot 是小红书发布的推理引擎优化方案,将 KV Cache 沿注意力头(attention head)维度拆解,通过头分类稀疏(局部头占比 83.4%-96.8%)、稀疏 FFN 和 SegPagedAttention 三个机制统一算法与存储粒度。在 8 卡 H800 上,TTFT(首个 token 延迟)最高加速 1.6-3.54 倍,单卡并发提升 4.7-7.8 倍,预填充 FLOPs 削减 67%-79.5%。DeepSeek-V4-Flash 上 128K 上下文场景的 TTFOT 显著降低。RedKnot 的核心贡献是发现"并非所有注意力头都重要",通过结构性稀疏换来数量级的吞吐提升,这套思路与英伟达 TRT-LLM、SGLang 的 vLLM 优化路径形成差异化竞争,对国产推理框架生态是重要的工程参考。

🔗 查看原文
7

EverOS:开源 Markdown 优先智能体记忆运行时,支持混合检索与自进化技能

MarkTechPost · 6月29日

EverMind 推出开源智能体记忆运行时 EverOS(Apache 2.0 许可),它以可编辑的 Markdown 文件作为记忆主体,经 SQLite 管理状态、LanceDB 实现混合检索(BM25 关键词 + 向量搜索 + 标量过滤)。每个完成的任务记录为 Case,离线提炼为可复用的 Skill,使记忆随使用自我进化。v1.1.0 新增 Knowledge APIs(支持分类与话题搜索)和多人协作能力。EverOS 的设计哲学是把记忆"人类可读"作为一等公民——开发者可以直接 git diff 智能体的"记忆仓库",审查 AI 究竟记了什么,与 LangChain/LlamaIndex 等基于向量的"黑盒记忆"形成鲜明对比,特别适合需要审计、可解释记忆的企业部署。

🔗 查看原文
8

Wayfinder Router:确定性查询路由,本地/托管 LLM 自由调度

GitHub · itsthelore · 6月28日

Wayfinder Router 通过分析提示词的结构(长度、标题、列表、代码)和措辞(证明、数学、硬约束),在微秒级完成路由决策,完全离线且无需调用其他模型。默认仅使用结构特征,词汇线索因盲测未泛化而默认关闭。对比依赖模型调用的路由器(如 RouteLLM、NotDiamond),它避免了延迟、成本和随机性。用户可在自有数据上校准评分阈值,支持任何 OpenAI 兼容 API(含 Ollama 本地模型)。这种"零推理成本"的路由器适合把 70% 简单查询路由到本地 7B 模型、把 30% 复杂查询路由到云端 Opus 4.8 的混合架构,是企业降本的关键中间件。

🔗 查看原文
🧠

模型发布/更新

1 条
9

美团 LongCat Owl Alpha:1.6 万亿 MoE 登顶 OpenRouter,国产 ASIC 训练

X · Emad Mostaque · 6月29日

美团 LongCat 的 Owl Alpha 成为 OpenRouter 上最流行模型,累计消耗 10 万亿 tokens,性能对标 Gemini / Opus 4.6。该模型使用 1.6 万亿参数 MoE 架构,35 万亿 tokens 训练数据,完全在 5 万块国产 ASIC 上完成(这意味着不依赖英伟达 GPU)。据官方推文,Owl Alpha 上线后每日调用量全球 Top 3,在 Hermes Agent 排名第一,Claude Code 排名第二,OpenClaw 排名第三。美团作为外卖公司跨界做基础模型,且做到 OpenRouter 第一,是 2026 年中国 AI 领域最值得关注的"异类"。国产 ASIC 训练成功意味着中美 AI 算力脱钩有了真正的可行替代方案,不再是 PPT 概念;这也预示着 MoE + 稀疏激活 + 国产算力的组合可能成为主流路线。

🔗 查看原文
🌐

行业动态

5 条
10

Nvidia Rubin Ultra 取消:制造执行问题导致尺寸/性能减半

X · SemiAnalysis · 6月29日

在 GTC 2026 宣布 Rubin Ultra 仅 3 个月后,原 4-die Rubin Ultra 因制造执行问题被取消,新的"Rubin Ultra"尺寸减半,实际性能约为原版的一半。这是英伟达近年来罕见的旗舰产品回炉事件,揭示出 4-die 封装在良率和频率上的工程挑战远超预期。短期看,市场担忧英伟达在 2027-2028 年 AI 加速器路线图的交付能力,AMD MI400 系列和谷歌 TPU v7 可能获得更长的产品窗口期;长期看,Nvidia 单芯片性能增长曲线出现折点,将进一步推升 hyperscaler 自研 ASIC(TPU、Trainium、MTIA)的紧迫感,半导体格局正在从"一家独大"向"多极竞速"演进。

🔗 查看原文
11

美军 AI 选目标首日误炸伊朗学校,Claude 嵌入 Palantir Maven 系统

The Decoder · 6月29日

美军在打击伊朗时首次大规模使用 AI 选择目标,Anthropic Claude 模型嵌入 Palantir 的 Maven Smart System,首日建议约 1000 个目标。然而对一所学校的导弹袭击导致约 120 名儿童死亡,调查发现情报分析师早在 2019 年就通过数字工具标记该地点已变为小学,但该工具未连接军方官方目标数据库 MIDB,信息从未送达指挥官。MIDB 建于 1980 年代,依赖手动输入,替代系统 MAR将需要数年才能上线。此事件是 AI 进入致命决策系统的最严重一次"in the wild"失败,引发 Anthropic 内部巨大伦理争议:一方面 Claude 被宣传为"constitutional AI",另一方面被嵌入武器系统用于目标推荐;Anthropic 此前的"不用于自主武器"承诺面临拷问,未来军用 AI 供应商的责任边界、AI 建议 vs 人类决策的权责划分,将成为全球 AI 治理的核心议题。

🔗 查看原文
12

国务院印发《教育发展"十五五"规划》:推进 AI 全学段教育

IT 之家 · 6月29日

国务院印发《教育发展"十五五"规划》,要求推进人工智能全学段教育,提升学生人工智能素养及提出问题、解决问题的能力。规划明确完善科学教育体系,强化科技教育与人文教育协同,加强青少年科学素养、批判性思维和创新能力培养。同时实施学生体质强健计划、心理健康促进行动,加大拔尖创新人才自主培养力度,推动学科交叉融合,扩大优质本科招生规模。目标到 2030 年高质量教育体系基本建成。这意味着 AI 素养将从"大学选修课"下沉到义务教育阶段,与英美"AI literacy from K-12"路线接轨,将催生海量 AI 教学资源、青少年编程/AI 平台、师范培训需求,AI+ 教育赛道在 2026-2030 年将享受政策红利。

🔗 查看原文
13

三星+SK 海力士 5900 亿美元扩产:AI 需求推升内存价格数倍

The Decoder · 6月29日

在韩国政府支持下,三星和 SK 海力士计划投入 5900 亿美元扩大芯片产能,包括 800 万亿韩元新建四座工厂、81 万亿韩元建封装中心,以及未来 15 年 30 万亿韩元用于研发下一代芯片。AI 数据中心需求是主要驱动力。Jefferies 预测,2026 年 Q3 内存价格将上涨 40%-50%,Q4 再涨 30%-40%,2027 年继续上涨 40%-45%,到 2028 年新产能仅上线 15%-20% 才可能缓解。两家公司合计控制全球近 90% 的 HBM 内存市场。这轮"内存超级周期"将持续至少 18-24 个月,远超 2017-2018 年的传统 DRAM 周期,AI 服务器对 HBM3E/HBM4 的需求曲线远比 PC/手机刚性。下游云厂商和 AI 创业公司将被迫接受内存涨价,毛利率承压。

🔗 查看原文
14

SK 集团 1000 万亿韩元 AI 数据中心蓝图:到 2035 年建 15GW

IT 之家 · 6月29日

SK 集团会长崔泰源 6 月 29 日宣布,计划到 2035 年建成 15GW AI 数据中心容量,作为韩国国家级基础设施和实体 AI 时代核心底座。项目总投资 1000 万亿韩元(约 4.4 万亿元人民币),未来 10 年保持年均 100 万亿韩元以上国内投资,旨在实现从出口传统商品向智能服务的转变,构建韩国智能市场。此外 SK 海力士将向韩国西南部投资 400 万亿韩元,半导体供应项目总投资达同等量级。这是韩国版"AI 曼哈顿计划",由国家资本 + 财阀协同驱动,与中国"东数西算"、美国"Stargate"形成对比。15GW 容量相当于 15 个核电机组的持续供电,对电力基础设施、冷却方案、绿电交易等环节产生巨大拉动。

🔗 查看原文
📖

论文研究

3 条
15

Meta Brain2Qwerty v2:非侵入式脑电信号实时解码完整句子

X · AI at Meta · 6月29日

Meta 公布 Brain2Qwerty v2,这是非侵入式脑电信号(EEG)解码研究的最新里程碑。基于当天发表在《Nature》的 v1,v2 是性能最高的端到端管道,能从原始脑信号实时解码句子。它从字符级性能提升至解码单词和语义,提高整体沟通准确性。该研究有望帮助数百万因脑损伤或疾病(ALS、中风后遗症、闭锁综合征等)无法沟通的人群。BCI(脑机接口)赛道近年来形成两条路线:侵入式(Neuralink、Synchron)精度高但有手术风险;非侵入式精度低但安全性好。Meta 走的是后者,通过深度学习大幅提升 EEG 解码精度,如果精度能再上一个台阶,"无声交流"将不再依赖昂贵的植入式设备。

🔗 查看原文
16

Claude Code 打开 GitHub 仓库即执行隐藏恶意代码:0DIN 披露

The Decoder · 6月29日

安全研究人员在 Mozilla 的 GenAI 漏洞赏金平台 0DIN 发现新攻击向量:一个看似正常的 GitHub 仓库包含 setup 脚本,该脚本运行时从 DNS TXT 记录拉取命令并执行,恶意代码从未存在于仓库中,对扫描器、代码审查和 AI 智能体不可见。开发者使用 Claude Code 等 AI 编码工具打开该仓库时,Claude Code 在设置过程中遇到常规错误消息后自动运行该脚本,打开者获得完全控制权。这种 "prompt-injection through DNS" 攻击绕过了所有传统供应链安全机制,特别针对 AI 智能体"乐于跑 setup 脚本"的行为模式。Anthropic 必须在 Claude Code 中加入"危险操作前必须人类确认"的强制弹窗,同时所有 AI 编程工具(Cursor、Cline、Aider)都需要引入沙箱隔离机制,这是 AI Coding 时代最严重的安全范式转变。

🔗 查看原文
17

OpenAI 报告:绘制欧洲 AI 劳动力转型版图

OpenAI · 6月29日

OpenAI 发布新报告,分析 AI 对欧盟就业的影响,划定哪些职业面临自动化、增长或工作流程变化。这与 OpenAI 此前对美国市场的同类报告形成姊妹篇,但欧洲语境下特别强调 GDPR、AI Act 对劳动力的影响。报告大概率会指出客服、基础编程、行政文书等岗位面临替代风险,而 AI 工程师、AI 训练师、提示工程师等新岗位增长最快,且薪资溢价显著。欧盟政策制定者正在起草 AI 劳动力过渡期政策(如再培训补贴、转型期社会安全网),OpenAI 这份报告将以"行业数据"的形式影响欧盟未来 3 年的就业政策走向。

🔗 查看原文
💡

技巧与观点

5 条
18

Qwen 3.6 27B:本地开发的"甜点级"模型

Quesma Blog · 6月29日

Qwen 3.6 27B 是一款密集参数本地大语言模型,原生支持 256k 上下文。在 MacBook Max M5 上运行 llama.cpp Q8_0 量化版(含多 token 预测)可达 30 tokens/s;用户反馈在 RTX 5090 上 Q6_K 量化可达 50 tokens/s。它可通过单个提示完成创意诗歌、用 pnpm 生成六边形扫雷游戏等任务,作者称其为首个真正具备通用智能的本地模型。27B 级别在 2026 年已成为本地 LLM 的"性能/硬件甜点"——足够强大可以胜任 80% 通用任务,又能在消费级 GPU 甚至高端 MacBook 上流畅运行。配合 Cursor/Cline/Aider 等 AI 编程工具,可以完全离线运行,配合本地代码库实现隐私敏感的代码工作流。

🔗 查看原文
19

Anthropic 工程师实战:调试生产提示词为主,评估是唯一严谨方式

X · Berry Xia · 6月29日

Anthropic 应用 AI 工程师 Margot Van Laar 在 Code with Claude 分享提示词工程实战,核心观点:大部分时间在调试和维护已有生产提示词,而非从零编写。两个场景案例——客服机器人维护中,用 XML 标签结构化清理,移除旧模型遗留的"禁止列表"指令(新模型会过度拟合),精确计算应调用工具,转人工决策需明确代价与收益;零售排班 Agent 从零构建时,拆成"生成-评估-修复"三个简单提示词串联。这与"提示词即代码"的工程哲学呼应——提示词需要版本控制、A/B 测试、回滚机制。Anthropic 把 prompt engineering 从"艺术"推向"工程",为整个行业树立了 production prompt 的最佳实践。

🔗 查看原文
20

Vibe Coding 必备 Prompt:第一性原理 + 对抗式审查

公众号 · 数字生命卡兹克 · 6月29日

作者分享 Vibe Coding 中两个关键 Prompt:一是"从第一性原理出发",强制 AI 跳出类比推理,从基本事实重新推导本质,曾帮作者发现 AIHOT 抓取海外信源的底层流量路由隐患并彻底重构;二是"对抗式审查",让 AI 站在恶意用户角度攻防式审查代码,检出 OOM 死循环、未来时间污染等手工难发现的 BUG。两个 Prompt 形成生成与验证闭环,使纯 Vibe Coding 项目 AIHOT 最近一周请求量超千万次。Vibe Coding 的最大风险是"AI 一本正经写出能跑但有隐患的代码",引入对抗式审查是降低风险的关键工程实践。这套方法论适合一人公司或小团队快速交付 MVP,是 2026 年最实用的 AI 工程范式之一。

🔗 查看原文
21

Anthropic 算力支出突破:每位工程师年耗 51.5 万美元

Tom Tunguz · 6月29日

Anthropic 在算力上的支出达到每位工程师每年 51.5 万美元,是其完全薪资(22.4 万美元)的 2.3 倍。相比之下,顶尖 1% 软件公司的算力支出为 8.9 万美元,中位数仅为 1.37 万美元。报告给出三个 2029 年情景预测了这一差距的缩小路径——模型推理成本下降 5-10 倍 / 模型架构优化使单 token 计算成本下降 / 端侧推理承担更多负载。这揭示了 AI 时代软件公司的成本结构剧变:传统 SaaS 公司人力成本占 70%+,AI Native 公司算力成本可能反超人力。当算力支出超过人力支出,意味着商业模式的护城河从"人才密度"转向"模型+算力供应链",VC 估值模型也需要重新校准 LTV/CAC。

🔗 查看原文
22

开源模型生态扩张:Zyphra、Cohere、Poolside 拓宽版图

Nathan Lambert · 6月28日

开源模型生态正变得更多元,参与者从少数中国公司扩展到全球各类组织。纯模型制造商包括 DeepSeek、智谱、MiniMax、Poolside、Arcee、Zyphra 及主权 AI 玩家 Cohere、Sovereign、Mistral、Trillion Labs;科技巨头如阿里 Qwen、Google Gemma 和 NVIDIA 各有不同动机;产品公司如 JetBrains、Zed、Krea 也开始发模型。这与两年前"中国厂商独霸开源"形成对比,主权 AI(欧洲、中东、印度)和垂直产品公司正在涌入,生态从"几家独大"走向"长尾多元"。对开发者意味着更多高质量小众模型可选(编程专用、长上下文专用、多模态专用),对企业意味着采购谈判筹码增加。

🔗 查看原文