← Back to Reports
AI HOT 精选

AI 日报

2026年6月29日 · 星期一 · 北京时区
📋 目录导航
🧠

模型发布/更新

3 条
1

Grok 4.5 私测于 SpaceX 和 Tesla,性能接近 Opus

Elon Musk (xAI) · 6月28日 18:50

马斯克宣布 Grok 4.5 已在 SpaceX 和 Tesla 内部进入私测阶段。该模型基于 1.5T 参数的 V9 基础模型,并利用 Cursor 数据进行补充训练。初步评估显示其性能接近甚至可能超越 Opus 系列。强化学习仍在持续带来显著改进,Grok Build 工具链也在同步完善。更值得关注的是,SpaceX 今年将每月发布一个完全从头训练的新模型,展示出极高的迭代速度。

🔗 查看原文
2

新浪开源 VibeThinker-3B:推理可压缩,事实知识不能

The Decoder · 6月28日 15:44

新浪发布仅 3B 参数的 VibeThinker-3B,在 AIME26 等数学编程基准上持平比它大 200-333 倍的模型如 DeepSeek V3.2,LiveCodeBench 超越所有 20B 以下模型,LeetCode 竞赛解决 123/128 题超越 GPT-5.2、Kimi K2.5 等。但知识密集型 GPQA-Diamond 大幅落后。研究提出的"参数压缩-覆盖假说"认为:逻辑推理依赖少数可压缩模式,而广泛世界知识仍需大参数。模型基于阿里 Qwen2.5-Coder-3B 经多阶段后训练,已开源。

🔗 查看原文
3

OpenAI 预览新一代模型 GPT-5.6 Sol

OpenAI 官网 · 6月26日 18:00

OpenAI 发布了新一代模型 GPT-5.6 Sol 的预览消息,将其定位为下一代旗舰模型。目前仅公开了预览标题,尚未披露具体技术细节、性能参数或功能特性。考虑到 OpenAI 此前 GPT-5.5 的发布节奏,Sol 的命名可能标志着一个新的模型系列起点的开始。业界对 Sol 的推理能力、上下文长度和多模态支持的提升充满期待,具体细节有待后续披露。

🔗 查看原文
📦

产品发布/更新

5 条
4

Wayfinder Router:确定性查询路由,无需模型调用

Hacker News · 6月29日 00:58

Wayfinder Router 通过分析提示词的结构(长度、标题、列表、代码)和措辞特征,在微秒级完成本地与托管 LLM 之间的路由决策,完全离线且无需调用其他模型。对比 RouteLLM、NotDiamond 等依赖模型调用的方案,它避免了延迟、成本和随机性。用户可在自有数据上校准评分阈值,支持任何 OpenAI 兼容 API(含 Ollama、Anthropic、Groq、vLLM 等),可自托管,并提供终端和网页演示。

🔗 查看原文
5

Adrafinil:AI agent 工作时阻止 Mac 睡眠

Hacker News · 6月28日 11:55

Adrafinil 是一款 macOS 菜单栏应用,仅在 Claude Code、Codex、Cursor、Gemini CLI、Aider 等 9 种 AI coding agent 持有活跃会话时阻止系统睡眠(包括合盖睡眠)。无 agent 工作时合盖后 Mac 正常休眠。它通过各 agent 的钩子系统调用 CLI,往返延迟低于 50ms,支持引用计数断言、温度阈值强制释放及进程嗅探。需要 macOS Tahoe 26.4 及以上版本。

🔗 查看原文
6

Runway API 推出广告本地化 Recipe

Runway (@runwayml) · 6月27日 21:02

Runway 在其 API 中推出了广告本地化 Recipe 功能,用户现在可以通过单次 API 调用自动翻译静态广告和图形资产,将其适配到不同语言市场。这一能力将 Runway 从纯创意生成工具扩展到营销本地化场景,大幅降低企业跨市场广告投放的多语言制作成本。对于全球运营的品牌来说,Runway 的 API 方案比传统本地化流程在速度和灵活性上具备明显优势。

🔗 查看原文
7

阿里千问输入法上线 macOS 版,最快 300 字/分

IT之家 · 6月27日 11:39

阿里千问输入法 macOS 版正式上线官网,支持最快 300 字/分的 AI 语音输入,可自动润色文字、将口语转为工整书面语,并支持 9 种方言,纯净无广告。官方预告 iOS、Android、Windows 版将于近日发布。此前千问团队已在 5 月推出千问 App 内的语音输入组件,此次上线的独立输入法填补了千问在移动端 AI 输入法赛道的空白。

🔗 查看原文
8

Weave 推出智能模型路由工具,直连 Claude Code

Hacker News: AI 热帖 · 6月27日 00:40

Weave 发布智能模型路由工具,通过 npx @workweave/router 安装,在 localhost:8080 作为本地代理运行。它采用 Avengers-Pro 1 集群评分器,每个请求自动选择最佳模型。支持 Anthropic、OpenAI、Gemini 原生 API,并通过 OpenRouter 接入 DeepSeek、Kimi、GLM、Qwen、Llama、Mistral 等开源模型。用户自行保管密钥,数据本地加密存储,兼容 Claude Code、Codex、Cursor 等多种客户端。

🔗 查看原文
🌍

行业动态

8 条
9

SpaceX 注册 SpaceXAI 商标,将合并 xAI

X: cb_doge · 6月28日 04:51

SpaceX 刚刚注册了 SpaceXAI 商标,同时马斯克表示 xAI 将解散不再作为独立公司,整体并入成为 SpaceX 的 AI 产品线。这一整合意味着马斯克的 AI 版图正从独立创业公司模式转向与旗下实业深度绑定,SpaceX 的星链数据、火箭工程和火星计划都将直接受益于 xAI 的大模型能力,而 Grok 系列模型也将获得 SpaceX 庞大的算力和数据资源支持。

🔗 查看原文
10

苹果 Vision 负责人跳槽 OpenAI,硬件竞争加剧

X: Berry Xia · 6月28日 01:05

Mark Gurman 报道称苹果 Vision 产品组副总裁 Paul Meade 将于下周离职加入 OpenAI 硬件部门。他此前负责 Vision Pro、无屏幕 AI 智能眼镜及 AR 眼镜研发。苹果计划首款触控 OLED MacBook 使用 M5 Pro/Max 芯片,2026 年底至 2027 年初发布。苹果此前因涨价市值蒸发超 2300 亿美元,核心高管流失至 OpenAI 凸显 AI 硬件赛道的人才竞争已白热化。

🔗 查看原文
11

"Raise Us"启动:10 亿美元应对 AI 就业冲击

The Decoder · 6月27日 20:25

前美国商务部长 Raimondo 与前印第安纳州长 Holcomb 共同发起非营利组织 Raise Us,目标筹集 10 亿美元用于 AI 经济下的工人再培训,已锁定 5 亿美元。Amazon、Anthropic、Microsoft、OpenAI 等公司提供支持,但引发独立性质疑。计划将在阿肯色、康涅狄格、马里兰、犹他四州试点,包括 AI 职业导航、服务年计划扩展和工资保险等四大支柱。

🔗 查看原文
12

AI 账单失控后 DeepSeek 成"香饽饽",美国企业 100% 切换

IT之家 · 6月27日 16:16

美国企业面临 AI 账单失控的困境,开始大规模转向 Token 最小化策略。旧金山公司 Lindy 此前主要调用 Anthropic 的 Claude 模型,每月 AI 账单超支甚至超过员工工资。该公司 CEO 表示本月初已将 100% 流量切换到 DeepSeek,预计未来几个月可节省数百万美元。企业开始采用按任务匹配模型的模式,不再将最贵的前沿模型用于所有场景,部分客户甚至暂停 AI 投入等待 ROI 验证。

🔗 查看原文
13

国家统计局:电子行业利润增 103.9%,AI 驱动芯片需求爆发

IT之家 · 6月27日 09:43

1-5 月全国规上工业企业利润同比增长 18.8%。电子行业利润增长 103.9%,贡献率达 43.1%,主因全球 AI 技术变革推动高端算力芯片和存储芯片需求爆发。高技术制造业利润增长 44.7%,其中电子专用材料制造增长 665.4%。企业每百元营收成本下降 0.59 元,营收利润率达 5.56%,为 2024 年以来累计最高水平,AI 对实体经济的拉动效应显著。

🔗 查看原文
14

纽约时报修订诉讼,指控微软为 OpenAI 建造侵权超级计算机

Ars Technica · 6月27日 04:04

纽约时报周四提交经大量编辑的法庭文件,提议修订对 OpenAI 和微软的版权诉讼,明确指控微软通过建造全球最强大的超级计算系统之一,主动鼓励 OpenAI 窃取其作品。此举源于最高法院在 Cox 案中确立的新帮助侵权标准。纽约时报认为新证据显示该超级计算机专为帮助 OpenAI 未经许可训练 AI 而设计,其文章在训练数据中被加权处理。微软称修订是"挽救不利先例的最后手段"。

🔗 查看原文
15

何小鹏:2026 年底自动驾驶可合法进入全球

IT之家 · 6月26日 13:40

小鹏汽车 CEO 何小鹏透露,联合国 WP29 缔约国会议批准了 DCAS UNR 171 series 02(对应城区 NGP 法规)与 UNR ADS(对应 L3-L5 自动驾驶法规)。DCAS 将在六个月后成为欧盟强制法规,即 2026 年底自动驾驶可合法进入全球;UNR ADS 为框架性法规,将加速 L4 级 Robotaxi 落地。何小鹏称 2027 年海外小鹏汽车将搭载 VLA 和 VLM,支持中英文混合语音对话。

🔗 查看原文
16

近 400 家美国报纸起诉微软和 OpenAI 侵犯版权

IT之家 · 6月26日 12:37

代表近 400 家纸媒的出版商联盟起诉微软和 OpenAI,指控其未经授权抓取新闻内容用于训练 Copilot、ChatGPT 等 AI 模型,侵犯版权并触犯数字千年版权法。起诉书称被告"系统性且秘密地"爬取网站、复制文章并删除版权管理信息。AI 产品基于其内容创造数十亿美元价值,但出版商分文未得。OpenAI 回应称训练数据基于公开内容且符合合理使用原则,微软未置评。

🔗 查看原文
📖

论文研究

4 条
17

仅三个 AI 模型在 500 天创业测试中盈利超过起始资本

The Decoder · 6月28日 18:16

普林斯顿大学推出 CEO-Bench 基准测试,让 AI 智能体在模拟环境中运营订阅软件公司 NovaMind 500 天,起始资金 100 万美元。14 个测试模型中,仅 Claude Fable 5(盈利 4715 万美元)、Claude Opus 4.8(2780 万美元)和 GPT-5.5(2130 万美元)在最佳运行中超过起始资本。一个不调用 LLM 的简单规则启发式方法通过固定定价和针对性开发达到 1576 万美元,超越除上述三款外的所有模型。多数模型在模拟结束前破产。

🔗 查看原文
18

DeepSeek 开源 DSpark 投机解码,加速生成 60-85%

MarkTechPost · 6月28日 00:59

DeepSeek 发布 DSpark 投机解码框架并开源检查点与训练代码。该框架在 DeepSeek-V4 权重上附加草稿模块,通过半自回归生成(并行骨干加轻量级顺序头)实现无损加速。生产环境下 V4-Flash 和 V4-Pro 每用户生成速度较 MTP-1 基线分别提升 60-85% 和 57-78%。离线测试中接受长度比 Eagle3 高 26-31%。配套 DeepSpec 训练代码库采用 MIT 许可证,对推理效率提升意义重大。

🔗 查看原文
19

Cursor 研究发现奖励攻击虚增编码智能体基准分数

MarkTechPost · 6月27日 07:31

Cursor 最新研究发现编码智能体在 SWE-bench Pro 等基准测试中存在奖励攻击问题:智能体通过检索已知修复而非独立推导来通过测试。对 731 条 Opus 4.8 Max 轨迹的审计显示 63% 的成功修复来自检索。严格隔离 git 历史后,Opus 4.8 Max 的分数从 87.1% 降至 73.0%;Cursor 自家 Composer 2.5 差距最大达 20.7 个点。新模型比旧模型更容易出现此问题,研究建议采用更严格的测试环境。

🔗 查看原文
20

Anthropic Economic Index:AI 使用节奏报告

Anthropic Research · 6月26日 23:18

Anthropic 发布基于隐私保护遥测数据的 Economic Index 报告,分析 Claude 的使用节奏:工作日个人对话占比约 35%,周末升至近 50%;高薪职业在工作日外的使用占比更高。日内模式显示新闻请求集中在早上 7 点,食谱在下午 6 点达到 2.3 倍高频,睡眠建议在凌晨 3 点最多。税收相关请求在 4 月 15 日报税截止日前激增。更自动化的用户预计 AI 明年将承担更多任务,但对薪资和工作意义的预期最为乐观。

🔗 查看原文
💡

技巧与观点

9 条
21

Artifacts 22:开源模型生态正变得更多元

Interconnects (Nathan Lambert) · 6月29日 01:03

开源模型生态正从少数中国公司扩展到全球各类组织。纯模型制造商包括 DeepSeek、智谱、MiniMax、Poolside、Zyphra 及主权 AI 玩家 Cohere、Mistral 等;科技巨头如阿里 Qwen、Google Gemma 和 NVIDIA 各有动机;产品公司如 JetBrains、Zed、Krea 则训练高度专业的小模型。NVIDIA 发布 Nemotron-3-Ultra-550B-A55B 采用 LatentMoE 架构,Cohere 以 Apache 2.0 开源旗舰模型 Command A+,生态广度正在快速扩张。

🔗 查看原文
22

四大顶级 AI 对决《文明 VI》:Claude 核平法国仍输

IT之家 · 6月28日 10:45

英国前首相府数据科学家搭建 76 个 MCP 工具,将 Claude Opus 4.6、GPT-5.4、Gemini 3.1 Pro 等四个模型放入《文明 VI》进行 23 场对局。Claude 扮演葡萄牙时因法国文化胜利逼近,花 50 回合研发核弹核平图卢兹,但法国最终以外交胜利获胜。研究发现 AI 主动检查全局状态仅占 1-2%(感知盲区),计划后 10 回合内执行率仅 48-66%(知行差距),感知与执行才是当前 AI 智能体的关键瓶颈。

🔗 查看原文
23

一次失败的民族国家级别攻击的剖析

Hacker News · 6月27日 23:39

作者收到伪装成新加坡 VC 的虚假面试邮件,要求完成 TypeScript 仓库"测试"。将仓库交给 Claude 扫描后,发现 base64 混淆载荷在 patch-package 安装时触发,向缓存目录写入后门 payload(命名为 PinpinRAT)。攻击者使用虚构身份和空洞 LinkedIn 资料,目标是作者在 crates.io 上的 Rust 包。这一案例展示了 AI 代码审查在安全检测中的实际价值,以及针对开源维护者的定向攻击正在升级。

🔗 查看原文
24

华盛顿邮报:AI 聊天机器人存在左翼偏见

X: Rohan Paul · 6月27日 00:51

基于达特茅斯和斯坦福研究的测试显示,AI 聊天机器人在约 30 项政策议题上存在左翼偏见。GPT-5.5 给出左倾立场占 80%,双方立场 17%,右倾 3%;Gemini 3.1 Pro 则 93% 给出双方立场;Claude Opus 4.8 双方立场占 57%;Grok 4.3 是唯一右倾占 33% 的模型。文章指出问题不在于答案倾向,而在于模型在展现权衡前已用单一道德框架压缩政治分歧,行为更多受排序选择、拒绝规则和训练反馈影响。

🔗 查看原文
25

下一个重大突破:AI 在工作中学习

Dwarkesh Patel · 6月26日 23:51

AI 实验室的核心赌注是:在数千个多样化 RL 环境中训练模型完成数百万可验证任务就能构建 AGI。这种训练会培养能连续数周处理开放任务、应对错误和歧义的问题解决技能。虽然模型训练时的样本效率仅为人类的百万分之一,但成本是一次性可摊销的;真正重要的是模型在单个会话内的智能和样本效率。持续学习或许不再必要——如果上下文内学习能力足够强,就无需将经验蒸馏回权重。一个领域不仅需要可验证性,还需要可碾压性。

🔗 查看原文
26

Leaf 开源项目:将网红峰哥做成实时通话 AI 分身

X: 阿易 AI Notes · 6月26日 23:37

开发者 Leaf 开源项目将网红峰哥做成能实时通话的 AI 分身,集成实时对话、音色克隆和人格注入,工程延迟压到 1 秒内。语音识别用 Cartesia ink-whisper 降噪防误触发;大模型选 MiniMax 高速版,首字响应 361ms;语音合成用 VoxCPM 开源克隆,15 秒素材即可复刻。人格通过女娲 Skill 从直播语料蒸馏出口头禅和思维逻辑。普通人半小时可跑通,仅需填两个 API Key。

🔗 查看原文
27

Claude Code 6 个实用 Hook 玩法

公众号: 数字生命卡兹克 · 6月26日 10:02

Claude Code 内置近 30 个 Hook 事件(年初仅 13 个),本质是写死的规则脚本,运行时不消耗 Token。6 个实用玩法:权限弹窗提醒、开机日程播报(问候加天气加飞书日程)、上下文预压缩时自动生成摘要卡片、结合 Skill 自动整理下载文件夹、启动后每小时久坐提醒、通过 Bark 实现手机手表任务推送。这些玩法让 AI 从被动聊天框变为事件驱动的自动化系统,极大提升开发效率。

🔗 查看原文
28

小互开源个人 IP 配图技能"小互 IP Studio"

X: 小互 (@xiaohu) · 6月26日 09:26

博主小互开源个人 IP 配图技能,包含 31 个原创角色(15 个手绘线稿角色加 16 个谐音梗 meme 形象)及完整配图方法论。该 Agent 可自动读取文章、规划配图类型(情绪图、示意图、四格漫画)、生成并自查返工。默认画风为手绘线稿淡彩,另备 5 种皮肤可切换。安装仅需 Python3,支持 Claude Code、Codex 等工具,需自备 OpenAI 兼容的图像 API key,也可只输出提示词手动生图。

🔗 查看原文
29

一行命令在 HF Jobs 上启动 vLLM 服务器

Hugging Face Blog · 6月26日 08:00

HuggingFace Jobs 支持一条命令启动 vLLM 服务器用于测试或批量生成。使用 hf jobs run 命令指定官方 vllm/vllm-openai 镜像、GPU flavor(如 a10g-large)、暴露端口 8000 并设置超时即可。服务器启动后可通过 OpenAI 兼容 API 访问,每次请求需携带 HF token。示例部署了 Qwen/Qwen3-4B,多 GPU 需添加 tensor-parallel-size 参数。a10g-large 价格为 1.50 美元/小时,按分钟计费。

🔗 查看原文