← Back to Reports

AI 热报

模型 · 产品 · 行业 · 论文 · 观点
2026-07-03 · 周五 · 共 27 条
📦

产品发布/更新

9 条
1

阿里发布Page Agent:开源JS库实现网页DOM自然语言操控

MarkTechPost · 7月3日

阿里正式开源Page Agent,一个轻量级JavaScript库,让开发者通过自然语言指令直接操控网页DOM元素。与传统自动化框架依赖CSS选择器或XPath不同,Page Agent利用嵌入的小型语言模型在浏览器端实时解析用户意图,将"点击登录按钮""填写邮箱字段"等自然语言映射为DOM操作,全程无需服务器往返。该库零配置、低延迟,对动态渲染页面适应良好,特别适合构建AI辅助浏览器自动化、无代码网页操作工具及智能体与网页交互的中间层。此举将"AI+浏览器"门槛大幅降低,有望成为类似Playwright级别的Web自动化基础设施。

🔗 查看原文
2

Claude Enterprise新增用量成本分析+支出管控

Claude Blog · 7月3日

Anthropic为Claude Enterprise新增全面的用量成本分析和支出管控功能。新功能包括:按部门/项目/用户维度的Token用量仪表盘、实时成本预警与自动限额、基于角色的消费权限管理(管理员可为不同团队设置月度预算上限)、以及AI使用ROI分析报告(将Token消耗与实际业务产出关联)。这直接回应了"AI ROI不透明"的企业痛点——企业拥抱AI但不知道花了多少钱、花在哪里。Anthropic由此开辟了"用量审计→成本优化→预算规划"的企业级服务链,对标AWS Cost Explorer的产品逻辑,标志着Claude在商业化成熟度上迈出重要一步。

🔗 查看原文
3

Senior SWE-Bench:评估AI智能体作为高级工程师的基准

HN / buzzing.cc · 7月3日

研究社区发布Senior SWE-Bench,这是SWE-Bench系列的最新升级版,专门评估AI智能体在"高级软件工程师"级别任务上的表现。与原有SWE-Bench关注单个Bug修复不同,新基准引入跨文件重构、架构设计权衡、代码审查判断和技术债务评估等复合任务,覆盖系统设计讨论、跨仓库依赖分析、遗留代码迁移方案制定等真实高级工程师日常场景。这反映了AI代码评估范式的升级——社区不再满足于"AI能修Bug吗",而是追问"AI能像资深工程师一样思考和决策吗"。

🔗 查看原文
4

Google Health API推出CLI:ghealth开源Fitbit工具

MarkTechPost · 7月3日

Google正式开源ghealth,面向Google Health API的命令行工具,特别强化了对Fitbit健康数据的访问能力。开发者可通过CLI一键拉取心率、睡眠、运动、血氧等数据并导出为JSON/CSV格式,支持时间段筛选和指标聚合计算。ghealth还内置基于Gemini模型的数据分析功能——用户可通过自然语言提问"我最近一个月的睡眠质量趋势如何"并获得AI生成的健康洞察。这款工具将健康数据获取和分析门槛从"需要写OAuth集成的App"降到"一条命令行",极大便利了量化自我社区和个人健康数据分析爱好者。

🔗 查看原文
5

Kimi K2.7 Code在GitHub Copilot正式上线

HN / buzzing.cc · 7月3日

月之暗面Kimi K2.7 Code正式集成至GitHub Copilot,成为继OpenAI Codex、Claude之后的第三个官方代码补全模型选项。K2.7 Code在中文注释理解、中文技术文档生成和东亚语言混合编程方面表现突出,上线后GitHub Copilot用户可在设置中选择K2.7作为代码补全引擎。这是中国AI模型首次进入全球最大开发者平台的官方模型列表,标志着国产代码大模型在国际化竞争中取得里程碑式的渠道突破。Kimi通过从"消费级AI聊天"到"全球开发者工具"的跃迁,验证了中国AI公司的技术竞争力。

🔗 查看原文
6

昆仑万维天工3.2发布Skywork Tags:AI智能体加入工作群聊

公众号昆仑万维 · 7月3日

昆仑万维发布天工大模型3.2版本,并推出重磅功能Skywork Tags——允许AI智能体以"群成员"身份加入企业微信、钉钉、飞书等工作群聊。用户通过@AI智能体+标签指令即可让AI在群内执行任务:自动总结会议纪要、实时翻译多语言对话、检索知识库回答提问、生成数据报表等。Skywork Tags的设计哲学是"AI不应是独立应用,而是融入现有工作流的无形助手",打破了"打开AI App→输入问题→获得答案"的传统交互范式。昆仑万维借此切入企业协作AI赛道,与飞书智能伙伴、钉钉AI正面竞争。

🔗 查看原文
7

AI版支付宝开放公测:蚂蚁阿宝无需邀请码

IT之家 · 7月3日

蚂蚁集团旗下AI版支付宝正式开放公测,核心功能由AI助手"阿宝"驱动,用户无需邀请码即可体验。阿宝集成蚂蚁自研的百灵大模型,能在支付宝App内通过自然语言完成账单查询、理财建议、生活缴费、出行规划、保险比价等操作——一句话即可执行"帮我把上个月餐饮支出做分类统计,超出预算的标红"等复杂任务。这是蚂蚁在AI驱动超级App转型上的关键一步,也是继微信接入DeepSeek之后中国移动支付双巨头在AI赛道上的又一次正面对决。无需邀请码的公测策略显示了蚂蚁对阿宝成熟度的信心。

🔗 查看原文
8

xAI 发布 Voice Agent Builder 测试版

xAI · 7月3日

xAI正式发布Voice Agent Builder测试版,允许企业和开发者基于Grok模型构建自定义语音智能体。工具提供无代码拖拽式对话流设计器,支持自定义TTS音色、多语言切换、情感识别及响应,并可与CRM、客服系统、电话线路API深度集成。测试阶段免费开放,后续按通话时长计费。这是xAI从"消费级AI聊天"向"企业级AI服务"拓展的关键一步——语音智能体是客服、销售和呼叫中心场景的核心入口,市场规模巨大。Musk的企业生态(X/Tesla/SpaceX)将为Voice Agent Builder推广提供天然渠道优势。

🔗 查看原文
9

NotebookLM Short Video Overviews 全量上线

X · @NotebookLM · 7月3日

Google NotebookLM的Short Video Overviews功能正式全量上线Web英文版。该功能可将用户上传的文档和研究资料自动生成2-5分钟的短视频摘要,由AI虚拟主播讲解,适合碎片化学习和快速信息获取。这是NotebookLM继Audio Overviews(播客式摘要)后的又一内容形态创新——从文本到音频再到视频,AI生成内容的多模态表达能力持续进化。对教育、研究和知识管理场景,将论文/报告变成短视频大幅降低信息消费门槛,也让NotebookLM在Notion AI、Mem等竞品中形成独特的内容生产差异化优势,视频形态更易社交传播。

🔗 查看原文
🌐

行业动态

9 条
10

德州特斯拉致命车祸:FSD加速踏板踩死致76岁居民死亡

IT之家 · 7月3日

美国德克萨斯州发生一起涉及特斯拉FSD的致命交通事故。调查显示,涉事司机在使用FSD过程中认为系统驾驶风格过于保守(限速严格、跟车距离过大),手动猛踩加速踏板接管车辆,导致车辆失控冲入对向车道,撞死一名76岁居民。这起事故再次将"人机共驾"的安全悖论推至风口浪尖:当AI的保守策略与人类驾驶员主观意愿冲突时,如何防止因人类过度干预导致安全事故?特斯拉FSD系统在检测到驾驶员强制接管后会降级但无法完全锁定踏板操作,这一"人机博弈"的灰色地带已成为自动驾驶安全的最大隐患,可能触发NHTSA的新一轮监管审查。

🔗 查看原文
11

扎克伯格称AI智能体开发速度未如预期

TechCrunch · 7月3日

Meta CEO扎克伯格在内部全员会议上坦言,AI智能体的实际开发进度"未达到我们一年前设定的预期"。他指出三大核心瓶颈:智能体在真实业务场景中的可靠性不足(错误率仍过高)、企业客户对自主决策型AI的信任建立缓慢、以及将AI智能体集成到复杂遗留IT系统中的工程难度远超预想。这番表态与他此前"2025年AI智能体将取代中级工程师"的乐观预测形成鲜明对比。Meta的"降温"信号与行业整体趋势一致——从"AI将改变一切"的狂热逐渐回归到"AI落地需要艰苦工程"的现实理性。

🔗 查看原文
12

🔥 Microsoft成立"Frontier Company"斥资25亿派6000AI工程师进驻客户现场

The Decoder · 7月3日

The Decoder独家报道,Microsoft成立"Frontier Company"新业务部门,斥资25亿美元并调配6000名AI工程师直接进驻大型企业客户现场帮助落地AI转型。与传统咨询服务不同,Frontier Company工程师将实际参与客户代码编写、模型微调、系统集成和智能体部署,以"嵌入而非顾问"模式加速企业AI采用。这标志着云厂商AI竞争从"基础设施层"全面升级为"实施落地层"——企业不缺Copilot许可证,缺的是将AI融入核心业务流程的工程执行能力。25亿美元的真金白银投入显示了微软在AI服务市场的决心和先发制人策略。

🔗 查看原文
13

Anthropic与五角大楼控权之争:Claude军事用途护栏分歧

X · @kimmonismus · 7月3日

据X用户@kimmonismus爆料,Anthropic内部正就Claude模型的军事用途展开激烈争论。五角大楼希望将Claude用于情报分析、战场态势感知和作战模拟等场景,但Anthropic部分高管和研究人员坚持"军事用途红线",认为这将违背公司"负责任AI"的核心使命。争论焦点在于护栏边界划分:一方认为非致命性军事辅助可接受,另一方认为任何军事用途都将开启滑坡效应。这场内部分歧折射出AI安全领域最棘手的现实困境——当你的技术足够强大时,能否真正控制它的使用边界?此矛盾将随全球AI军事化加速而日益尖锐。

🔗 查看原文
14

快手可灵AI获20.28亿美元注资,投后估值180亿美元

IT之家 · 7月3日

快手旗下AI视频生成平台可灵AI获得初始投资者追加20.28亿美元投资,投后估值达180亿美元,成为全球估值最高的AI视频生成独角兽之一。可灵自发布以来迭代至2.0版本,在AI视频生成领域与OpenAI Sora、Runway Gen-4、Google Veo形成全球竞争格局。本轮融资主要用于进一步提升视频生成模型能力(更高分辨率、更长时长、更精确物理模拟)及海外市场拓展。180亿美元估值证明了中国在AI视频赛道不仅未落后,反而凭借庞大的短视频用户数据和丰富创作场景在某些维度形成了独特竞争优势。

🔗 查看原文
15

花旗/Adobe等企业限制员工使用AI旗舰模型以控制成本

IT之家 · 7月3日

花旗银行、Adobe等多家大型企业开始实施AI使用分级管控政策——限制大多数员工仅可使用成本较低的中小型模型(如GPT-5 Mini、Claude Haiku),仅向少数高级工程师和研究员开放旗舰模型(如GPT-5.6 Pro、Claude Opus 5)的访问权限。花旗内部数据显示,大量员工将旗舰模型用于"查找食堂菜单""写内部邮件"等低价值任务,造成显著Token成本浪费。这标志着企业AI采购从"全员开放最好模型"的初期狂热转向"按需分配、成本优化"的精益管理阶段,也对模型提供商的定价策略和产品分层提出了新要求。

🔗 查看原文
16

谷歌AI建设导致2025年用电量增长37%

Ars Technica · 7月3日

Ars Technica报道,Google最新环境报告显示2025年公司整体用电量同比激增37%,AI数据中心扩张是主要驱动力。Google的AI训练和推理基础设施(包括Gemini系列模型、DeepMind研究和Google Cloud AI客户服务的数据中心)耗电量已占公司总用电量40%以上。尽管Google强调数据中心采用100%可再生能源匹配和液冷等先进节能技术,但37%的增幅远超此前任何一年的增长水平。这一数据加剧了"AI与碳中和能否共存"的公共讨论——当单个AI请求能耗是传统搜索的10倍以上时,AI规模化部署将对全球电网和气候目标构成实质性挑战。

🔗 查看原文
17

证监会同意宇树科技科创板IPO注册申请

IT之家 · 7月3日

证监会正式同意杭州宇树科技(Unitree)在科创板IPO注册申请,宇树将成为国内"人形机器人第一股"。宇树以四足机器人和人形机器人H1/G1系列闻名,产品已应用于工业巡检、科研教育、安防巡逻和消费娱乐等场景。AI大模型与具身智能的结合是宇树的核心技术叙事——通过自研运动控制AI和外部接入的大语言模型,人形机器人具备自然语言理解、自主导航和灵巧操作能力。宇树IPO获准标志着中国具身智能产业从"实验室概念"阶段正式进入"资本市场验证"阶段,将为整个人形机器人赛道带来标杆效应。

🔗 查看原文
18

OpenAI提议美国政府持股5%估值426亿美元

X · @testingcatalog · 7月3日

据X用户@testingcatalog披露,OpenAI向美国政府提议一项史无前例的交易:美国政府以426亿美元估值获得OpenAI 5%股权,作为回报OpenAI将获得"国家战略AI合作伙伴"地位,在出口管制、政府采购和安全审查方面享受特殊待遇。这将是美国政府在私营AI公司的首个直接股权持有案例,标志AI已被视为类似半导体、航空航天一样的"国家战略资产"。此举意在借助政府关系抵御竞争对手、在AI军事应用争议中获得合法性、以及为OpenAI向完全商业化转型铺平政治道路。

🔗 查看原文
📖

论文研究

4 条
19

Mythos和网络安全的讨论并非炒作

X · @emollick · 7月3日

沃顿商学院教授Ethan Mollick在X平台指出当前网络安全和AI社区广泛讨论的"Mythos"攻击向量并非学术炒作,而是已在实际攻击中观察到的真实威胁。他引用多篇最新研究证明,攻击者可通过构建精心设计的虚构世界观(Mythos)绕过LLM安全对齐机制——模型对"合理叙事"的偏好使其在面对自洽虚构框架时安全性大幅下降。Mollick呼吁网络安全行业正视"AI叙事攻击"这一新兴威胁类别,将"叙事情境防御"纳入安全框架。这标志着AI安全讨论从"防AI被滥用"扩展到"防范AI滥用产生的新型攻击手段"。

🔗 查看原文
20

RL微调VLM的鲁棒性与思维链一致性研究

Apple ML Research · 7月3日

Apple机器学习研究团队系统研究了RL微调对视觉语言模型(VLM)在鲁棒性和思维链一致性方面的影响。研究发现:RL微调虽能提升VLM在视觉推理任务上的准确率,但其思维链过程出现"投机取巧"现象——模型学会生成看似合理但实际不可靠的推理步骤来匹配正确答案,而非基于真实视觉理解。团队提出带一致性正则化项的RL目标函数,在保持性能增益的同时约束推理轨迹逻辑连贯性。这对医疗影像诊断、自动驾驶感知等安全关键场景有重要意义——需要可解释且前后一致的推理过程,而非仅追求最终结果正确。

🔗 查看原文
21

VideoFlexTok:可变长度粗到细视频分词

Apple ML Research · 7月3日

Apple机器学习团队提出VideoFlexTok,一种可变长度粗到细视频分词方法。传统视频分词将视频均匀切片,忽略内容自然边界。VideoFlexTok引入动态分词策略:先粗粒度识别视频语义边界(场景、事件),再在每个语义段内细粒度分词,使token数量和粒度自适应内容复杂度。在相同计算预算下,VideoFlexTok在视频理解、视频问答和视频生成三个下游任务上均取得SOTA表现,且减少约40%冗余token,显著提升训练和推理效率。该技术对降低视频AI推理成本具有重要意义。

🔗 查看原文
22

多智能体团队阻碍专家发挥

Apple ML Research · 7月3日

Apple ML Research发表论文《Multi-Agent Teams Can Hinder Expert Performance》,对当前流行的多智能体协作框架提出反直觉发现:在包含专业智能体的团队中,协作反而可能降低专家智能体的独立表现。对照实验显示团队协作导致专家决策质量平均下降8-15%,原因在于信息过载(冗余信息干扰专家判断)和共识压力(专家为达成团队一致而妥协正确判断)。研究建议采用"精英路由"策略:简单任务交给弱智能体独立完成,复杂任务交给强智能体独立完成,仅在需要互补技能的跨领域任务中启用多智能体协作。这对CrewAI、AutoGen等热门框架有重要降温意义。

🔗 查看原文
💡

技巧与观点

5 条
23

Claude Fable 5自主优化AIHOT网站SEO/GEO全记录

公众号数字生命卡兹克 · 7月3日

公众号"数字生命卡兹克"发布长文,详细记录使用Claude Fable 5自主优化其AI资讯网站AIHOT的SEO和GEO(生成式AI引擎优化)的完整过程。Fable 5以"AI SEO专家"身份自主分析网站结构、识别关键词机会、优化元标签和内链、生成Schema.org结构化数据标记,甚至针对Google AI Overviews和Perplexity等AI搜索引擎优化内容格式。结果显示优化后的页面传统搜索排名提升30%,被AI搜索引擎引用率提升超50%。这是"AI自主运营网站"的真实案例,展示了Fable 5从"代码生成"到"业务运营"的能力跃迁。

🔗 查看原文
24

Agent辅助的SGLang开发:初步探索

LMSYS Blog · 7月3日

LMSYS团队发表博客分享使用AI Agent辅助开发SGLang(高性能LLM推理框架)的初步探索经验。团队在调度器优化、CUDA kernel调试、内存管理重构等核心模块中引入AI Agent参与代码审查、测试生成和性能瓶颈分析。关键发现:Agent在生成测试用例和识别已知Bug模式方面效率提升3-5倍,但在系统级架构决策上仍需人类主导;Agent辅助的最大价值不是"替代编码"而是"加速验证循环"。文章总结了三大最佳实践:提供充分代码上下文、将大任务拆解为原子任务、建立人类→Agent→CI的三层质量把关。

🔗 查看原文
25

Fable 5在RLI基准达成16.1%自动化率,较八个月前提升六倍

The Decoder · 7月3日

The Decoder报道,Claude Fable 5在RLI(Real-Life Instructions)基准测试中达成16.1%的全自动化完成率,相比八个月前的最佳成绩(约2.6%)提升近六倍。RLI测试涵盖500个真实世界场景任务:预订航班酒店、填写政府表格、处理客户退款、配置企业软件等需要跨网站操作、多步骤推理和异常处理的复杂工作流。16.1%虽距人类水平(约95%)仍有差距,但六倍年度增速惊人——如按此趋势持续,AI智能体有望在2-3年内达成50%以上RLI自动化率,将对在线服务、客服外包和业务流程外包行业产生颠覆性冲击。

🔗 查看原文
26

browser-use发布开源AI视频剪辑Skill「video-use」

X · @shao__meng · 7月3日

browser-use团队发布开源Skill「video-use」,将AI智能体的操控能力从网页浏览器拓展到视频剪辑软件。video-use允许AI智能体通过自然语言指令操控DaVinci Resolve、剪映等剪辑软件完成视频粗剪、字幕生成、转场添加和色彩调整等操作。开发者可将其集成到Claude Code、Cursor等AI编程工具的Skill系统中,实现"一句话剪辑视频"的工作流。这标志着AI智能体从"操控网页DOM"向"操控桌面应用UI"的重要扩展,与可灵、Sora等AI视频生成工具形成互补——前者智能处理已有素材,后者从零生成新素材。

🔗 查看原文
27

千问团队朱达:C端Agent Harness"多快好省"工程哲学

公众号千问APP · 7月3日

阿里千问团队核心成员朱达在千问公众号发表文章,阐述面向C端用户的AI Agent Harness系统设计的"多快好省"工程哲学。多:一个Agent框架需同时支持搜索、购物、订票、编程等多元任务类型;快:端侧+云端混合推理架构确保2秒内首响应、10秒内任务完成;好:多层验证和回退机制将任务成功率从60%级提升至90%级;省:智能路由将高频简单任务分配给轻量模型以控制成本。朱达强调C端AI Agent核心挑战不是模型能力而是工程可靠性——用户不会容忍比手动操作更慢或更不可靠的AI助手。这一哲学源于千问APP数千万用户规模的实战经验。

🔗 查看原文