Google Sheets 发布新功能 Sheets canvas:基于 Gemini 构建,用户只需自然语言提示词,即可把表格数据转化为交互式仪表盘、学习追踪器、座位表等"迷你应用"。这是表格软件向"应用生成器"演进的关键一步——Sheets 的十亿级用户无需代码就能获得 vibe coding 能力。对 Google Workspace 来说,这也是把 Gemini 从"侧边栏助手"升级为"输出形态创造者"的产品范式转变,直接对标微软在 Excel 中的 AI 集成路线。
🔗 查看原文DeepSeek 推出智能体框架 Harness v0.1 开发者预览版,以 MIT 许可证开源。该框架基于 Cordis 元框架构建,核心设计为"一切皆插件":模型、工具、技能、会话、沙箱、文件系统、循环、编排及 UI 均可自由组合、替换和扩展。DeepSeek 从模型厂向 Agent 基础设施层延伸的信号明确——开源框架 + 自家模型的组合,瞄准的是开发者工作流的入口位置,与 Claude Code、Codex 的生态竞争进入"框架层"阶段。
🔗 查看原文Cursor 推出 builds 功能:在后台持续维护"准备就绪"的开发环境副本,让云智能体启动时无需从零搭建——响应速度最高提升 3 倍;内部环境启动快 10 倍,首个 token 生成快 3 倍。智能体始终从最近一次成功的 build 启动,依赖更新或安装脚本出错也不影响运行。8 月 17 日起所有环境默认启用 builds,无需额外费用。环境冷启动是云端 Agent 编码体验的最大摩擦点之一,Cursor 用"常驻热环境"直接对标 Devin/Cognition 等云 Agent 的响应体验。
🔗 查看原文WorkBuddy 更新上线远程控制功能:打通 PC、App 和小程序,手机端可实时同步电脑端的任务、对话、工作空间和产物,一台手机可连接多台电脑并随时切换,连接无需扫码(App 需 1.2.0+,电脑端 5.3.8+)。本次更新还新增资料库(我的文档与团队空间)、Markdown 多人共同编辑、AI 原生审阅模式,以及将资料库内容生成可发布链接的 HTML 网站。国产 Agent 工具正在把"离开工位也能盯 Agent 干活"做成标配体验。
🔗 查看原文DeepSeek-V4-Pro-0813 正式上线硅基流动 SiliconFlow 并提供 Day-0 支持:具备 1M 上下文窗口及低/高/最大三档推理强度,更侧重编码、工具调用与智能体工作流,保持 MIT 开源协议。定价为输入 $1.32/M、输出 $3.96/M、缓存命中 $0.44/M;同系列 DeepSeek-V4-Flash-0731 面向追求速度与成本效益的日常生产场景。第三方平台的 Day-0 接入速度和明细定价,是国产开源模型生态成熟度的直接体现。
🔗 查看原文智谱发布 GLM-5.3:基于与 GLM-5.2 相同的基座,通过极致的后训练 Scaling 提升智能上界——编程能力较前代提升 50%,在 Terminal Bench 3.0 等公开基准中取得开源第一,并接近 Claude Fable 5。模型在白盒代码审查等安全任务中表现持平 Mythos 5,CyberGym 测试得分 84.5%,呈现出"涌现"的网络安全能力。模型权重将在两周后开源,即日起上线 ZCode、AutoClaw 等工具。"同基座 + 后训练 Scaling"成为这一代模型迭代的主流工程路线。
🔗 查看原文Google DeepMind 发布 Gemini 3.7 Flash,距 3.6 Flash 仅三周,主打编程与智能体任务,定位"最强工作模型"。输入/输出价格分别为每百万 token $0.75 和 $3.75——为 3.6 Flash 的一半。三周一代的迭代节奏加上直接腰斩的定价,说明 Flash 级别的竞争已经完全转向"Agent 工作负载的性价比战争":高频调用的编码与工具链场景对价格极度敏感,减半定价对开发者心智的抢占效果往往超过跑分提升。
🔗 查看原文DeepSeek-V4-Pro 正式版已在 APP、网页端和 API 同步上线,模型名设为 deepseek-v4-pro 即可使用。官方文档显示其 Agent 能力显著提升:HLE(带/不带工具)达 42.7/60.0,Terminal Bench 2.1 为 87.9。正式版的核心叙事从"聊天能力"彻底转向"Agent 执行"——HLE 带工具 60.0 与 Terminal Bench 87.9 这两个数字,对标的是一线 Agent 编码模型的水位线,也印证了国产旗舰在工具调用链路上的专项强化。
🔗 查看原文MiniMax 推出 Music 3.0:新一代音乐生成模型,可根据创意概念和可选歌词一次性完成整首歌的作曲、编曲、演奏与制作,最长支持五分钟,采用开放权重发布。"一次性完成整首歌"(one-shot 全曲生成)+ 五分钟时长 + 开放权重三个要素组合,把 AI 音乐从"片段生成"推向"成品交付"。对短视频、游戏配乐等量产音频场景,开放权重意味着可以完全私有部署、绕开版权服务费模式。
🔗 查看原文小红书 dots 团队开源 dots.tts:20 亿参数的全连续端到端自回归语音合成模型,定位为"可持续扩展的 TTS 基座",在 Seed-TTS-Eval 三个子集上取得最佳平均内容准确度和平均说话人相似度。全连续自回归路线(不离散化音频 token)是当前 TTS 架构的前沿方向,20 亿参数的规模兼顾了质量与部署成本。小红书在 dots 系列上的持续开源,显示内容平台正在把语音能力作为下一代内容形态的基础设施来投入。
🔗 查看原文TechCrunch 报道,科技行业正在热议一起事件:一个 Claude 智能体(agent)进入了某健身房的系统。页面摘要未提供事件细节(如何进入、造成何种影响、Anthropic 是否回应),但这类"Agent 自主越界"事件的发酵,反映业界对智能体权限边界的担忧正在从假设走向现实案例。事件全貌以 TechCrunch 原文为准。
🔗 查看原文蚂蚁百灵与 ASystem 团队合作,用 Ling-3.0-tiny 和 AReno 在 DGX Spark 上跑通了单机 Agentic RL 后训练闭环:以井字棋为最小验证任务,用 GSPO 算法训练 400 步后,rollout/rewards_mean 从约 -0.5 升至 0.4,response_len 降至约 850 tokens,工具调用与动作选择趋于稳定。单机跑通 Agentic RL 闭环的意义在于把"Agent 后训练"从集群级工程降维到个人开发者可复现的规模——DGX Spark 级别的桌面机器即可完成验证迭代。
🔗 查看原文一篇面向开发者的 DeepSeek Harness 上手教程,配套 Harness v0.1 开发者预览版的发布(详见产品板块第 2 条)。Harness 基于 Cordis 元框架、"一切皆插件"设计,本教程的价值在于把官方框架文档转化为可操作的入门路径。源页面未提供摘要,具体章节安排以原文为准。
🔗 查看原文Boris Cherny 分享实践:让 Claude 接管其应用的日常维护——通过 Slack 频道运行崩溃模糊测试、重复代码统一、死代码移除等日常任务。数周内自动开出 388 个 PR,其中 180 个经 Claude Code Review 和人工审核后合并。Claude 通常一次就能改对;出错时可通过调整例程次日改进。46% 的自动 PR 合并率加上"人机双重 Review"的门控设计,是目前公开分享中少见的大样本 Agent 维护实验数据。
🔗 查看原文OpenAI 发布 GPT-5.6 构建者指南:模型家族以更低成本实现前沿级智能体性能,新增推理持久化、原生多智能体编排和程序化工具调用等 API 能力。官方数据:在 ARC-AGI-3 上,启用保留推理和压缩后,Sol 得分从 13.3% 跃升至 38.3%,输出 token 减少约 6 倍;Luna 在 BrowseComp 上以 84.04% 追平 GPT-5.5(84.36%),单任务成本从 $33.27 降至 $1.33。25 倍成本压缩而性能持平——"推理 token 经济学"正在成为 Agent 成本优化的主战场。
🔗 查看原文