德国 AI 协会协调的研究联盟发布开源大语言模型 Soofi S 30B-A3B,总参数量 316 亿、每个 token 仅激活约 32 亿参数,采用 Mamba-2 与标准注意力层混合的 MoE 架构。模型完全在德国电信慕尼黑工业 AI 云上训练,训练数据中德语占比从第一阶段的 7.2% 提升至第二阶段的 15.3%。在基准测试中,Soofi S 在所有完全开源模型中取得英语和德语综合最高分,超越 OLMo 3 32B 等。
🔗 查看原文腾讯混元发布 HyOCR-1.5,为端到端 OCR 大模型领域首个将训练、推理、模型权重完整开源的专家模型。仅 1B 参数,覆盖 8 种以上 text-centric 任务;引入 DFlash 投机解码框架,在 Transformers 下实现 6.37× 加速、vLLM 下 2.14× 加速,端到端推理达每页 1.408s,支持 4K 分辨率与 128K 上下文窗口。
🔗 查看原文新加坡视频生成初创公司 PixVerse 完成 C 轮扩展融资,共筹集 4.39 亿美元,估值突破 20 亿美元。公司提供 V 系列(消费者及 API)、C 系列(专业影视)及今年初发布的 R 系列世界模型(游戏开发),用户可生成最高 4K 分辨率并自带音频的视频;消费端注册用户超 1.5 亿、月活超 1500 万,图生视频每分钟 4.80 美元。本轮投资者包括阿里巴巴等。
🔗 查看原文字节跳动发布 Seedream 5.0 Pro,图像质量与提示词理解追平 GPT-Image 2.0,综合能力仅次于后者。核心亮点是"可编辑"交互:用户可在图上打点、画框、涂鸦,并在提示词中直接 @ 标记,实现精准局部编辑(如换沙发、改墙面颜色)而其他区域不变。实测涵盖家装改造(一次替换六件家具)、商品图制作、海报排版等场景,支持色卡配色。
🔗 查看原文一篇分析指出,同一份 TypeScript 文件在 GPT-5.x 上为 681 个 token,在 Claude 最新 tokenizer 下为 1,178 个,相差 1.73 倍。文中称 Anthropic 新 tokenizer 比旧版多产生约 30% 的 token 而标价不变,构成"隐性涨价",即便 Opus 4.6 与 Opus 4.8 标价同为 $5.00 / $25.00,实际成本也可能上升。(属第三方测算,供参考)
🔗 查看原文OpenAI 整合了一份面向普通用户的提示词指南,涵盖目标、上下文、输出格式和边界四个可选模块,建议以"结果"而非步骤开头,用一两条硬性规则替代逐步骤脚本。指南区分了 Chat 处理快速任务、基于 Codex 与 GPT-5.6 的 ChatGPT Work 负责多源多步骤复杂项目;Codex 还新增 Steer(重定向当前运行)、Queue(排队消息)和沙盒模式。
🔗 查看原文