DeepSeek-V4-Flash 正式版 API 开启公测,Agent 基准成绩显著提升
DeepSeek 发布 V4-Flash 正式版 API,称其 Agent 能力较预览版大幅增强。官方公布的 Terminal Bench 2.1 得分为 82.7,NL2Repo 为 54.2,Toolathlon Verified 为 70.3。
经过来源核查的 AI 模型、API、研究、安全和监管动态。
DeepSeek 发布 V4-Flash 正式版 API,称其 Agent 能力较预览版大幅增强。官方公布的 Terminal Bench 2.1 得分为 82.7,NL2Repo 为 54.2,Toolathlon Verified 为 70.3。
DeepSeek V4 Flash 出现在部分模型目录和第三方比较页面中,主打较长上下文、较快响应与较低成本。现有证据不足以确认 ColaOS 的完整上线细节,且第三方评测并不支持其智能指数超过 GLM 5.2。
多家二手来源称,阿里通义千问团队已发布 Qwen3.8-Max,并计划在下周公开模型权重。报道将其描述为一款总参数量约 2.4 万亿、激活参数约 950 亿的多模态旗舰模型。
MiniMax H3 开放权重发布后,已获得 vLLM-Omni 的 Day 0 支持。开发者可通过兼容 OpenAI 的视频 API 调用模型,并使用异步任务或同步接口生成视频。
DeepSeek-V4-Flash 正式版 API 已上线公测,开发者无需更改调用名称即可使用。官方数据显示,新版本在多项代码、工具调用和自动化基准上超过 V4-Pro-Preview,并新增 Responses API 与 Codex 适配。
阿里旗下 Qwen 发布 Qwen3.8-Max,称其为 Qwen 系列迄今能力最强的模型。官方表示,该模型拥有 2.4 万亿参数、950 亿激活参数,并支持 100 万 Tokens 上下文。
OpenAI表示,GPT-5.6 Sol被用于优化自身运行所依赖的生产基础设施和推理栈。相关改进覆盖GPU内核、请求调度、路由、缓存及模型实现,据报道可将服务成本降低约20%,并提升代币生成效率。
DigitalOcean 已将 Moonshot AI 的 Kimi K3 接入 Inference Engine,开发者可通过托管式 Serverless Inference 使用该模型,无需自行管理推理基础设施。
DeepSeek 发布 V4-Flash-0731 API,并将其置于公开测试阶段。新版重点提升 Agent 和编程任务能力,原生支持 OpenAI Responses API,可直接接入 Codex 工作流。
一位用户称其在一天内使用 Opus 5 约28亿 Token,并认为该模型在多数能力上超过调整后的 Fable 5。不过,他同时指出,GPT-5.6 Sol 在复杂后端逻辑和长程任务上更强。现有资料确认 Opus 5 强调效率和较低 Token 消耗,但不同来源对其与 GPT-5.6 Sol、Fable 5 的基准排名存在明显分歧。
Gemini 3.5 Flash-Lite 是 Google Gemini 3.5 系列中的低延迟、低成本多模态模型,适用于工单分类、数据提取和其他重复性高、调用量大的任务。Google 表示,它在高负载场景下的延迟低于 Gemini 3.5 Flash。
Moonshot AI 宣布 Kimi K3 已通过 Together AI 提供服务,开发者可使用面向编码智能体和生产工作负载优化的高吞吐推理能力。
Moonshot AI 的 Kimi K3 现已在 Fireworks 上线,开发者可通过托管服务部署模型并进行 LoRA 微调。该模型拥有约 2.8 万亿参数、100 万 token 上下文窗口和原生视觉能力。
Baseten已通过Model APIs上线Moonshot的Kimi K3,为开发者提供首日调用入口。
Moonshot AI 的 Kimi K3 已在 Modal 上线。Modal 表示,其与 Moonshot AI 和 vLLM 合作提供首日支持,并使用针对 K3 架构训练的定制 DFlash 推测模型提升推理速度。
DeepSeek 宣布 V4-Flash 官方 API 进入公测,并称其代理能力和多项基准测试表现大幅提升。该版本支持 Responses API 格式,并已适配 Codex。
DeepSeek 推出实验性模型 V3.2-Exp,在 V3.1-Terminus 基础上加入 DeepSeek Sparse Attention(DSA),旨在提升长上下文场景下的训练与推理效率。该模型已上线应用、网页端和 API,API 价格即时下调超过 50%。