内容概览
本文围绕“Cloudflare 发布开放权重决策模型 Clef-omni,新增支持音视频多模态输入”整理核心信息、适用场景与使用条件,便于读者快速了解重点,再决定是否进一步体验或查阅项目资料。
详细信息
Cloudflare 于 10 月 9 日正式发布公告,推出了全新的开放权重决策模型 Clef-omni。该模型在原有的文本与图像处理能力基础上,进一步扩展了对音频和完整视频格式的支持,能够通过单次 API 调用同时处理多模态内容。

多模态升级与架构解析
在多模态支持方面,传统的 Clef 模型主要处理文本、图像以及通过按时间间隔抽取的静态连续画面。而新推出的 Clef-omni 则原生支持 wav、mp3、mp4 和 webm 等音视频格式。这一改进省去了开发者以往需要额外部署语音转写及音视频拆分流程的繁琐步骤,可以用单一模型高效处理多样化的输入需求。
根据官方公布的技术细节,Clef-omni 基于 Qwen3-Omni-30B-A3B-Instruct 构建,并保留了其核心理解能力。该模型主要面向结构化决策任务,不生成常规的文本输出。在性能表现上,纯文本请求的中位响应时间约为 130 毫秒,图像约为 150 毫秒;处理一段包含声音的 21 秒视频大约仅需 1.5 秒即可完成评分。
价格下调与系列模型对比
伴随新模型的发布,Cloudflare 同步下调了 Clef-flash 的使用价格,每百万输入 Token 的费用从 0.09 美元大幅下调至 0.038 美元,降幅约为 58%,其托管版的上下文窗口也从 64k 调整至 24k。整体而言,当前该系列模型的阶梯定价满足了不同开发者的成本与性能需求。
编辑整理:阅读要点
- 功能和价格可能随版本或地区变化,使用前应查看最新说明。
- 安装软件或启用服务时,优先使用项目官方渠道并检查所需权限。
- 是否适合长期使用,应结合自身设备、工作流和实际体验判断。
延伸阅读
资料来源:news.aibase.com。本文依据公开资料整理,不是独立采访或独家报道。
