Appearance
模型中心概述
模型是 AI 应用理解信息、生成内容和处理数据的基础能力。智能问答、报告摘要、知识库检索和语音交互等功能,背后都需要相应类型的模型提供支持。
模型中心用于统一管理平台可以使用的模型。你可以在这里找到平台已经收录的模型,将需要的模型添加到模型管理,完成必要的接入配置,再提供给智能应用、工作流和知识库使用。
一、先理解模型的使用过程
一个模型从“平台中可以看到”到“业务真正可以使用”,通常要经过四个状态:
| 状态 | 表示什么 |
|---|---|
| 已收录 | 可以在模型广场查看模型资料 |
| 已添加 | 模型已经进入模型管理,成为平台候选模型 |
| 已配置 | 调用所需的地址、凭证和参数已经准备完成 |
| 已验证 | 已经通过应用或工作流完成真实调用测试 |
模型出现在模型管理中,不一定代表它已经能够正常调用。正式使用前仍需完成配置和测试。
二、模型广场与模型管理
2.1 模型广场:找到平台支持的模型
模型广场类似模型目录。你可以按照厂商、类型、能力和上下文长度查找模型,查看模型资料,再将目标模型添加到模型管理。
适合在以下情况进入:
- 想知道平台支持哪些模型;
- 准备添加一个平台已经收录的模型;
- 想比较不同模型的类型和能力;
- 不确定某个模型能否处理图片、调用工具或输出结构化内容。
2.2 模型管理:让模型进入实际业务
模型管理保存已经添加或接入平台的模型。你可以在这里设置默认模型、配置厂商访问参数、接入兼容模型、查看模型详情,以及维护不再使用的模型。
适合在以下情况进入:
- 应用或工作流的模型列表为空;
- 需要配置模型厂商的 API Key;
- 需要设置应用、知识库或语音默认模型;
- 需要接入医院内部部署的模型;
- 需要排查模型调用失败;
- 需要更换或移除模型。
三、常见模型类型
不同模型承担不同任务,不能相互替代。
| 模型类型 | 通俗理解 | 常见用途 |
|---|---|---|
| 语言模型 | 负责理解和生成文字 | 对话、摘要、信息提取、报告生成 |
| 多模态模型 | 可以同时理解文字、图片等内容 | 图文问答、检查图片辅助理解 |
| Embedding 模型 | 把文字转换为便于检索的向量 | 知识库文档处理和语义检索 |
| Rerank 模型 | 将检索结果重新排序 | 提升知识库返回内容的相关性 |
| 语音识别模型 | 把语音转换成文字 | 语音提问、病情口述 |
| 语音合成模型 | 把文字转换成语音 | 语音播报 |
| 推理模型 | 更适合处理复杂分析任务 | 多步骤判断和复杂问题分析 |
如果你准备创建一个普通对话应用,通常先准备语言模型;如果应用需要知识库,还需要准备 Embedding 模型。
四、选择模型时看什么
不要只看模型名称或参数规模。应结合业务需求判断:
- 任务类型:需要对话、检索、图片理解还是语音能力;
- 输入形式:模型是否支持文字、图片或其他输入;
- 模型能力:是否支持工具调用、结构化输出等功能;
- 上下文长度:是否能处理业务所需的材料长度;
- 稳定性:相同任务下的输出是否稳定;
- 响应速度:是否满足实际服务体验;
- 使用成本:是否适合预期调用量;
- 部署与合规:医疗数据是否允许发送到对应模型服务。
五、模型选择技巧
选择模型的关键不是寻找“最强模型”,而是找到满足当前任务要求,并且在效果、速度、成本和合规之间更合适的模型。
5.1 先确认不可缺少的能力
先写清楚任务的输入、处理过程和预期输出,再用必需能力排除不合适的模型。
| 任务特征 | 优先确认 |
|---|---|
| 普通问答、摘要或文本生成 | 语言模型,能够处理预计的输入长度 |
| 输入包含图片 | 多模态模型,并确认支持所使用的图片格式 |
| 从文本中提取固定字段 | 支持结构化输出,测试字段是否完整、格式是否稳定 |
| 需要调用插件、MCP 服务或工作流工具 | 支持工具调用,并测试参数生成是否正确 |
| 需要查询知识库 | 准备 Embedding 模型;需要优化结果排序时再配置 Rerank 模型 |
| 语音转文字或文字转语音 | 分别选择语音识别模型或语音合成模型 |
| 处理长文档或多份材料 | 确认上下文长度能够容纳输入、提示词和预期输出 |
上下文长度不是可以全部用于上传材料的空间。系统提示词、历史对话、知识库召回内容和模型输出也会占用上下文。
5.2 结合平台现有模型缩小范围
下面的建议根据当前模型管理页面和模型厂商公开资料整理,用于帮助你确定候选模型,并不代表模型已经适配所有业务。其中,Qwen3.6-Max 和 Qwen3.6-Plus 的能力来自当前平台模型卡片;其他可识别型号同时参考了对应厂商的公开说明。
| 实际模型 | 可确认能力 | 建议场景 |
|---|---|---|
deepseek-v4-flash | 文本生成、结构化输出、Function Calling、联网搜索 | 分类、信息提取、普通问答,以及对响应速度和成本较敏感的文本任务 |
deepseek-v4-pro | 文本生成、结构化输出、Function Calling、联网搜索 | 复杂文本处理、编程、数学,以及需要调用工具或联网搜索的任务 |
Qwen3.6-Max | 平台标注支持文本生成、多模态、图片理解、结构化输出和 Function Calling | 图文问答、图片理解,以及需要结构化结果或工具调用的综合任务 |
Qwen3.6-Plus | 平台标注支持文本生成、多模态、推理、图片理解、结构化输出和 Function Calling | 同时需要图片理解、推理和工具调用的综合任务 |
qwen3-omni-flash-2025-… | 所属模型系列支持文本、图片、音频和视频输入,并支持思考模式和 Function Calling | 短音视频分析、会议内容整理,以及图片、音频或视频理解任务 |
text-embedding-v4 | 将文本转换为向量,支持语义检索 | 知识库文档向量化、文本检索、RAG 和聚类 |
Qwen3-rerank | 计算查询与候选文本的相关性并重新排序 | 对知识库初步召回的候选结果进行二次排序 |
Qwen-ASR | 语音识别,将音频转换为文字 | 用户录音、病情口述或会议录音的文字转写 |
截图中的 qwen3-omni-flash-2025-… 没有显示完整型号,因此这里只说明其所属模型系列的能力。正式配置时,应先在模型详情中核对完整模型 ID、调用方式和输入限制。
Doubao-Seed-2.0-lite 已出现在模型广场,支持文本、图像、音频和视频理解,可作为全模态内容理解任务的候选模型。如果当前工作空间尚未将其添加到模型管理,应先完成添加和配置,再进行实际调用。
模型管理页面中的能力标签用于初步筛选。模型是否能处理某种文件、稳定输出指定格式或正确调用工具,仍需以模型详情、厂商文档和实际测试结果为准。
5.3 再根据任务难度确定候选范围
- 简单任务:改写、分类、短摘要等规则明确的任务,优先比较响应速度、稳定性和成本;
- 中等任务:多字段提取、材料归纳或需要调用工具的任务,重点测试指令遵循、结构化输出和工具调用;
- 复杂任务:多步骤分析、方案规划或跨材料推理,重点测试推理过程的一致性、长文本处理能力和失败情况。
模型能力越强,不代表越适合所有环节。工作流中的分类、格式转换等固定任务,可以使用满足要求且响应更快的模型;复杂分析节点再选择能力更强的模型。
5.4 使用同一组样例进行比较
不要只用一个问题判断模型效果。建议为同一任务选择 2~3 个候选模型,并使用相同的提示词、参数和测试样例进行比较。
至少检查:
- 结果质量:关键信息是否正确,有无遗漏或无依据内容;
- 格式稳定性:重复测试时,字段名称、数据类型和输出结构是否稳定;
- 任务兼容性:图片理解、工具调用或结构化输出能否实际执行;
- 响应表现:耗时和失败率是否满足业务要求;
- 使用成本:结合单次消耗与预计调用量评估;
- 部署与合规:数据能否发送到该模型服务,日志、权限和存储方式是否符合要求。
不能仅凭一次高质量回答确定模型。应同时加入边界输入、信息不完整、格式异常和容易混淆的样例,观察模型在不理想输入下是否仍然可控。
5.5 医疗场景需要额外确认
- 测试阶段使用脱敏数据或构造数据,避免直接提交真实患者敏感信息;
- 模型能够生成医学内容,不代表输出已经经过临床验证;
- 诊疗建议、风险判断等高风险结果应设置专业人员审核,不能仅依赖模型自动输出;
- 更换模型或调整版本后,应重新测试关键样例以及工作流的下游节点,确认输出格式和业务结果没有发生不可接受的变化。
平台展示的模型能力用于初步筛选,最终选择应以本业务场景中的实际测试结果为准。
六、第一次配置建议
如果你是第一次使用模型中心,可以按照下面的顺序操作:
