AI 模型管理
AI 模型管理提供统一的模型配置和管理界面,支持多种主流 LLM 提供商和模型类型。
支持的模型提供商
Sira AI 集成了主流 AI 模型提供商:
| 提供商 | 代码 | 说明 | 推荐模型 |
|---|---|---|---|
| Auto 智能调度 | auto | ⚡ 路由器:按规则把请求转发给具体模型,本身不调上游 API | —(见 AutoRouter 小节) |
| OpenAI | openai | 最强大的通用模型 | GPT-4o, GPT-3.5-turbo |
| Claude | claude | 长文本和推理能力强 | Claude 3.5 Sonnet |
| Azure OpenAI | azure_openai | 企业级 OpenAI 服务 | GPT-4, GPT-3.5 |
| DeepSeek | deepseek | 性价比高的中文模型 | DeepSeek Chat |
| Qwen | qwen | 阿里通义千问 | Qwen-Turbo, Qwen-Plus |
| Local | local | 本地部署模型 | Ollama, vLLM |
| HuggingFace TEI | tei | TEI 推理服务(embedding/rerank),默认 http://reranker:80 | BGE 系列 |
| Custom | custom | 自定义 API 端点 | 任意兼容 OpenAI 格式的 API |
模型类型
Sira AI 支持 4 种模型类型,一个模型可以同时支持多种类型:
- LLM - 大语言模型,用于对话和文本生成
- EMBEDDING - 嵌入模型,用于向量化和语义检索
- VISION - 视觉模型,用于图像理解和多模态任务
- RERANK - 重排序模型,用于搜索结果优化
多模型类型
创建模型时可以勾选多个类型。例如 GPT-4o 可以同时勾选 LLM 和 VISION。
模型管理页面
进入模型管理
导航路径:AI 模型配置 → 模型管理
页面功能
模型列表:
- 按提供商分组展示
- 显示模型状态(启用/禁用)
- 显示模型类型标签
- 显示使用统计(总请求数、总 Token 数)
- 最后使用时间
操作按钮:
- + 添加模型 - 创建新模型
- 测试 - 发送测试消息验证模型
- 编辑 - 修改模型配置
- 删除 - 删除模型
- 启用/禁用 - 切换模型状态
- 设为默认 - 设置默认 LLM 模型
创建 AI 模型
1. 点击"添加模型"
在模型管理页面右上角点击**+ 添加模型**按钮。
2. 填写基础信息
必填字段
| 字段 | 说明 | 示例 |
|---|---|---|
| 模型名称 | 显示名称 | GPT-4o 生产环境 |
| 提供商 | 选择提供商 | openai |
| 模型标识 | API 中的模型名称 | gpt-4o-2024-05-13 |
| 模型类型 | 勾选支持的类型 | LLM + VISION |
模型标识
模型标识必须与 API 文档中的模型名称完全一致,否则调用会失败。
3. 配置 API 访问
OpenAI / Claude / DeepSeek / Qwen
| 字段 | 说明 | 必填 |
|---|---|---|
| API Key | API 密钥 | ✅ |
| API Base URL | 自定义端点(可选) | ❌ |
示例配置:
# OpenAI
API Key: sk-proj-xxx...
API Base URL: https://api.openai.com/v1 # 默认值
# DeepSeek
API Key: sk-xxx...
API Base URL: https://api.deepseek.com/v1 # 默认值Azure OpenAI
| 字段 | 说明 | 必填 |
|---|---|---|
| API Key | Azure API 密钥 | ✅ |
| API Base URL | Azure 端点地址 | ✅ |
| API Version | API 版本 | ✅ |
示例配置:
API Key: 你的Azure密钥
API Base URL: https://your-resource.openai.azure.com
API Version: 2024-02-15-previewLocal / Custom
| 字段 | 说明 | 必填 |
|---|---|---|
| API Base URL | 本地服务地址 | ✅ |
示例配置:
# Ollama
API Base URL: http://localhost:11434/v1
# vLLM
API Base URL: http://localhost:8000/v1
# 其他兼容 OpenAI 格式的 API
API Base URL: https://your-custom-api.com/v1API 密钥安全
API Key 会自动加密存储,在列表中显示为 ***。
4. 配置模型参数
基础参数
| 参数 | 说明 | 默认值 | 范围 |
|---|---|---|---|
| Temperature | 创造性控制 | 0.7 | 0.0-2.0 |
| Max Tokens | 最大输出长度 | 4096 | 1-1,000,000 |
上下文窗口 (contextWindow) | 模型总 token 容量(输入+输出) | 100000 | 1,000-1,000,000 |
| Timeout | 超时时间(秒) | 300 | 1-300 |
上下文窗口
按提供商有不同的默认预填:Claude 200000 / DeepSeek 131072 / OpenAI 128000 / Qwen 100000。系统会用其中 15% 作为消息总结阈值。
Temperature 说明:
0.0-0.3: 输出稳定,适合客服、问答0.4-0.7: 平衡创造性和准确性0.8-1.0: 更有创意,适合内容创作
高级参数
| 参数 | 说明 | 默认值 | 适用场景 |
|---|---|---|---|
| Top P | 核采样概率 | 1.0 | 控制输出多样性 |
| Frequency Penalty | 频率惩罚 | 0.0 | 减少重复内容 |
| Presence Penalty | 存在惩罚 | 0.0 | 鼓励新话题 |
特殊功能
启用思考模式 (enableThinking):
- 适用于 OpenAI o1 系列模型(模型名含
o1时自动开启,可手动关) - 模型会返回思考过程
- 这是目前唯一的高级推理开关
额外请求参数 (extra_body):
- 在「高级配置」折叠区里,JSON 格式,直接透传给模型 API
- 例:
{"seed": 42, "response_format": {"type": "json_object"}} - 这是对话框里唯一的高级 JSON 字段
- ⚠️ Claude 不支持
extra_body,该输入框对 Claude 禁用
已移除的字段
旧版的「启用推理模式 (enableReasoning)」开关(原适用于 DeepSeek R1)已于 2026-06-14 移除;「自定义请求头 (customHeaders)」「提供商特定参数 (providerSpecificParams)」从未在当前 UI 提供 —— 自定义参数统一走 extra_body。
输出维度(仅 Embedding 模型)
embedding_dimensions(输出维度):
- 仅当「模型类型」勾选了
EMBEDDING时才显示该输入框 - 常见值:bge-large-zh / bge-m3 =
1024、text-embedding-3-small =1536、Qwen3-Embedding =2048、text-embedding-3-large =3072 - 模型支持降维时,此值会作为
dimensions参数发给 API 截断到目标维度 - 不配置时 RAG 入库会按 1024 假设并可能报错
5. 保存模型
点击创建按钮,系统会:
- 验证配置正确性
- 加密并保存 API Key
- 创建模型记录
- 返回模型列表
配额限制(Quota)
在模型对话框的「配额限制(Quota)」卡片里,可为单个模型设置多条配额规则(Rerank/TEI 模型不参与 token 配额,不显示此卡片)。
每条规则是一个五元组:
| 字段 | 说明 |
|---|---|
| 范围 (scope) | 配额作用范围,如 org(组织级,跨用户聚合) / model(该模型全局额度) / user |
| 窗口 (window) | 统计周期,如 day / hour / month |
| 指标 (metric) | 计量维度,如 total_tokens / requests / cost_micro_usd |
| 上限 (limit) | 阈值,必须 > 0 |
| 模式 (mode) | off(跳过本规则) / warning(触顶仅日志告警) / enforce(触顶直接 HTTP 429) |
同一
(scope, window, metric)三元组不允许重复。
熔断器(Circuit Breaker)
模型列表每行有一个盾牌图标,点击打开熔断器状态对话框,实时显示该模型的熔断状态:
| 状态 | 含义 |
|---|---|
closed | 正常 |
open | 已熔断,请求直接快速失败 |
half_open | 试探中,放少量请求探活 |
对话框还展示近 60 秒滑动窗口的统计(总数 / 失败 / 错误率)、opened_at 时间,以及一个「立即重置」按钮(把状态清回 closed,仅在非 closed 时可用)。
Auto 智能调度模型(AutoRouter)
当提供商选择 auto 时,该模型不真调上游 API,而是充当一个路由器。对话框会隐藏常规字段(API Key / 模型参数 / 高级配置 / 配额等),只显示路由规则编辑器(AutoRouting):
- 有序路由规则:从上到下逐条匹配,每条规则 =
condition→target_model_idcondition可选维度:has_vision(请求含图片) /has_tools(请求带工具) /requires_thinking/max_input_tokens/channeltarget_model_id:命中后转发给哪个具体模型
- 必须有兜底规则(catch-all):最后一条规则的 condition 全部留空,匹配所有未命中的请求(否则保存校验不通过)
- fallback_chain:目标模型不可用时按链路依次降级的模型列表
具体目标模型的 token / 成本 / API 凭据由各自的 AI 模型条目独立管理,AutoRouter 自身不重复配置。
测试模型
测试流程
- 在模型列表中找到要测试的模型
- 点击测试按钮
- 在弹出的对话框中输入测试消息
- 点击发送
- 查看模型响应
测试示例
测试消息: 你好,请介绍一下你自己
正常响应:
你好!我是一个AI助手,可以帮助你回答问题、提供信息...错误响应:
- API Key 错误:
Incorrect API key provided - 模型不存在:
The model does not exist - 网络错误:
Connection timeout
测试建议
创建模型后立即测试,确保配置正确再应用到 Agent。
编辑模型
编辑流程
- 点击模型卡片的编辑按钮
- 修改配置(所有字段均可修改)
- 点击保存
可修改内容
- 基础信息(名称、模型标识、类型)
- API 配置(密钥、端点、版本)
- 模型参数(温度、最大 token、上下文窗口、超时等)
- 高级功能(思考模式、
extra_body、配额、熔断、auto 路由等)
注意
修改后立即生效,正在使用该模型的 Agent 会使用新配置。
删除模型
删除流程
- 点击模型卡片的删除按钮
- 确认删除操作
- 模型被删除(软删除)
删除前检查
系统会检查模型是否被使用:
- ✅ 未被使用: 可以直接删除
- ❌ 正在使用: 需要先解除 Agent 绑定
警告
删除模型后无法恢复,请谨慎操作。
启用和禁用
启用/禁用模型
启用: 模型可以被 Agent 使用
禁用: 模型暂时不可用,已配置的 Agent 调用时会报错
使用场景
临时禁用:
- API 配额用尽
- 模型维护期间
- 成本控制需要
重新启用:
- 配额恢复
- 维护完成
- 预算充足
设置默认模型
默认模型作用
设置为默认的 LLM 模型会在以下场景自动使用:
- 创建 Agent 时的预选模型
- Orchestrator 未指定模型时的fallback
- Web 客户端快速测试
设置方法
- 找到要设为默认的模型
- 点击设为默认按钮
- 该模型成为默认 LLM 模型
限制
只有类型包含 LLM 的模型可以设为默认。
使用统计
统计指标
每个模型卡片显示:
- 总请求数 (
totalRequests): 模型被调用的总次数 - 总 Token 数 (
totalTokens): 消耗的 Token 总量 - 最后使用时间 (
lastUsedAt): 最近一次调用时间
成本估算
根据使用统计和各提供商的定价,可以估算成本:
| 提供商 | 输入价格 | 输出价格 | 示例(1M tokens) |
|---|---|---|---|
| OpenAI GPT-4o | $5/1M | $15/1M | $20 |
| OpenAI GPT-3.5 | $0.5/1M | $1.5/1M | $2 |
| Claude 3.5 Sonnet | $3/1M | $15/1M | $18 |
| DeepSeek Chat | $0.14/1M | $0.28/1M | $0.42 |
常见问题
API Key 相关
Q: API Key 如何获取?
A:
- OpenAI: https://platform.openai.com/api-keys
- Claude: https://console.anthropic.com/settings/keys
- DeepSeek: https://platform.deepseek.com/api_keys
- Qwen: https://dashscope.console.aliyun.com/apiKey
Q: API Key 存储安全吗?
A: API Key 使用 AES-256 加密存储,只有系统内部可以解密。
模型配置
Q: 如何知道模型标识?
A: 查看各提供商的 API 文档:
- OpenAI: https://platform.openai.com/docs/models
- Claude: https://docs.anthropic.com/claude/docs/models-overview
- DeepSeek: https://platform.deepseek.com/api-docs/
Q: Temperature 如何选择?
A:
- 客服、问答 → 0.2-0.3
- 通用对话 → 0.7
- 内容创作 → 0.8-1.0
Q: Max Tokens 设置多少合适?
A:
- 简短回复 → 500-1000
- 一般对话 → 1000-2000
- 长文本生成 → 2000-4000
测试和调试
Q: 测试失败怎么办?
A: 按以下顺序排查:
- 检查 API Key 是否正确
- 检查模型标识是否正确
- 检查网络连接
- 查看系统日志
Q: 模型响应很慢?
A:
- 检查 API Base URL 是否正确
- 尝试增加 Timeout 时间
- 考虑更换提供商或区域
Q: 出现 Rate Limit 错误?
A:
- API 配额用尽,等待重置或充值
- 请求频率过高,降低并发数
- 升级 API 套餐
成本优化
Q: 如何降低使用成本?
A:
- 日常对话使用 GPT-3.5 或 DeepSeek
- 复杂任务才使用 GPT-4o
- 减少 Max Tokens 设置
- 启用缓存机制
Q: 如何监控成本?
A:
- 定期查看使用统计
- 在提供商后台设置预算告警
- 使用成本分析工具
下一步
- 多模型配置 - 不同类型模型的应用
- 自定义模型 - 接入本地部署模型
- 创建 Agent - 将模型应用到 Agent
- Orchestrator 配置 - 编排多模型协作
