Skip to content

AI 模型管理

AI 模型管理提供统一的模型配置和管理界面,支持多种主流 LLM 提供商和模型类型。

支持的模型提供商

Sira AI 集成了主流 AI 模型提供商:

提供商代码说明推荐模型
Auto 智能调度auto⚡ 路由器:按规则把请求转发给具体模型,本身不调上游 API—(见 AutoRouter 小节)
OpenAIopenai最强大的通用模型GPT-4o, GPT-3.5-turbo
Claudeclaude长文本和推理能力强Claude 3.5 Sonnet
Azure OpenAIazure_openai企业级 OpenAI 服务GPT-4, GPT-3.5
DeepSeekdeepseek性价比高的中文模型DeepSeek Chat
Qwenqwen阿里通义千问Qwen-Turbo, Qwen-Plus
Locallocal本地部署模型Ollama, vLLM
HuggingFace TEIteiTEI 推理服务(embedding/rerank),默认 http://reranker:80BGE 系列
Customcustom自定义 API 端点任意兼容 OpenAI 格式的 API

模型类型

Sira AI 支持 4 种模型类型,一个模型可以同时支持多种类型:

  • LLM - 大语言模型,用于对话和文本生成
  • EMBEDDING - 嵌入模型,用于向量化和语义检索
  • VISION - 视觉模型,用于图像理解和多模态任务
  • RERANK - 重排序模型,用于搜索结果优化

多模型类型

创建模型时可以勾选多个类型。例如 GPT-4o 可以同时勾选 LLM 和 VISION。


模型管理页面

进入模型管理

导航路径:AI 模型配置模型管理

页面功能

模型列表:

  • 按提供商分组展示
  • 显示模型状态(启用/禁用)
  • 显示模型类型标签
  • 显示使用统计(总请求数、总 Token 数)
  • 最后使用时间

操作按钮:

  • + 添加模型 - 创建新模型
  • 测试 - 发送测试消息验证模型
  • 编辑 - 修改模型配置
  • 删除 - 删除模型
  • 启用/禁用 - 切换模型状态
  • 设为默认 - 设置默认 LLM 模型

创建 AI 模型

1. 点击"添加模型"

在模型管理页面右上角点击**+ 添加模型**按钮。

2. 填写基础信息

必填字段

字段说明示例
模型名称显示名称GPT-4o 生产环境
提供商选择提供商openai
模型标识API 中的模型名称gpt-4o-2024-05-13
模型类型勾选支持的类型LLM + VISION

模型标识

模型标识必须与 API 文档中的模型名称完全一致,否则调用会失败。

3. 配置 API 访问

OpenAI / Claude / DeepSeek / Qwen

字段说明必填
API KeyAPI 密钥
API Base URL自定义端点(可选)

示例配置:

bash
# OpenAI
API Key: sk-proj-xxx...
API Base URL: https://api.openai.com/v1  # 默认值

# DeepSeek
API Key: sk-xxx...
API Base URL: https://api.deepseek.com/v1  # 默认值

Azure OpenAI

字段说明必填
API KeyAzure API 密钥
API Base URLAzure 端点地址
API VersionAPI 版本

示例配置:

bash
API Key: 你的Azure密钥
API Base URL: https://your-resource.openai.azure.com
API Version: 2024-02-15-preview

Local / Custom

字段说明必填
API Base URL本地服务地址

示例配置:

bash
# Ollama
API Base URL: http://localhost:11434/v1

# vLLM
API Base URL: http://localhost:8000/v1

# 其他兼容 OpenAI 格式的 API
API Base URL: https://your-custom-api.com/v1

API 密钥安全

API Key 会自动加密存储,在列表中显示为 ***

4. 配置模型参数

基础参数

参数说明默认值范围
Temperature创造性控制0.70.0-2.0
Max Tokens最大输出长度40961-1,000,000
上下文窗口 (contextWindow)模型总 token 容量(输入+输出)1000001,000-1,000,000
Timeout超时时间(秒)3001-300

上下文窗口

按提供商有不同的默认预填:Claude 200000 / DeepSeek 131072 / OpenAI 128000 / Qwen 100000。系统会用其中 15% 作为消息总结阈值。

Temperature 说明:

  • 0.0-0.3: 输出稳定,适合客服、问答
  • 0.4-0.7: 平衡创造性和准确性
  • 0.8-1.0: 更有创意,适合内容创作

高级参数

参数说明默认值适用场景
Top P核采样概率1.0控制输出多样性
Frequency Penalty频率惩罚0.0减少重复内容
Presence Penalty存在惩罚0.0鼓励新话题

特殊功能

启用思考模式 (enableThinking):

  • 适用于 OpenAI o1 系列模型(模型名含 o1 时自动开启,可手动关)
  • 模型会返回思考过程
  • 这是目前唯一的高级推理开关

额外请求参数 (extra_body):

  • 在「高级配置」折叠区里,JSON 格式,直接透传给模型 API
  • 例:{"seed": 42, "response_format": {"type": "json_object"}}
  • 这是对话框里唯一的高级 JSON 字段
  • ⚠️ Claude 不支持 extra_body,该输入框对 Claude 禁用

已移除的字段

旧版的「启用推理模式 (enableReasoning)」开关(原适用于 DeepSeek R1)已于 2026-06-14 移除;「自定义请求头 (customHeaders)」「提供商特定参数 (providerSpecificParams)」从未在当前 UI 提供 —— 自定义参数统一走 extra_body

输出维度(仅 Embedding 模型)

embedding_dimensions(输出维度):

  • 仅当「模型类型」勾选了 EMBEDDING才显示该输入框
  • 常见值:bge-large-zh / bge-m3 = 1024、text-embedding-3-small = 1536、Qwen3-Embedding = 2048、text-embedding-3-large = 3072
  • 模型支持降维时,此值会作为 dimensions 参数发给 API 截断到目标维度
  • 不配置时 RAG 入库会按 1024 假设并可能报错

5. 保存模型

点击创建按钮,系统会:

  1. 验证配置正确性
  2. 加密并保存 API Key
  3. 创建模型记录
  4. 返回模型列表

配额限制(Quota)

在模型对话框的「配额限制(Quota)」卡片里,可为单个模型设置多条配额规则(Rerank/TEI 模型不参与 token 配额,不显示此卡片)。

每条规则是一个五元组:

字段说明
范围 (scope)配额作用范围,如 org(组织级,跨用户聚合) / model(该模型全局额度) / user
窗口 (window)统计周期,如 day / hour / month
指标 (metric)计量维度,如 total_tokens / requests / cost_micro_usd
上限 (limit)阈值,必须 > 0
模式 (mode)off(跳过本规则) / warning(触顶仅日志告警) / enforce(触顶直接 HTTP 429)

同一 (scope, window, metric) 三元组不允许重复。


熔断器(Circuit Breaker)

模型列表每行有一个盾牌图标,点击打开熔断器状态对话框,实时显示该模型的熔断状态:

状态含义
closed正常
open已熔断,请求直接快速失败
half_open试探中,放少量请求探活

对话框还展示近 60 秒滑动窗口的统计(总数 / 失败 / 错误率)、opened_at 时间,以及一个「立即重置」按钮(把状态清回 closed,仅在非 closed 时可用)。


Auto 智能调度模型(AutoRouter)

提供商选择 auto 时,该模型不真调上游 API,而是充当一个路由器。对话框会隐藏常规字段(API Key / 模型参数 / 高级配置 / 配额等),只显示路由规则编辑器(AutoRouting):

  • 有序路由规则:从上到下逐条匹配,每条规则 = conditiontarget_model_id
    • condition 可选维度:has_vision(请求含图片) / has_tools(请求带工具) / requires_thinking / max_input_tokens / channel
    • target_model_id:命中后转发给哪个具体模型
  • 必须有兜底规则(catch-all):最后一条规则的 condition 全部留空,匹配所有未命中的请求(否则保存校验不通过)
  • fallback_chain:目标模型不可用时按链路依次降级的模型列表

具体目标模型的 token / 成本 / API 凭据由各自的 AI 模型条目独立管理,AutoRouter 自身不重复配置。


测试模型

测试流程

  1. 在模型列表中找到要测试的模型
  2. 点击测试按钮
  3. 在弹出的对话框中输入测试消息
  4. 点击发送
  5. 查看模型响应

测试示例

测试消息: 你好,请介绍一下你自己

正常响应:

你好!我是一个AI助手,可以帮助你回答问题、提供信息...

错误响应:

  • API Key 错误: Incorrect API key provided
  • 模型不存在: The model does not exist
  • 网络错误: Connection timeout

测试建议

创建模型后立即测试,确保配置正确再应用到 Agent。


编辑模型

编辑流程

  1. 点击模型卡片的编辑按钮
  2. 修改配置(所有字段均可修改)
  3. 点击保存

可修改内容

  • 基础信息(名称、模型标识、类型)
  • API 配置(密钥、端点、版本)
  • 模型参数(温度、最大 token、上下文窗口、超时等)
  • 高级功能(思考模式、extra_body、配额、熔断、auto 路由等)

注意

修改后立即生效,正在使用该模型的 Agent 会使用新配置。


删除模型

删除流程

  1. 点击模型卡片的删除按钮
  2. 确认删除操作
  3. 模型被删除(软删除)

删除前检查

系统会检查模型是否被使用:

  • 未被使用: 可以直接删除
  • 正在使用: 需要先解除 Agent 绑定

警告

删除模型后无法恢复,请谨慎操作。


启用和禁用

启用/禁用模型

启用: 模型可以被 Agent 使用
禁用: 模型暂时不可用,已配置的 Agent 调用时会报错

使用场景

临时禁用:

  • API 配额用尽
  • 模型维护期间
  • 成本控制需要

重新启用:

  • 配额恢复
  • 维护完成
  • 预算充足

设置默认模型

默认模型作用

设置为默认的 LLM 模型会在以下场景自动使用:

  • 创建 Agent 时的预选模型
  • Orchestrator 未指定模型时的fallback
  • Web 客户端快速测试

设置方法

  1. 找到要设为默认的模型
  2. 点击设为默认按钮
  3. 该模型成为默认 LLM 模型

限制

只有类型包含 LLM 的模型可以设为默认。


使用统计

统计指标

每个模型卡片显示:

  • 总请求数 (totalRequests): 模型被调用的总次数
  • 总 Token 数 (totalTokens): 消耗的 Token 总量
  • 最后使用时间 (lastUsedAt): 最近一次调用时间

成本估算

根据使用统计和各提供商的定价,可以估算成本:

提供商输入价格输出价格示例(1M tokens)
OpenAI GPT-4o$5/1M$15/1M$20
OpenAI GPT-3.5$0.5/1M$1.5/1M$2
Claude 3.5 Sonnet$3/1M$15/1M$18
DeepSeek Chat$0.14/1M$0.28/1M$0.42

常见问题

API Key 相关

Q: API Key 如何获取?

A:

Q: API Key 存储安全吗?

A: API Key 使用 AES-256 加密存储,只有系统内部可以解密。

模型配置

Q: 如何知道模型标识?

A: 查看各提供商的 API 文档:

Q: Temperature 如何选择?

A:

  • 客服、问答 → 0.2-0.3
  • 通用对话 → 0.7
  • 内容创作 → 0.8-1.0

Q: Max Tokens 设置多少合适?

A:

  • 简短回复 → 500-1000
  • 一般对话 → 1000-2000
  • 长文本生成 → 2000-4000

测试和调试

Q: 测试失败怎么办?

A: 按以下顺序排查:

  1. 检查 API Key 是否正确
  2. 检查模型标识是否正确
  3. 检查网络连接
  4. 查看系统日志

Q: 模型响应很慢?

A:

  • 检查 API Base URL 是否正确
  • 尝试增加 Timeout 时间
  • 考虑更换提供商或区域

Q: 出现 Rate Limit 错误?

A:

  • API 配额用尽,等待重置或充值
  • 请求频率过高,降低并发数
  • 升级 API 套餐

成本优化

Q: 如何降低使用成本?

A:

  1. 日常对话使用 GPT-3.5 或 DeepSeek
  2. 复杂任务才使用 GPT-4o
  3. 减少 Max Tokens 设置
  4. 启用缓存机制

Q: 如何监控成本?

A:

  • 定期查看使用统计
  • 在提供商后台设置预算告警
  • 使用成本分析工具

下一步

Apache-2.0 Licensed