多模型配置
Sira AI 支持 4 种模型类型,可以为不同任务配置专门的模型,实现最佳性能和成本效益。
模型类型概述
四种模型类型
| 类型 | 名称 | 用途 | 典型模型 |
|---|---|---|---|
| LLM | 大语言模型 | 对话、文本生成、推理 | GPT-4o, Claude 3.5, DeepSeek |
| EMBEDDING | 嵌入模型 | 向量化、语义检索、相似度计算 | text-embedding-3, BGE-M3 |
| VISION | 视觉模型 | 图像理解、多模态任务 | GPT-4o, Claude 3.5 Sonnet |
| RERANK | 重排序模型 | 搜索结果优化、相关性排序 | BGE-Reranker, Cohere Rerank |
一个模型,多种类型
创建模型时可以勾选多个类型,例如:
- GPT-4o: 勾选
LLM+VISION(既能对话又能看图) - text-embedding-3: 仅勾选
EMBEDDING(专注向量化) - Claude 3.5 Sonnet: 勾选
LLM+VISION
LLM (大语言模型)
功能
- 对话交互: 回答用户问题、多轮对话
- 内容生成: 撰写文章、代码、邮件等
- 推理分析: 逻辑推理、数据分析、决策支持
- 知识问答: 基于知识库的问答
推荐模型
OpenAI 系列:
gpt-4o-2024-05-13- 最强综合能力,支持多模态gpt-4o-mini- 性价比高,适合日常对话gpt-3.5-turbo- 经济实惠,响应快速
Claude 系列:
claude-3-5-sonnet-20241022- 长文本处理,推理能力强claude-3-5-haiku-20241022- 快速响应,成本低
DeepSeek 系列:
deepseek-chat- 性价比极高的中文模型deepseek-coder- 代码生成专家
Qwen 系列:
qwen-plus- 通义千问高级版qwen-turbo- 快速响应版本
使用场景
客服助手:
模型: GPT-3.5-turbo 或 DeepSeek Chat
原因: 成本低,响应快,满足日常咨询需求内容创作:
模型: GPT-4o 或 Claude 3.5 Sonnet
原因: 创意能力强,文本质量高技术支持:
模型: DeepSeek Coder
原因: 代码理解强,技术问题解决能力好配置示例
创建 LLM 模型:
- 进入 AI 模型配置 → 模型管理 → 添加模型
- 填写基础信息:
- 名称:
GPT-4o 生产环境 - 提供商:
openai - 模型标识:
gpt-4o-2024-05-13 - 模型类型: 勾选 LLM 和 VISION
- 名称:
- 配置 API:
- API Key: 输入 OpenAI API 密钥
- 调整参数:
- Temperature:
0.7 - Max Tokens:
2000
- Temperature:
- 保存并测试
EMBEDDING (嵌入模型)
功能
- 文本向量化: 将文本转换为高维向量
- 语义检索: 找到语义相似的文本
- 相似度计算: 计算文本之间的相似度
- 聚类分析: 对文本进行聚类
推荐模型
OpenAI 系列:
text-embedding-3-large- 3072维,最高精度text-embedding-3-small- 1536维,性价比高text-embedding-ada-002- 传统版本,稳定可靠
开源模型:
BAAI/bge-large-zh-v1.5- 中文嵌入模型BAAI/bge-m3- 多语言嵌入模型
使用场景
知识库检索:
场景: RAG (检索增强生成)
流程:
1. 将文档切分为片段
2. 使用 Embedding 模型向量化
3. 用户提问时,将问题向量化
4. 找到最相似的文档片段
5. 将片段传给 LLM 生成回答语义搜索:
场景: 智能文档搜索
优势: 不依赖关键词,理解语义含义
示例: 搜索"如何提升销售" 可以匹配到 "增加营收的方法"内容推荐:
场景: 相似内容推荐
流程:
1. 对所有内容进行向量化
2. 计算向量相似度
3. 推荐相似内容给用户配置示例
创建 Embedding 模型:
- 添加模型:
- 名称:
OpenAI Embedding Large - 提供商:
openai - 模型标识:
text-embedding-3-large - 模型类型: 仅勾选 EMBEDDING
- 输出维度(embedding_dimensions): 勾选 EMBEDDING 后出现此输入框,如
3072(text-embedding-3-large)。不配置时 RAG 入库会按 1024 假设并可能报错
- 名称:
- 配置 API Key
- 保存
在 Agent 中使用:
# Agent 配置中指定 Embedding 模型
{
"name": "知识库助手",
"llm_model_id": "gpt-4o的ID",
"embedding_model_id": "embedding模型的ID", // 用于向量检索
"tools": ["knowledge_base_search"]
}VISION (视觉模型)
功能
- 图像理解: 识别图像中的物体、场景、文字
- 图像描述: 生成图像的文字描述
- 视觉问答: 回答关于图像的问题
- 多模态推理: 结合图像和文本进行推理
推荐模型
支持 Vision 的模型:
gpt-4o-2024-05-13(OpenAI) - 综合能力最强gpt-4-turbo(OpenAI) - 成熟稳定claude-3-5-sonnet-20241022(Claude) - 视觉理解精准qwen-vl-plus(Qwen) - 中文视觉模型
使用场景
图片咨询:
场景: 用户发送产品图片咨询
处理: Vision 模型识别图片内容 → LLM 生成回答
示例:
用户: [上传手机截图] "这个报错怎么解决?"
AI: 识别截图中的错误信息,提供解决方案图表分析:
场景: 分析数据图表
处理: Vision 模型理解图表 → LLM 分析趋势
示例:
用户: [上传销售趋势图] "分析一下销售情况"
AI: 识别图表数据,分析销售趋势和原因文档OCR:
场景: 提取图片中的文字
处理: Vision 模型识别文字 → 结构化输出
示例:
用户: [上传名片照片] "保存这个联系人"
AI: 提取姓名、电话、邮箱等信息配置示例
创建 Vision 模型:
- 添加模型:
- 名称:
GPT-4o Vision - 提供商:
openai - 模型标识:
gpt-4o-2024-05-13 - 模型类型: 勾选 LLM + VISION
- 名称:
- 配置 API Key
- 保存
在 Application 中启用多模态:
- 企业微信 AI Bot 自动支持图片消息
- Web 客户端支持图片上传
- API Service 支持
image_url参数
RERANK (重排序模型)
功能
- 相关性评分: 评估文本与查询的相关性
- 结果重排序: 对搜索结果按相关性重新排序
- 精准匹配: 提升检索准确率
推荐模型
仅支持远程 API(2026-06-12)
内置的本地 rerank(进程内推理)已移除。现在 rerank 只支持远程 API —— 通过 tei 提供商接入自部署的 TEI 服务(默认 http://reranker:80,可跑 BGE-Reranker 等),或接入 Cohere / Jina 等商业 API。
自部署(TEI 服务):
BAAI/bge-reranker-v2-m3- 多语言重排序BAAI/bge-reranker-large- 中文重排序
商业 API:
- Cohere Rerank API
- Jina Rerank API
使用场景
知识库检索优化:
流程:
1. Embedding 模型初步检索 (召回100条)
2. Rerank 模型精准排序 (返回Top 5)
3. LLM 基于Top 5生成回答
效果: 提升检索准确率,减少噪音搜索结果优化:
场景: 企业内部文档搜索
处理:
1. 用户搜索 "销售政策"
2. Embedding 召回50篇相关文档
3. Rerank 按相关性重排序
4. 返回最相关的Top 10配置示例
创建 Rerank 模型:
- 添加模型:
- 名称:
BGE Reranker - 提供商:
tei(自部署 TEI 服务)或custom(远程 API) - API Base URL: TEI 服务地址(
tei默认http://reranker:80) - 模型类型: 仅勾选 RERANK
- 名称:
- 保存
在 RAG 中使用:
# Agent Tool 配置
{
"tool": "knowledge_base_search",
"config": {
"embedding_model_id": "embedding模型ID",
"rerank_model_id": "rerank模型ID", // 可选,提升精准度
"top_k": 5
}
}多模型协作
Agent 多模型配置
一个 Agent 可以同时配置多种类型的模型:
{
"name": "智能助手",
"llm_model_id": "gpt-4o的ID", // 主对话模型
"embedding_model_id": "embedding的ID", // 知识库检索
"vision_model_id": "gpt-4o的ID", // 图像理解(可选)
"rerank_model_id": "rerank的ID", // 重排序(可选)
"tools": ["knowledge_base_search", "web_search"]
}典型协作场景
场景 1: 知识库助手
用户提问
↓
Embedding 模型: 向量化问题
↓
向量数据库: 检索相似文档
↓
Rerank 模型: 重排序结果 (可选)
↓
LLM 模型: 基于检索结果生成回答场景 2: 多模态客服
用户发送图片 + 文字
↓
Vision 模型: 理解图片内容
↓
LLM 模型: 结合图片和文字生成回答场景 3: 智能搜索
用户搜索查询
↓
Embedding 模型: 语义检索
↓
Rerank 模型: 精准排序
↓
LLM 模型: 总结搜索结果成本优化策略
按任务选择模型
日常对话 → GPT-3.5 / DeepSeek Chat
成本: $0.5-2 / 1M tokens
复杂推理 → GPT-4o / Claude 3.5 Sonnet
成本: $5-15 / 1M tokens
图像理解 → GPT-4o (必需)
成本: $5-15 / 1M tokens + 图片费用
向量检索 → text-embedding-3-small
成本: $0.02 / 1M tokens
重排序 → 本地部署 BGE-Reranker
成本: 免费(仅硬件成本)
混合策略
策略 1: 分层模型
- 简单问题 → 经济型 LLM
- 复杂问题 → 高端 LLM
- 图片问题 → Vision 模型
策略 2: 本地 + 云端
- Embedding/Rerank → 本地部署(免费)
- LLM → 云端 API (按需付费)
模型性能对比
LLM 对比
| 模型 | 速度 | 质量 | 成本 | 中文 | 推荐场景 |
|---|---|---|---|---|---|
| GPT-4o | ⚡⚡ | ⭐⭐⭐⭐⭐ | 💰💰💰 | ⭐⭐⭐⭐ | 复杂任务 |
| GPT-3.5 | ⚡⚡⚡ | ⭐⭐⭐ | 💰 | ⭐⭐⭐ | 日常对话 |
| Claude 3.5 | ⚡⚡ | ⭐⭐⭐⭐⭐ | 💰💰💰 | ⭐⭐⭐ | 长文本分析 |
| DeepSeek | ⚡⚡⚡ | ⭐⭐⭐⭐ | 💰 | ⭐⭐⭐⭐⭐ | 中文任务 |
Embedding 对比
| 模型 | 维度 | 性能 | 成本 | 语言 |
|---|---|---|---|---|
| text-embedding-3-large | 3072 | ⭐⭐⭐⭐⭐ | 💰💰 | 多语言 |
| text-embedding-3-small | 1536 | ⭐⭐⭐⭐ | 💰 | 多语言 |
| BGE-M3 | 1024 | ⭐⭐⭐⭐ | 免费 | 多语言 |
常见问题
模型选择
Q: LLM 模型必须配置吗?
A: 是的,每个 Agent 必须配置至少一个 LLM 模型用于对话。
Q: Embedding 模型什么时候需要?
A: 当使用知识库检索、语义搜索等功能时需要配置 Embedding 模型。
Q: 一个模型可以多种类型吗?
A: 可以。例如 GPT-4o 可以同时作为 LLM 和 Vision 模型。
Q: 如何选择 Embedding 模型?
A:
- 英文为主 → text-embedding-3
- 中文为主 → BGE-M3
- 成本敏感 → 本地部署 BGE
配置问题
Q: Agent 中的 vision_model_id 是可选的吗?
A: 是的,如果不处理图片,可以不配置。但如果配置了,必须选择支持 Vision 的模型。
Q: Rerank 模型必须配置吗?
A: 不是必须的,但在知识库检索场景下,配置 Rerank 可以显著提升准确率。
Q: 如何测试 Embedding 模型?
A: 在模型管理页面测试时,输入一段文本,系统会返回向量维度信息。
性能问题
Q: Vision 模型比 LLM 慢吗?
A: 是的,因为需要处理图像,通常慢 2-5 秒。
Q: Embedding 响应很慢?
A:
- 检查 API Base URL 是否正确
- 考虑使用本地部署的 Embedding 模型
- 减少 batch size
Q: 如何提升检索准确率?
A:
- 使用高维度 Embedding 模型 (如 3072维)
- 配置 Rerank 模型二次排序
- 优化文档切分策略
