Skip to content

多模型配置

Sira AI 支持 4 种模型类型,可以为不同任务配置专门的模型,实现最佳性能和成本效益。

模型类型概述

四种模型类型

类型名称用途典型模型
LLM大语言模型对话、文本生成、推理GPT-4o, Claude 3.5, DeepSeek
EMBEDDING嵌入模型向量化、语义检索、相似度计算text-embedding-3, BGE-M3
VISION视觉模型图像理解、多模态任务GPT-4o, Claude 3.5 Sonnet
RERANK重排序模型搜索结果优化、相关性排序BGE-Reranker, Cohere Rerank

一个模型,多种类型

创建模型时可以勾选多个类型,例如:

  • GPT-4o: 勾选 LLM + VISION (既能对话又能看图)
  • text-embedding-3: 仅勾选 EMBEDDING (专注向量化)
  • Claude 3.5 Sonnet: 勾选 LLM + VISION

LLM (大语言模型)

功能

  • 对话交互: 回答用户问题、多轮对话
  • 内容生成: 撰写文章、代码、邮件等
  • 推理分析: 逻辑推理、数据分析、决策支持
  • 知识问答: 基于知识库的问答

推荐模型

OpenAI 系列:

  • gpt-4o-2024-05-13 - 最强综合能力,支持多模态
  • gpt-4o-mini - 性价比高,适合日常对话
  • gpt-3.5-turbo - 经济实惠,响应快速

Claude 系列:

  • claude-3-5-sonnet-20241022 - 长文本处理,推理能力强
  • claude-3-5-haiku-20241022 - 快速响应,成本低

DeepSeek 系列:

  • deepseek-chat - 性价比极高的中文模型
  • deepseek-coder - 代码生成专家

Qwen 系列:

  • qwen-plus - 通义千问高级版
  • qwen-turbo - 快速响应版本

使用场景

客服助手:

模型: GPT-3.5-turbo 或 DeepSeek Chat
原因: 成本低,响应快,满足日常咨询需求

内容创作:

模型: GPT-4o 或 Claude 3.5 Sonnet
原因: 创意能力强,文本质量高

技术支持:

模型: DeepSeek Coder
原因: 代码理解强,技术问题解决能力好

配置示例

创建 LLM 模型:

  1. 进入 AI 模型配置模型管理添加模型
  2. 填写基础信息:
    • 名称: GPT-4o 生产环境
    • 提供商: openai
    • 模型标识: gpt-4o-2024-05-13
    • 模型类型: 勾选 LLMVISION
  3. 配置 API:
    • API Key: 输入 OpenAI API 密钥
  4. 调整参数:
    • Temperature: 0.7
    • Max Tokens: 2000
  5. 保存并测试

EMBEDDING (嵌入模型)

功能

  • 文本向量化: 将文本转换为高维向量
  • 语义检索: 找到语义相似的文本
  • 相似度计算: 计算文本之间的相似度
  • 聚类分析: 对文本进行聚类

推荐模型

OpenAI 系列:

  • text-embedding-3-large - 3072维,最高精度
  • text-embedding-3-small - 1536维,性价比高
  • text-embedding-ada-002 - 传统版本,稳定可靠

开源模型:

  • BAAI/bge-large-zh-v1.5 - 中文嵌入模型
  • BAAI/bge-m3 - 多语言嵌入模型

使用场景

知识库检索:

场景: RAG (检索增强生成)
流程:
1. 将文档切分为片段
2. 使用 Embedding 模型向量化
3. 用户提问时,将问题向量化
4. 找到最相似的文档片段
5. 将片段传给 LLM 生成回答

语义搜索:

场景: 智能文档搜索
优势: 不依赖关键词,理解语义含义
示例: 搜索"如何提升销售" 可以匹配到 "增加营收的方法"

内容推荐:

场景: 相似内容推荐
流程:
1. 对所有内容进行向量化
2. 计算向量相似度
3. 推荐相似内容给用户

配置示例

创建 Embedding 模型:

  1. 添加模型:
    • 名称: OpenAI Embedding Large
    • 提供商: openai
    • 模型标识: text-embedding-3-large
    • 模型类型: 仅勾选 EMBEDDING
    • 输出维度(embedding_dimensions): 勾选 EMBEDDING 后出现此输入框,如 3072(text-embedding-3-large)。不配置时 RAG 入库会按 1024 假设并可能报错
  2. 配置 API Key
  3. 保存

在 Agent 中使用:

python
# Agent 配置中指定 Embedding 模型
{
  "name": "知识库助手",
  "llm_model_id": "gpt-4o的ID",
  "embedding_model_id": "embedding模型的ID",  // 用于向量检索
  "tools": ["knowledge_base_search"]
}

VISION (视觉模型)

功能

  • 图像理解: 识别图像中的物体、场景、文字
  • 图像描述: 生成图像的文字描述
  • 视觉问答: 回答关于图像的问题
  • 多模态推理: 结合图像和文本进行推理

推荐模型

支持 Vision 的模型:

  • gpt-4o-2024-05-13 (OpenAI) - 综合能力最强
  • gpt-4-turbo (OpenAI) - 成熟稳定
  • claude-3-5-sonnet-20241022 (Claude) - 视觉理解精准
  • qwen-vl-plus (Qwen) - 中文视觉模型

使用场景

图片咨询:

场景: 用户发送产品图片咨询
处理: Vision 模型识别图片内容 → LLM 生成回答
示例:
用户: [上传手机截图] "这个报错怎么解决?"
AI: 识别截图中的错误信息,提供解决方案

图表分析:

场景: 分析数据图表
处理: Vision 模型理解图表 → LLM 分析趋势
示例:
用户: [上传销售趋势图] "分析一下销售情况"
AI: 识别图表数据,分析销售趋势和原因

文档OCR:

场景: 提取图片中的文字
处理: Vision 模型识别文字 → 结构化输出
示例:
用户: [上传名片照片] "保存这个联系人"
AI: 提取姓名、电话、邮箱等信息

配置示例

创建 Vision 模型:

  1. 添加模型:
    • 名称: GPT-4o Vision
    • 提供商: openai
    • 模型标识: gpt-4o-2024-05-13
    • 模型类型: 勾选 LLM + VISION
  2. 配置 API Key
  3. 保存

在 Application 中启用多模态:

  • 企业微信 AI Bot 自动支持图片消息
  • Web 客户端支持图片上传
  • API Service 支持 image_url 参数

RERANK (重排序模型)

功能

  • 相关性评分: 评估文本与查询的相关性
  • 结果重排序: 对搜索结果按相关性重新排序
  • 精准匹配: 提升检索准确率

推荐模型

仅支持远程 API(2026-06-12)

内置的本地 rerank(进程内推理)已移除。现在 rerank 只支持远程 API —— 通过 tei 提供商接入自部署的 TEI 服务(默认 http://reranker:80,可跑 BGE-Reranker 等),或接入 Cohere / Jina 等商业 API。

自部署(TEI 服务):

  • BAAI/bge-reranker-v2-m3 - 多语言重排序
  • BAAI/bge-reranker-large - 中文重排序

商业 API:

  • Cohere Rerank API
  • Jina Rerank API

使用场景

知识库检索优化:

流程:
1. Embedding 模型初步检索 (召回100条)
2. Rerank 模型精准排序 (返回Top 5)
3. LLM 基于Top 5生成回答

效果: 提升检索准确率,减少噪音

搜索结果优化:

场景: 企业内部文档搜索
处理:
1. 用户搜索 "销售政策"
2. Embedding 召回50篇相关文档
3. Rerank 按相关性重排序
4. 返回最相关的Top 10

配置示例

创建 Rerank 模型:

  1. 添加模型:
    • 名称: BGE Reranker
    • 提供商: tei(自部署 TEI 服务)或 custom(远程 API)
    • API Base URL: TEI 服务地址(tei 默认 http://reranker:80
    • 模型类型: 仅勾选 RERANK
  2. 保存

在 RAG 中使用:

python
# Agent Tool 配置
{
  "tool": "knowledge_base_search",
  "config": {
    "embedding_model_id": "embedding模型ID",
    "rerank_model_id": "rerank模型ID",  // 可选,提升精准度
    "top_k": 5
  }
}

多模型协作

Agent 多模型配置

一个 Agent 可以同时配置多种类型的模型:

json
{
  "name": "智能助手",
  "llm_model_id": "gpt-4o的ID",           // 主对话模型
  "embedding_model_id": "embedding的ID",  // 知识库检索
  "vision_model_id": "gpt-4o的ID",       // 图像理解(可选)
  "rerank_model_id": "rerank的ID",       // 重排序(可选)
  "tools": ["knowledge_base_search", "web_search"]
}

典型协作场景

场景 1: 知识库助手

用户提问

Embedding 模型: 向量化问题

向量数据库: 检索相似文档

Rerank 模型: 重排序结果 (可选)

LLM 模型: 基于检索结果生成回答

场景 2: 多模态客服

用户发送图片 + 文字

Vision 模型: 理解图片内容

LLM 模型: 结合图片和文字生成回答

场景 3: 智能搜索

用户搜索查询

Embedding 模型: 语义检索

Rerank 模型: 精准排序

LLM 模型: 总结搜索结果

成本优化策略

按任务选择模型

日常对话 → GPT-3.5 / DeepSeek Chat
成本: $0.5-2 / 1M tokens

复杂推理 → GPT-4o / Claude 3.5 Sonnet
成本: $5-15 / 1M tokens

图像理解 → GPT-4o (必需)
成本: $5-15 / 1M tokens + 图片费用

向量检索 → text-embedding-3-small
成本: $0.02 / 1M tokens

重排序 → 本地部署 BGE-Reranker
成本: 免费(仅硬件成本)

混合策略

策略 1: 分层模型

  • 简单问题 → 经济型 LLM
  • 复杂问题 → 高端 LLM
  • 图片问题 → Vision 模型

策略 2: 本地 + 云端

  • Embedding/Rerank → 本地部署(免费)
  • LLM → 云端 API (按需付费)

模型性能对比

LLM 对比

模型速度质量成本中文推荐场景
GPT-4o⚡⚡⭐⭐⭐⭐⭐💰💰💰⭐⭐⭐⭐复杂任务
GPT-3.5⚡⚡⚡⭐⭐⭐💰⭐⭐⭐日常对话
Claude 3.5⚡⚡⭐⭐⭐⭐⭐💰💰💰⭐⭐⭐长文本分析
DeepSeek⚡⚡⚡⭐⭐⭐⭐💰⭐⭐⭐⭐⭐中文任务

Embedding 对比

模型维度性能成本语言
text-embedding-3-large3072⭐⭐⭐⭐⭐💰💰多语言
text-embedding-3-small1536⭐⭐⭐⭐💰多语言
BGE-M31024⭐⭐⭐⭐免费多语言

常见问题

模型选择

Q: LLM 模型必须配置吗?

A: 是的,每个 Agent 必须配置至少一个 LLM 模型用于对话。

Q: Embedding 模型什么时候需要?

A: 当使用知识库检索、语义搜索等功能时需要配置 Embedding 模型。

Q: 一个模型可以多种类型吗?

A: 可以。例如 GPT-4o 可以同时作为 LLM 和 Vision 模型。

Q: 如何选择 Embedding 模型?

A:

  • 英文为主 → text-embedding-3
  • 中文为主 → BGE-M3
  • 成本敏感 → 本地部署 BGE

配置问题

Q: Agent 中的 vision_model_id 是可选的吗?

A: 是的,如果不处理图片,可以不配置。但如果配置了,必须选择支持 Vision 的模型。

Q: Rerank 模型必须配置吗?

A: 不是必须的,但在知识库检索场景下,配置 Rerank 可以显著提升准确率。

Q: 如何测试 Embedding 模型?

A: 在模型管理页面测试时,输入一段文本,系统会返回向量维度信息。

性能问题

Q: Vision 模型比 LLM 慢吗?

A: 是的,因为需要处理图像,通常慢 2-5 秒。

Q: Embedding 响应很慢?

A:

  • 检查 API Base URL 是否正确
  • 考虑使用本地部署的 Embedding 模型
  • 减少 batch size

Q: 如何提升检索准确率?

A:

  1. 使用高维度 Embedding 模型 (如 3072维)
  2. 配置 Rerank 模型二次排序
  3. 优化文档切分策略

下一步

Apache-2.0 Licensed