Skip to content

图片分析功能

Sira AI 支持在对话中发送图片,让 AI 识别和分析图片内容。无论是架构图、数据图表、产品照片还是文档截图,AI 都能理解并回答相关问题。

快速开始

步骤 1:确认模型支持

创建 Agent 时,选择支持 Vision(视觉) 能力的 AI 模型:

支持的模型

  • OpenAI:GPT-4o、GPT-4 Vision
  • Anthropic:Claude 3 Opus、Claude 3.5 Sonnet、Claude 3 Haiku
  • 阿里云:Qwen-VL-Plus、Qwen-VL-Max
  • Google:Gemini Pro Vision

配置提示: 在 Agent 配置页面,确保选择了带有 "Vision" 标记的模型。

步骤 2:发送图片

根据您使用的平台,有不同的发送方式:

企业微信 AI Bot

  • 直接在企业微信对话框发送图片
  • 或在文字消息中插入图片
  • 支持图文混合消息

Web 聊天客户端

在消息中粘贴图片 URL:

分析这张图片 https://example.com/chart.png

API 调用

发送 OpenAI 格式的多模态消息:

json
{
  "messages": [
    {
      "role": "user",
      "content": [
        {
          "type": "text",
          "text": "What's in this image?"
        },
        {
          "type": "image_url",
          "image_url": {
            "url": "https://example.com/image.jpg"
          }
        }
      ]
    }
  ]
}

步骤 3:AI 分析

AI 会自动识别图片并回答您的问题:

您:"分析这张销售趋势图"
AI:"这是一张折线图,展示了过去 12 个月的销售趋势:
1. 整体呈上升趋势
2. Q2(4-6月)增长最快
3. 8月有小幅回落
4. 目前处于历史高位
建议:保持当前策略,关注 8 月回落原因..."

支持的平台

平台图片支持发送方式
企业微信 AI Bot直接发送图片/图文混合
企业微信传统应用发送图片消息
Web 聊天客户端粘贴图片 URL
API ServiceOpenAI Vision 格式

实际应用场景

场景 1:图表分析

用户需求:分析销售数据图表

对话示例

用户:"这张图表显示什么趋势?[销售图表]"

AI:"这是一张柱状图,展示了各区域的销售额对比:

📊 数据洞察:
• 华东区:350万(最高)
• 华南区:280万
• 华北区:220万
• 西南区:150万

📈 趋势分析:
• 华东区遥遥领先,占总额 35%
• 西南区还有较大增长空间

💡 建议:
1. 加大西南区市场投入
2. 华东区保持当前策略
3. 可考虑区域间经验共享"

场景 2:技术架构评审

用户需求:评估系统架构图

对话示例

用户:"帮我看看这个架构有什么问题?[架构图]"

AI:"这是一个微服务架构设计,我注意到几个问题:

✅ 优点:
1. 服务拆分合理(用户、订单、支付独立)
2. 使用了 API Gateway 统一入口
3. 有 Redis 缓存层

⚠️ 潜在问题:
1. 缺少服务注册与发现机制
2. 没有看到消息队列,服务间可能耦合较紧
3. 建议添加熔断器(如 Hystrix)
4. 数据库直连,建议增加连接池

💡 优化建议:
1. 引入 Consul/Nacos 做服务发现
2. 增加 RabbitMQ/Kafka 解耦服务
3. 加入 Sentinel 做流量控制"

场景 3:产品图片识别

用户需求:推荐类似产品

对话示例

用户:"我想买类似的椅子,有推荐吗?[椅子照片]"

AI:"这是一款北欧风格的实木餐椅,我为您推荐几款相似产品:

🪑 产品特征:
• 风格:北欧简约
• 材质:实木框架
• 颜色:原木色
• 特点:弧形靠背

📋 推荐产品:
1. 宜家 EKEDALEN 餐椅
   - 相似度:95%
   - 价格:499 元
   - 特色:可叠放

2. 木智工坊橡木餐椅
   - 相似度:88%
   - 价格:680 元
   - 特色:全实木

3. 原始原素餐椅
   - 相似度:85%
   - 价格:550 元
   - 特色:环保涂装"

(注:需要配置产品搜索 MCP 工具)

场景 4:文档 OCR 提取

用户需求:提取发票信息

对话示例

用户:"帮我提取这张发票的信息 [发票照片]"

AI:"已识别发票信息如下:

📄 发票详情:
• 发票号码:No.12345678
• 开票日期:2025-10-14
• 购买方:ABC 科技有限公司
• 销售方:XYZ 贸易公司
• 税号:9144xxxxxxxxxx

💰 金额明细:
• 商品名称:办公用品
• 规格型号:-
• 数量:1
• 单价:5,000.00
• 金额:5,000.00
• 税率:13%
• 税额:650.00
• 价税合计:5,650.00

✅ 发票状态:信息完整,可用于报销"

场景 5:UI 设计反馈

用户需求:评估界面设计

编排器配置:协作模式(多专家)

  • Agent 1:视觉设计专家
  • Agent 2:UX 用户体验专家
  • Agent 3:前端技术专家

对话示例

用户:"评估这个登录页面设计 [UI 截图]"

→ 视觉设计专家:
"🎨 视觉分析:
• 配色:蓝白为主,符合企业应用风格
• 布局:居中对称,视觉平衡
• 字体:统一使用无衬线字体
• 留白:充足,不拥挤
评分:8/10"

→ UX 专家:
"👤 用户体验分析:
• 登录流程清晰,步骤简单
• 'remember me' 选项位置合理
• 建议:密码框添加显示/隐藏切换按钮
• 建议:错误提示文案可以更友好
评分:7.5/10"

→ 前端技术专家:
"💻 技术评估:
• 响应式布局,移动端兼容性好
• 实现难度:中等
• 预估开发时间:2-3 天
• 建议:加入骨架屏加载效果"

→ 综合评估:
"总体评分:7.8/10
优点:视觉专业,布局合理
改进:优化密码输入体验,增强错误提示
建议采纳并小幅优化"

配置指南

创建图片分析 Agent

  1. 进入 Agent System → Agents 页面

  2. 点击创建 Agent

  3. 填写基本信息:

    • 名称:vision_analyst
    • 显示名称:"图片分析专家"
  4. 选择 Vision 模型:

    • 模型:GPT-4o 或 Claude 3.5 Sonnet
    • 确保模型支持 Vision
  5. 系统提示词示例:

    你是一个专业的图片分析专家。
    
    当用户发送图片时,你需要:
    
    1. 仔细观察图片的所有细节
    2. 识别图片中的主要对象、文字、数据
    3. 分析图片的构图、颜色、风格等视觉元素
    4. 结合用户的问题给出针对性的回答
    
    对于不同类型的图片:
    • 数据图表:提取关键数据,分析趋势,给出洞察
    • 架构图:识别组件,分析设计,提出优化建议
    • 产品图片:描述特征,识别品牌,推荐相似产品
    • 文档/发票:进行 OCR 识别,结构化提取信息
    • UI 设计:评估视觉效果和用户体验
    
    回答要求:
    • 结构化组织内容(使用标题、列表)
    • 提供具体的数据和细节
    • 给出可操作的建议
    • 保持专业友好的语气
  6. (可选)添加 MCP 工具:

    • 如需网页搜索相似图片
    • 如需调用产品数据库查询
  7. 点击创建

创建编排器

简单场景:

  • 编排类型:单体 (Single)
  • 关联 Agent:"图片分析专家"

多专家场景(如 UI 评审):

  • 编排类型:协作 (Collaboration)
  • 协作策略:顺序 (Sequential)
  • Agents:
    1. 视觉设计专家
    2. UX 用户体验专家
    3. 技术专家

创建应用

  • 平台类型:根据需求选择

    • 企业微信 AI Bot(企业内部使用)
    • Web 聊天客户端(外部客户使用)
    • API Service(系统集成)
  • 关联编排器:选择刚创建的编排器

图片格式要求

支持的图片格式

✅ 支持:

  • JPG / JPEG
  • PNG
  • GIF
  • WebP
  • 企业微信加密图片(自动处理)

❌ 不支持:

  • PDF(需要先转换为图片)
  • SVG(需要先转换)
  • 视频(不支持)

图片大小

  • 推荐:< 20MB
  • 最大:根据 AI 模型限制
  • 分辨率:支持高清图片,但过大会增加分析时间

图片 URL 要求

如果使用 Web 聊天客户端:

  • ✅ 使用 HTTPS 公开链接
  • ✅ 确保 URL 可直接访问(无需登录)
  • ✅ 使用稳定的图床或 CDN
  • ❌ 避免需要认证的私有链接
  • ❌ 避免会过期的临时链接

编排模式对图片的支持

不同编排模式对图片分析的支持程度不同:

编排模式图片支持说明
Single(单体)✅ 完全支持Agent 直接接收图片
Collaboration(协作)✅ 完全支持所有 Agent 都能看到图片
Conditional(条件路由)✅ Agent 支持路由后的 Agent 能看图,但路由决策基于文本
Workflow(工作流)✅ 各步骤支持每个步骤的 Agent 都能收到图片
Supervisor(监督者)⚠️ 仅监督者工人 Agent 看不到图片(技术限制)
External(外部集成)✅ 看外部系统取决于 Dify/n8n 的支持

重要提示: 如果需要多个 Agent 都分析同一张图片,请使用 Collaboration(协作)模式,不要使用 Supervisor 模式。

常见问题

Q1: 为什么 AI 说看不到图片?

检查清单:

  1. ✅ Agent 使用的模型是否支持 Vision?

    • 查看模型名称是否包含 "Vision" 或 "4o" 等标识
    • GPT-4o、Claude 3 系列都支持
  2. ✅ 图片 URL 是否可访问?

    • 在浏览器打开 URL 测试
    • 确保无需登录即可查看
  3. ✅ 图片格式是否支持?

    • JPG、PNG、GIF、WebP 都支持
    • PDF、视频不支持
  4. ✅ 编排模式是否支持?

    • Supervisor 模式的工人 Agent 看不到图片
    • 改用 Collaboration 模式

Q2: 企业微信发送的图片为什么分析失败?

企业微信图片是加密的,Sira AI 会自动:

  1. 下载加密图片
  2. 解密图片
  3. 上传到临时存储
  4. 传递给 AI 分析

如果失败,可能原因:

  • 企业微信配置错误(Corp ID、Secret)
  • 网络问题导致下载失败
  • 存储服务异常

查看日志获取详细错误信息。

Q3: 图片分析的成本是多少?

Vision 模型通常比纯文本模型贵 3-5 倍

模型文本价格Vision 价格差异
GPT-4o$5/1M tokens$15/1M tokens3x
Claude 3 Opus$15/1M tokens$75/1M tokens5x

节省成本建议

  • 使用更便宜的 Vision 模型(如 GPT-4o mini)
  • 压缩图片大小
  • 只在确实需要时使用图片分析

Q4: 可以一次发送多张图片吗?

可以,支持一次发送多张图片:

Web 聊天

对比这三张图表:
图1:https://example.com/chart1.png
图2:https://example.com/chart2.png
图3:https://example.com/chart3.png

企业微信

  • 直接发送图文混合消息(多张图片)

建议

  • 单次请求不超过 5 张图片
  • 图片总大小 < 20MB

Q5: AI 能识别图片中的文字吗(OCR)?

可以。Vision 模型内置 OCR 能力:

支持识别

  • 中英文文字
  • 数字
  • 表格内容
  • 手写文字(准确度略低)

使用建议

  • 提示词中明确要求提取文字
  • 图片清晰、文字不要太小
  • 复杂表格可能需要引导 AI 按结构提取

示例提示词

系统提示词中加入:
"当图片包含文字或表格时,进行 OCR 识别并结构化输出"

Q6: Supervisor 模式的工人为什么看不到图片?

这是当前的技术限制(LangGraph handoff 机制导致)。

解决方案

  1. 改用 Collaboration(协作)模式

    • 所有 Agent 都能看到图片
    • 效果类似,但更灵活
  2. 在 Supervisor 中完成图片分析

    • 监督者 Agent 可以看到图片
    • 分析后将结果传递给工人 Agent

Q7: 图片分析速度慢怎么办?

Vision 模型分析图片通常比纯文本慢 2-3 倍

优化建议

  1. 压缩图片大小(降低分辨率)
  2. 使用更快的模型(如 GPT-4o mini)
  3. 缓存常见图片的分析结果
  4. 避免一次发送过多图片

Q8: 可以分析视频吗?

目前不支持直接分析视频。

替代方案

  1. 提取视频关键帧作为图片
  2. 逐帧分析(多张图片)
  3. 使用专门的视频分析 API

最佳实践

1. 提示词优化

针对图表分析

你是数据分析专家。分析图表时:
1. 识别图表类型(柱状图、折线图、饼图等)
2. 提取所有数字数据
3. 分析趋势和异常
4. 给出业务洞察和建议

针对 UI 设计

你是 UI/UX 设计专家。评估界面时:
1. 分析视觉设计(配色、布局、字体)
2. 评估用户体验(流程、交互)
3. 指出优点和改进点
4. 提供可操作的优化建议

针对技术架构

你是架构师。审查架构图时:
1. 识别所有组件和连接关系
2. 评估架构合理性
3. 指出潜在问题
4. 提出优化方案和最佳实践

2. 图片质量

  • ✅ 使用清晰、高分辨率的图片
  • ✅ 确保文字清晰可读
  • ✅ 避免过度压缩
  • ❌ 避免模糊、低分辨率的图片

3. 提问技巧

模糊提问 ❌:

看看这张图

清晰提问 ✅:

分析这张销售趋势图,回答:
1. 哪个季度销售最好?
2. 是否有异常波动?
3. 未来趋势预测

4. 组合使用工具

给 Agent 配置 MCP 工具,增强分析能力:

示例

  • 图片:产品照片
  • 工具:网页搜索
  • 效果:识别产品后,自动搜索价格和评价

Agent 配置

  • 模型:GPT-4 Vision
  • 工具:Web Search MCP 工具
  • 提示词:"识别产品后,自动搜索最新价格和用户评价"

高级应用

场景:智能客服图片分流

需求:根据用户发送的图片类型,自动分配给合适的客服

方案

  • 编排类型:Conditional(条件路由)
  • 创建一个"图片分类" Agent(使用 Vision 模型)
  • 根据图片分类结果路由:
    • 产品图片 → 销售客服
    • 技术截图 → 技术客服
    • 发票图片 → 财务客服

实现: 在条件路由的 LLM 兜底模式中,AI 会智能识别图片类型并路由。

场景:批量图片处理

需求:一次处理多张图片并汇总分析

方案

  • 编排类型:Collaboration(协作并行模式)
  • 为每张图片创建一个 Agent 实例
  • 并行分析后汇总

(需要自定义开发,标准配置暂不支持)

下一步

Apache-2.0 Licensed