图片分析功能
Sira AI 支持在对话中发送图片,让 AI 识别和分析图片内容。无论是架构图、数据图表、产品照片还是文档截图,AI 都能理解并回答相关问题。
快速开始
步骤 1:确认模型支持
创建 Agent 时,选择支持 Vision(视觉) 能力的 AI 模型:
支持的模型:
- OpenAI:GPT-4o、GPT-4 Vision
- Anthropic:Claude 3 Opus、Claude 3.5 Sonnet、Claude 3 Haiku
- 阿里云:Qwen-VL-Plus、Qwen-VL-Max
- Google:Gemini Pro Vision
配置提示: 在 Agent 配置页面,确保选择了带有 "Vision" 标记的模型。
步骤 2:发送图片
根据您使用的平台,有不同的发送方式:
企业微信 AI Bot
- 直接在企业微信对话框发送图片
- 或在文字消息中插入图片
- 支持图文混合消息
Web 聊天客户端
在消息中粘贴图片 URL:
分析这张图片 https://example.com/chart.pngAPI 调用
发送 OpenAI 格式的多模态消息:
{
"messages": [
{
"role": "user",
"content": [
{
"type": "text",
"text": "What's in this image?"
},
{
"type": "image_url",
"image_url": {
"url": "https://example.com/image.jpg"
}
}
]
}
]
}步骤 3:AI 分析
AI 会自动识别图片并回答您的问题:
您:"分析这张销售趋势图"
AI:"这是一张折线图,展示了过去 12 个月的销售趋势:
1. 整体呈上升趋势
2. Q2(4-6月)增长最快
3. 8月有小幅回落
4. 目前处于历史高位
建议:保持当前策略,关注 8 月回落原因..."支持的平台
| 平台 | 图片支持 | 发送方式 |
|---|---|---|
| 企业微信 AI Bot | ✅ | 直接发送图片/图文混合 |
| 企业微信传统应用 | ✅ | 发送图片消息 |
| Web 聊天客户端 | ✅ | 粘贴图片 URL |
| API Service | ✅ | OpenAI Vision 格式 |
实际应用场景
场景 1:图表分析
用户需求:分析销售数据图表
对话示例:
用户:"这张图表显示什么趋势?[销售图表]"
AI:"这是一张柱状图,展示了各区域的销售额对比:
📊 数据洞察:
• 华东区:350万(最高)
• 华南区:280万
• 华北区:220万
• 西南区:150万
📈 趋势分析:
• 华东区遥遥领先,占总额 35%
• 西南区还有较大增长空间
💡 建议:
1. 加大西南区市场投入
2. 华东区保持当前策略
3. 可考虑区域间经验共享"场景 2:技术架构评审
用户需求:评估系统架构图
对话示例:
用户:"帮我看看这个架构有什么问题?[架构图]"
AI:"这是一个微服务架构设计,我注意到几个问题:
✅ 优点:
1. 服务拆分合理(用户、订单、支付独立)
2. 使用了 API Gateway 统一入口
3. 有 Redis 缓存层
⚠️ 潜在问题:
1. 缺少服务注册与发现机制
2. 没有看到消息队列,服务间可能耦合较紧
3. 建议添加熔断器(如 Hystrix)
4. 数据库直连,建议增加连接池
💡 优化建议:
1. 引入 Consul/Nacos 做服务发现
2. 增加 RabbitMQ/Kafka 解耦服务
3. 加入 Sentinel 做流量控制"场景 3:产品图片识别
用户需求:推荐类似产品
对话示例:
用户:"我想买类似的椅子,有推荐吗?[椅子照片]"
AI:"这是一款北欧风格的实木餐椅,我为您推荐几款相似产品:
🪑 产品特征:
• 风格:北欧简约
• 材质:实木框架
• 颜色:原木色
• 特点:弧形靠背
📋 推荐产品:
1. 宜家 EKEDALEN 餐椅
- 相似度:95%
- 价格:499 元
- 特色:可叠放
2. 木智工坊橡木餐椅
- 相似度:88%
- 价格:680 元
- 特色:全实木
3. 原始原素餐椅
- 相似度:85%
- 价格:550 元
- 特色:环保涂装"
(注:需要配置产品搜索 MCP 工具)场景 4:文档 OCR 提取
用户需求:提取发票信息
对话示例:
用户:"帮我提取这张发票的信息 [发票照片]"
AI:"已识别发票信息如下:
📄 发票详情:
• 发票号码:No.12345678
• 开票日期:2025-10-14
• 购买方:ABC 科技有限公司
• 销售方:XYZ 贸易公司
• 税号:9144xxxxxxxxxx
💰 金额明细:
• 商品名称:办公用品
• 规格型号:-
• 数量:1
• 单价:5,000.00
• 金额:5,000.00
• 税率:13%
• 税额:650.00
• 价税合计:5,650.00
✅ 发票状态:信息完整,可用于报销"场景 5:UI 设计反馈
用户需求:评估界面设计
编排器配置:协作模式(多专家)
- Agent 1:视觉设计专家
- Agent 2:UX 用户体验专家
- Agent 3:前端技术专家
对话示例:
用户:"评估这个登录页面设计 [UI 截图]"
→ 视觉设计专家:
"🎨 视觉分析:
• 配色:蓝白为主,符合企业应用风格
• 布局:居中对称,视觉平衡
• 字体:统一使用无衬线字体
• 留白:充足,不拥挤
评分:8/10"
→ UX 专家:
"👤 用户体验分析:
• 登录流程清晰,步骤简单
• 'remember me' 选项位置合理
• 建议:密码框添加显示/隐藏切换按钮
• 建议:错误提示文案可以更友好
评分:7.5/10"
→ 前端技术专家:
"💻 技术评估:
• 响应式布局,移动端兼容性好
• 实现难度:中等
• 预估开发时间:2-3 天
• 建议:加入骨架屏加载效果"
→ 综合评估:
"总体评分:7.8/10
优点:视觉专业,布局合理
改进:优化密码输入体验,增强错误提示
建议采纳并小幅优化"配置指南
创建图片分析 Agent
进入 Agent System → Agents 页面
点击创建 Agent
填写基本信息:
- 名称:
vision_analyst - 显示名称:"图片分析专家"
- 名称:
选择 Vision 模型:
- 模型:GPT-4o 或 Claude 3.5 Sonnet
- 确保模型支持 Vision
系统提示词示例:
你是一个专业的图片分析专家。 当用户发送图片时,你需要: 1. 仔细观察图片的所有细节 2. 识别图片中的主要对象、文字、数据 3. 分析图片的构图、颜色、风格等视觉元素 4. 结合用户的问题给出针对性的回答 对于不同类型的图片: • 数据图表:提取关键数据,分析趋势,给出洞察 • 架构图:识别组件,分析设计,提出优化建议 • 产品图片:描述特征,识别品牌,推荐相似产品 • 文档/发票:进行 OCR 识别,结构化提取信息 • UI 设计:评估视觉效果和用户体验 回答要求: • 结构化组织内容(使用标题、列表) • 提供具体的数据和细节 • 给出可操作的建议 • 保持专业友好的语气(可选)添加 MCP 工具:
- 如需网页搜索相似图片
- 如需调用产品数据库查询
点击创建
创建编排器
简单场景:
- 编排类型:单体 (Single)
- 关联 Agent:"图片分析专家"
多专家场景(如 UI 评审):
- 编排类型:协作 (Collaboration)
- 协作策略:顺序 (Sequential)
- Agents:
- 视觉设计专家
- UX 用户体验专家
- 技术专家
创建应用
平台类型:根据需求选择
- 企业微信 AI Bot(企业内部使用)
- Web 聊天客户端(外部客户使用)
- API Service(系统集成)
关联编排器:选择刚创建的编排器
图片格式要求
支持的图片格式
✅ 支持:
- JPG / JPEG
- PNG
- GIF
- WebP
- 企业微信加密图片(自动处理)
❌ 不支持:
- PDF(需要先转换为图片)
- SVG(需要先转换)
- 视频(不支持)
图片大小
- 推荐:< 20MB
- 最大:根据 AI 模型限制
- 分辨率:支持高清图片,但过大会增加分析时间
图片 URL 要求
如果使用 Web 聊天客户端:
- ✅ 使用 HTTPS 公开链接
- ✅ 确保 URL 可直接访问(无需登录)
- ✅ 使用稳定的图床或 CDN
- ❌ 避免需要认证的私有链接
- ❌ 避免会过期的临时链接
编排模式对图片的支持
不同编排模式对图片分析的支持程度不同:
| 编排模式 | 图片支持 | 说明 |
|---|---|---|
| Single(单体) | ✅ 完全支持 | Agent 直接接收图片 |
| Collaboration(协作) | ✅ 完全支持 | 所有 Agent 都能看到图片 |
| Conditional(条件路由) | ✅ Agent 支持 | 路由后的 Agent 能看图,但路由决策基于文本 |
| Workflow(工作流) | ✅ 各步骤支持 | 每个步骤的 Agent 都能收到图片 |
| Supervisor(监督者) | ⚠️ 仅监督者 | 工人 Agent 看不到图片(技术限制) |
| External(外部集成) | ✅ 看外部系统 | 取决于 Dify/n8n 的支持 |
重要提示: 如果需要多个 Agent 都分析同一张图片,请使用 Collaboration(协作)模式,不要使用 Supervisor 模式。
常见问题
Q1: 为什么 AI 说看不到图片?
检查清单:
✅ Agent 使用的模型是否支持 Vision?
- 查看模型名称是否包含 "Vision" 或 "4o" 等标识
- GPT-4o、Claude 3 系列都支持
✅ 图片 URL 是否可访问?
- 在浏览器打开 URL 测试
- 确保无需登录即可查看
✅ 图片格式是否支持?
- JPG、PNG、GIF、WebP 都支持
- PDF、视频不支持
✅ 编排模式是否支持?
- Supervisor 模式的工人 Agent 看不到图片
- 改用 Collaboration 模式
Q2: 企业微信发送的图片为什么分析失败?
企业微信图片是加密的,Sira AI 会自动:
- 下载加密图片
- 解密图片
- 上传到临时存储
- 传递给 AI 分析
如果失败,可能原因:
- 企业微信配置错误(Corp ID、Secret)
- 网络问题导致下载失败
- 存储服务异常
查看日志获取详细错误信息。
Q3: 图片分析的成本是多少?
Vision 模型通常比纯文本模型贵 3-5 倍:
| 模型 | 文本价格 | Vision 价格 | 差异 |
|---|---|---|---|
| GPT-4o | $5/1M tokens | $15/1M tokens | 3x |
| Claude 3 Opus | $15/1M tokens | $75/1M tokens | 5x |
节省成本建议:
- 使用更便宜的 Vision 模型(如 GPT-4o mini)
- 压缩图片大小
- 只在确实需要时使用图片分析
Q4: 可以一次发送多张图片吗?
可以,支持一次发送多张图片:
Web 聊天:
对比这三张图表:
图1:https://example.com/chart1.png
图2:https://example.com/chart2.png
图3:https://example.com/chart3.png企业微信:
- 直接发送图文混合消息(多张图片)
建议:
- 单次请求不超过 5 张图片
- 图片总大小 < 20MB
Q5: AI 能识别图片中的文字吗(OCR)?
可以。Vision 模型内置 OCR 能力:
支持识别:
- 中英文文字
- 数字
- 表格内容
- 手写文字(准确度略低)
使用建议:
- 提示词中明确要求提取文字
- 图片清晰、文字不要太小
- 复杂表格可能需要引导 AI 按结构提取
示例提示词:
系统提示词中加入:
"当图片包含文字或表格时,进行 OCR 识别并结构化输出"Q6: Supervisor 模式的工人为什么看不到图片?
这是当前的技术限制(LangGraph handoff 机制导致)。
解决方案:
改用 Collaboration(协作)模式
- 所有 Agent 都能看到图片
- 效果类似,但更灵活
在 Supervisor 中完成图片分析
- 监督者 Agent 可以看到图片
- 分析后将结果传递给工人 Agent
Q7: 图片分析速度慢怎么办?
Vision 模型分析图片通常比纯文本慢 2-3 倍。
优化建议:
- 压缩图片大小(降低分辨率)
- 使用更快的模型(如 GPT-4o mini)
- 缓存常见图片的分析结果
- 避免一次发送过多图片
Q8: 可以分析视频吗?
目前不支持直接分析视频。
替代方案:
- 提取视频关键帧作为图片
- 逐帧分析(多张图片)
- 使用专门的视频分析 API
最佳实践
1. 提示词优化
针对图表分析:
你是数据分析专家。分析图表时:
1. 识别图表类型(柱状图、折线图、饼图等)
2. 提取所有数字数据
3. 分析趋势和异常
4. 给出业务洞察和建议针对 UI 设计:
你是 UI/UX 设计专家。评估界面时:
1. 分析视觉设计(配色、布局、字体)
2. 评估用户体验(流程、交互)
3. 指出优点和改进点
4. 提供可操作的优化建议针对技术架构:
你是架构师。审查架构图时:
1. 识别所有组件和连接关系
2. 评估架构合理性
3. 指出潜在问题
4. 提出优化方案和最佳实践2. 图片质量
- ✅ 使用清晰、高分辨率的图片
- ✅ 确保文字清晰可读
- ✅ 避免过度压缩
- ❌ 避免模糊、低分辨率的图片
3. 提问技巧
模糊提问 ❌:
看看这张图清晰提问 ✅:
分析这张销售趋势图,回答:
1. 哪个季度销售最好?
2. 是否有异常波动?
3. 未来趋势预测4. 组合使用工具
给 Agent 配置 MCP 工具,增强分析能力:
示例:
- 图片:产品照片
- 工具:网页搜索
- 效果:识别产品后,自动搜索价格和评价
Agent 配置:
- 模型:GPT-4 Vision
- 工具:Web Search MCP 工具
- 提示词:"识别产品后,自动搜索最新价格和用户评价"
高级应用
场景:智能客服图片分流
需求:根据用户发送的图片类型,自动分配给合适的客服
方案:
- 编排类型:Conditional(条件路由)
- 创建一个"图片分类" Agent(使用 Vision 模型)
- 根据图片分类结果路由:
- 产品图片 → 销售客服
- 技术截图 → 技术客服
- 发票图片 → 财务客服
实现: 在条件路由的 LLM 兜底模式中,AI 会智能识别图片类型并路由。
场景:批量图片处理
需求:一次处理多张图片并汇总分析
方案:
- 编排类型:Collaboration(协作并行模式)
- 为每张图片创建一个 Agent 实例
- 并行分析后汇总
(需要自定义开发,标准配置暂不支持)
