VetClaw:面向畜禽疾病筛查的端云多模态智能体系统
arXiv原文链接:https://arxiv.org/html/2607.26042v1
摘要
本文提出VetClaw——一套基于端云架构的畜禽早期疾病筛查多模态智能体系统。边缘侧搭载摄像头采集动物影像,搭配养殖户录入的病症文本,上传至云端视觉语言模型(VLM)完成零样本疾病分类。系统将智能体交互与工作流编排解耦:OpenClaw负责边缘设备的任务调度、工具调用、用户交互与消息通知;LangGraph实现带状态筛查流程管控,包含输入校验、图像预处理、模型调用、安全规则校验、条件分支路由、异常容错与结构化日志全链路能力。
相较于传统静态图像分类方案,VetClaw具备工具调用、流程管理、异常降级、疑难病例人工升级能力。实验结果表明:仅依靠图像输入的零样本识别效果存在明显瓶颈,影像+病症文本的多模态融合输入可大幅提升分类精度。本系统将单一静态预测模型升级为具备安全约束、故障自愈、流程可追溯的端到端智能筛查平台。
1 引言
动物生物安全核心目标是阻断传染性疫病在养殖群体内扩散,皮肤病是疫病爆发最典型的临床表征之一。人工智能在兽医诊疗领域已拥有大量落地案例,但动物无法自主口述症状,不同物种、生理结构、行为模式会造成病症表现差异极大,给自动诊断带来巨大挑战。
生成式多模态AI可融合影像、文字、养殖行为多维度观测证据,模拟兽医综合查体、病历、检测报告的诊断逻辑;智能体技术进一步突破静态单次预测局限,实现自适应推理、工具调用、长流程协同、个性化决策。
本文基于OpenClaw+LangGraph搭建VetClaw畜禽筛查智能流水线,采用两套公开畜禽疾病数据集完成零样本评测。硬件采用树莓派边缘设备搭配摄像头采集动物图像,上传云端VLM完成自动化疾病初筛。
2 相关基础技术与研究现状
2.1 OpenClaw
开源自主智能体框架,提供大模型、外部脚本、定时任务、通信通道的统一交互接口,负责边缘侧用户交互与任务调度。
2.2 LangGraph
基于图结构的有状态智能体工作流框架,以节点+条件边描述完整业务流程。每个节点执行独立操作(输入校验、模型调用、安全判定、日志存储等),可根据运行状态动态分支、重试、终止流程。
2.3 多模态人工智能
可同时处理文本、图像、音频、视频异构数据的AI体系,视觉语言模型(VLM)是典型代表,同时具备图像理解与文本推理生成能力。
2.4 国内外相关研究
现有兽医AI研究分为三大方向:
- 纯NLP系统:VetTag基于临床病历自动生成兽医诊断编码;
- 医疗多智能体:面向人类诊疗的问题检测、LLM对话诊断框架,无畜禽场景适配;
- 物联网养殖监测:基于体温、运动传感器做健康预警,缺少多模态图像智能体流程。
现有方案缺失端云智能体编排、图文融合推理、安全规则校验、异常病例升级一体化能力,VetClaw填补该空白。
2.5 本文三大核心贡献
- 提出基于OpenClaw+LangGraph的端云协同智能体VetClaw,树莓派边缘设备采集影像,云端VLM完成畜禽疾病筛查;
- 采用两套公开兽医数据集,在纯图像、纯文本、图文多模态三种输入范式下评测两款主流VLM零样本分类性能;
- 验证病症文本对VLM推理的增益,同时指出纯文本引导会存在标签泄露、输出不可控风险,提出规则化校验约束方案。
图1 VetClaw树莓派畜禽皮肤病预测端云整体架构
分层架构:边缘部署层 → 中间件OpenClaw → 云端推理层
3 VetClaw系统整体架构
系统分为边缘部署层、云端推理层两大模块,分工完全隔离:
3.1 边缘层(树莓派硬件)
硬件:8GB内存树莓派 + Camera Module 3摄像头;系统Python3.12
核心组件:
- OpenClaw:边缘主智能体,定时触发采集、接收用户病症文本、启动LangGraph工作流、下发筛查通知;
- 轻量本地LLM:仅做指令解析,不执行疾病分类;
- LangGraph工作流引擎:全流程状态管控,包含图像校验、预处理、API封装、模型请求、安全判定、日志存储、异常分支;
- 摄像头采集脚本、本地文件存储模块。
3.2 云端推理层
硬件:Intel Xeon + A100 80GB + 240GB内存
组件:
- FastAPI服务接口:接收边缘上传图像、病症文本,参数校验;
- Ollama托管双视觉大模型:Qwen3-VL-32B、InternVL3-38B;
- 持久化日志数据库,存储全量请求、预测结果。
3.3 完整业务工作流
- OpenClaw定时任务触发,调用Python摄像头脚本拍摄动物图像,本地时间戳存储;
- 用户可选录入皮肤、行为等病症描述文本;
- 启动LangGraph有状态流程,校验图像清晰度、尺寸、格式;
- 分两条分支:仅图像输入 / 图像+病症多模态输入;
- 图像预处理后上传谷歌云盘,生成访问链接封装进API请求;
- FastAPI转发图文至云端VLM,返回结构化疾病预测结果;
- LangGraph安全规则校验:低置信、冲突证据、紧急病症、接口报错自动触发重拍/重试/人工升级;
- 过滤专业诊断话术,仅输出初筛预警,禁止给出最终诊疗结论;
- 全流程结构化日志写入云端,OpenClaw推送筛查通知至用户。
架构设计核心优势
VLM仅作为推理工具,无权控制流程走向;所有重试、升级、输出过滤逻辑由LangGraph规则管控,流程可追溯、可审计;边缘仅轻量采集调度,重VLM推理全部上云,适配低算力嵌入式设备。
4 数据集与软硬件环境
4.1 评测数据集
两套公开畜禽图像数据集全部用于零样本测试:
- Pet Disease Images:1736张图像,22类动物疾病;
- Dogs Skin Disease:443张犬类皮肤病图像,4个病症类别。
4.2 边缘硬件与工具栈
- 设备:CanaKit树莓派8GB,128GB存储,Camera Module 3;
- 运行环境:Python3.12;
- 边缘智能:OpenClaw调度、LangGraph编排图像/请求流程;
- 图像存储:拍摄原图上传谷歌云端盘。
4.3 云端推理环境
- 模型:Qwen3-VL-32B、InternVL3-38B;
- 部署方案:Ollama托管 + FastAPI封装REST接口;
- 三类评测输入范式:纯图像、仅病症文本、图文融合多模态;
- 评测约束:Prompt剔除文件夹名称、文件名、疾病标签,杜绝标签泄露干扰零样本效果。
4.4 评测指标
准确率Acc、精确率Prec、召回Rec、宏F1分数。
| 数据集 | 模型 | 输入模式 | Acc(%) | Prec | Rec | F1 |
|---|---|---|---|---|---|---|
| 犬皮肤病数据集 | Qwen3-VL-32B | 纯图像 | 33.26 | 0.51 | 0.31 | 0.31 |
| 犬皮肤病数据集 | Qwen3-VL-32B | 仅文本 | 69.00 | 0.60 | 0.75 | 0.64 |
| 犬皮肤病数据集 | Qwen3-VL-32B | 图文融合 | 72.17 | 0.85 | 0.78 | 0.69 |
| 犬皮肤病数据集 | InternVL3-38B | 纯图像 | 31.90 | 0.41 | 0.35 | 0.31 |
| 犬皮肤病数据集 | InternVL3-38B | 仅文本 | 100.00 | 1.00 | 1.00 | 1.00 |
| 犬皮肤病数据集 | InternVL3-38B | 图文融合 | 94.34 | 0.94 | 0.95 | 0.94 |
| 宠物综合疾病集 | Qwen3-VL-32B | 纯图像 | 48.41 | 0.64 | 0.48 | 0.47 |
| 宠物综合疾病集 | Qwen3-VL-32B | 仅文本 | 86.90 | 0.79 | 0.86 | 0.82 |
| 宠物综合疾病集 | Qwen3-VL-32B | 图文融合 | 84.02 | 0.90 | 0.83 | 0.80 |
| 宠物综合疾病集 | InternVL3-38B | 纯图像 | 52.22 | 0.62 | 0.49 | |
| 宠物综合疾病集 | InternVL3-38B | 仅文本 | 86.04 | 0.79 | 0.86 | 0.81 |
| 宠物综合疾病集 | InternVL3-38B | 图文融合 | 88.11 | 0.93 | 0.88 | 0.86 |
5 系统实现与性能评测
5.1 工作流初始化流程
- OpenClaw定时触发筛查任务,调用摄像头拍摄动物图像;
- 图像本地校验(清晰度、尺寸、模糊度),不合格直接重拍;
- 存在病症文本则拼接为多模态输入;
- LangGraph封装请求,上传图像至谷歌云盘获取引用链接;
- HTTP请求发送至云端FastAPI,调用VLM推理;
- 返回结果进入安全校验节点:置信度低、冲突、急症自动升级人工复核;
- 输出仅为初筛预警,严禁生成临床确诊结论;
- 全链路时间戳、图像ID、预测结果、校验状态写入云端日志;
- 推送通知给养殖户,附带原图链接便于兽医复核。
5.2 图像预处理链路
LangGraph内置图像校验节点,校验维度:文件存在性、分辨率、文件大小、模糊程度、亮度、图片格式;不达标直接进入重拍分支。
图像不直接二进制传输,上传云端后仅传递文件URL,降低网络传输负载。
单次完整执行样例日志:
| 阶段 | 字段 | 数值 |
|---|---|---|
| 图像采集 | 硬件 | Camera Module 3 |
| 图像采集 | 时间戳 | 2026-06-03 |
| 图像采集 | 状态 | 成功 |
| 图像采集 | 文件大小 | 296 KB |
| 采集耗时 | 2820.47 ms | |
| 云端上传 | 存储位置 | Google Drive |
| 云端上传 | 文件ID | 20260603_125355.jpg |
| 上传状态 | 成功 | |
| 上传耗时 | 1977.86 ms | |
| VLM推理 | 模型 | Qwen3-VL-32B |
| 预测结果 | 猫牙科疾病 | |
| 推理耗时 | 925.3 ms |
5.3 VLM零样本性能分析
- 纯图像输入两类模型效果均极差,犬皮肤病数据集F1仅0.31左右;
- 仅病症文本输入基线大幅提升,InternVL3在犬数据集文本输入下达到100%准确率;
- 图文融合输入综合表现最优:兼顾视觉特征与文字病症上下文,精确率显著提升;
- 仅依赖图像无法完成可靠筛查,多模态融合是畜牧AI核心优化方向。
5.4 请求与响应处理规范
- LangGraph输出标准化JSON请求:图像云链接、病症文本、采集时间;
- FastAPI校验字段完整性,转发至Ollama VLM;
- VLM返回结构化预测、置信度、支撑依据;
- 返回数据回流LangGraph做规则校验:
- 校验输出是否符合预设格式;
- 判定置信度、证据冲突、紧急病症;
- 生成安全初筛通知,记录全链路日志;
- OpenClaw推送消息至养殖终端。
系统可统计端到端总耗时、分段延迟,区分采集、上传、云端推理各阶段开销,用于后续性能优化。
6 研究局限性
- 评测仅使用两套中小型公开畜禽数据集,样本多样性不足;
- 全部采用零样本Prompt推理,未针对畜牧数据微调模型,临床精准度存在上限;
- 预测结果高度依赖Prompt措辞、病症描述完整性;
- 摄像头固定拍摄角度,无法捕捉运动动物多角度病灶;
- 真实兽医诊疗还包含血常规、行为、音频等多类数据,本系统仅覆盖图像+文本;
- 未开展专业兽医人工盲测验证筛查可靠性。
7 结论
本文搭建VetClaw端云多模态智能体系统,基于OpenClaw做边缘调度、LangGraph管控完整疾病筛查工作流,树莓派嵌入式设备采集动物图像,云端VLM完成零样本疫病初筛。
实验证明:仅依靠动物图像识别精度极低,融合养殖户病症文本的多模态输入可显著提升疾病分类准确率。系统内置安全校验、异常重试、人工升级、全链路日志,规避大模型直接输出诊疗结论的安全风险。
后续研究计划:扩充大规模畜禽多模态数据集、对比非智能体静态流水线性能、完善安全规则体系、联合兽医完成临床实测。
伦理说明
本研究仅使用公开开源畜禽图像数据集,无养殖户隐私、动物敏感诊疗数据,不存在数据泄露风险。
资源链接汇总
- 论文HTML原文:https://arxiv.org/html/2607.26042v1
- 论文PDF原文:https://arxiv.org/pdf/2607.26042
- OpenClaw开源框架官网:https://openclaw.ai/
- LangGraph开源仓库:https://github.com/langchain-ai/langgraph
- 犬皮肤病数据集(Kaggle):https://www.kaggle.com/datasets/yashmotiani/dogs-skin-dataset
- 宠物综合疾病数据集(Kaggle):https://www.kaggle.com/datasets/smadive/pet-disease-images
- Qwen3-VL模型论文:arXiv:2511.21631
- InternVL3模型论文:arXiv:2504.10479