news 2026/7/30 17:16:25

VetClaw:面向畜禽疾病筛查的端云多模态智能体系统

作者头像

张小明

前端开发工程师

1.2k 24
文章封面图
VetClaw:面向畜禽疾病筛查的端云多模态智能体系统

VetClaw:面向畜禽疾病筛查的端云多模态智能体系统

arXiv原文链接:https://arxiv.org/html/2607.26042v1

摘要

本文提出VetClaw——一套基于端云架构的畜禽早期疾病筛查多模态智能体系统。边缘侧搭载摄像头采集动物影像,搭配养殖户录入的病症文本,上传至云端视觉语言模型(VLM)完成零样本疾病分类。系统将智能体交互与工作流编排解耦:OpenClaw负责边缘设备的任务调度、工具调用、用户交互与消息通知;LangGraph实现带状态筛查流程管控,包含输入校验、图像预处理、模型调用、安全规则校验、条件分支路由、异常容错与结构化日志全链路能力。
相较于传统静态图像分类方案,VetClaw具备工具调用、流程管理、异常降级、疑难病例人工升级能力。实验结果表明:仅依靠图像输入的零样本识别效果存在明显瓶颈,影像+病症文本的多模态融合输入可大幅提升分类精度。本系统将单一静态预测模型升级为具备安全约束、故障自愈、流程可追溯的端到端智能筛查平台。

1 引言

动物生物安全核心目标是阻断传染性疫病在养殖群体内扩散,皮肤病是疫病爆发最典型的临床表征之一。人工智能在兽医诊疗领域已拥有大量落地案例,但动物无法自主口述症状,不同物种、生理结构、行为模式会造成病症表现差异极大,给自动诊断带来巨大挑战。
生成式多模态AI可融合影像、文字、养殖行为多维度观测证据,模拟兽医综合查体、病历、检测报告的诊断逻辑;智能体技术进一步突破静态单次预测局限,实现自适应推理、工具调用、长流程协同、个性化决策。
本文基于OpenClaw+LangGraph搭建VetClaw畜禽筛查智能流水线,采用两套公开畜禽疾病数据集完成零样本评测。硬件采用树莓派边缘设备搭配摄像头采集动物图像,上传云端VLM完成自动化疾病初筛。

2 相关基础技术与研究现状

2.1 OpenClaw

开源自主智能体框架,提供大模型、外部脚本、定时任务、通信通道的统一交互接口,负责边缘侧用户交互与任务调度。

2.2 LangGraph

基于图结构的有状态智能体工作流框架,以节点+条件边描述完整业务流程。每个节点执行独立操作(输入校验、模型调用、安全判定、日志存储等),可根据运行状态动态分支、重试、终止流程。

2.3 多模态人工智能

可同时处理文本、图像、音频、视频异构数据的AI体系,视觉语言模型(VLM)是典型代表,同时具备图像理解与文本推理生成能力。

2.4 国内外相关研究

现有兽医AI研究分为三大方向:

  1. 纯NLP系统:VetTag基于临床病历自动生成兽医诊断编码;
  2. 医疗多智能体:面向人类诊疗的问题检测、LLM对话诊断框架,无畜禽场景适配;
  3. 物联网养殖监测:基于体温、运动传感器做健康预警,缺少多模态图像智能体流程。
    现有方案缺失端云智能体编排、图文融合推理、安全规则校验、异常病例升级一体化能力,VetClaw填补该空白。

2.5 本文三大核心贡献

  1. 提出基于OpenClaw+LangGraph的端云协同智能体VetClaw,树莓派边缘设备采集影像,云端VLM完成畜禽疾病筛查;
  2. 采用两套公开兽医数据集,在纯图像、纯文本、图文多模态三种输入范式下评测两款主流VLM零样本分类性能;
  3. 验证病症文本对VLM推理的增益,同时指出纯文本引导会存在标签泄露、输出不可控风险,提出规则化校验约束方案。

图1 VetClaw树莓派畜禽皮肤病预测端云整体架构
分层架构:边缘部署层 → 中间件OpenClaw → 云端推理层

3 VetClaw系统整体架构

系统分为边缘部署层云端推理层两大模块,分工完全隔离:

3.1 边缘层(树莓派硬件)

硬件:8GB内存树莓派 + Camera Module 3摄像头;系统Python3.12
核心组件:

  1. OpenClaw:边缘主智能体,定时触发采集、接收用户病症文本、启动LangGraph工作流、下发筛查通知;
  2. 轻量本地LLM:仅做指令解析,不执行疾病分类;
  3. LangGraph工作流引擎:全流程状态管控,包含图像校验、预处理、API封装、模型请求、安全判定、日志存储、异常分支;
  4. 摄像头采集脚本、本地文件存储模块。

3.2 云端推理层

硬件:Intel Xeon + A100 80GB + 240GB内存
组件:

  1. FastAPI服务接口:接收边缘上传图像、病症文本,参数校验;
  2. Ollama托管双视觉大模型:Qwen3-VL-32B、InternVL3-38B;
  3. 持久化日志数据库,存储全量请求、预测结果。

3.3 完整业务工作流

  1. OpenClaw定时任务触发,调用Python摄像头脚本拍摄动物图像,本地时间戳存储;
  2. 用户可选录入皮肤、行为等病症描述文本;
  3. 启动LangGraph有状态流程,校验图像清晰度、尺寸、格式;
  4. 分两条分支:仅图像输入 / 图像+病症多模态输入;
  5. 图像预处理后上传谷歌云盘,生成访问链接封装进API请求;
  6. FastAPI转发图文至云端VLM,返回结构化疾病预测结果;
  7. LangGraph安全规则校验:低置信、冲突证据、紧急病症、接口报错自动触发重拍/重试/人工升级;
  8. 过滤专业诊断话术,仅输出初筛预警,禁止给出最终诊疗结论;
  9. 全流程结构化日志写入云端,OpenClaw推送筛查通知至用户。

架构设计核心优势

VLM仅作为推理工具,无权控制流程走向;所有重试、升级、输出过滤逻辑由LangGraph规则管控,流程可追溯、可审计;边缘仅轻量采集调度,重VLM推理全部上云,适配低算力嵌入式设备。

4 数据集与软硬件环境

4.1 评测数据集

两套公开畜禽图像数据集全部用于零样本测试:

  1. Pet Disease Images:1736张图像,22类动物疾病;
  2. Dogs Skin Disease:443张犬类皮肤病图像,4个病症类别。

4.2 边缘硬件与工具栈

  • 设备:CanaKit树莓派8GB,128GB存储,Camera Module 3;
  • 运行环境:Python3.12;
  • 边缘智能:OpenClaw调度、LangGraph编排图像/请求流程;
  • 图像存储:拍摄原图上传谷歌云端盘。

4.3 云端推理环境

  • 模型:Qwen3-VL-32B、InternVL3-38B;
  • 部署方案:Ollama托管 + FastAPI封装REST接口;
  • 三类评测输入范式:纯图像、仅病症文本、图文融合多模态;
  • 评测约束:Prompt剔除文件夹名称、文件名、疾病标签,杜绝标签泄露干扰零样本效果。

4.4 评测指标

准确率Acc、精确率Prec、召回Rec、宏F1分数。

数据集模型输入模式Acc(%)PrecRecF1
犬皮肤病数据集Qwen3-VL-32B纯图像33.260.510.310.31
犬皮肤病数据集Qwen3-VL-32B仅文本69.000.600.750.64
犬皮肤病数据集Qwen3-VL-32B图文融合72.170.850.780.69
犬皮肤病数据集InternVL3-38B纯图像31.900.410.350.31
犬皮肤病数据集InternVL3-38B仅文本100.001.001.001.00
犬皮肤病数据集InternVL3-38B图文融合94.340.940.950.94
宠物综合疾病集Qwen3-VL-32B纯图像48.410.640.480.47
宠物综合疾病集Qwen3-VL-32B仅文本86.900.790.860.82
宠物综合疾病集Qwen3-VL-32B图文融合84.020.900.830.80
宠物综合疾病集InternVL3-38B纯图像52.220.620.49
宠物综合疾病集InternVL3-38B仅文本86.040.790.860.81
宠物综合疾病集InternVL3-38B图文融合88.110.930.880.86

5 系统实现与性能评测

5.1 工作流初始化流程

  1. OpenClaw定时触发筛查任务,调用摄像头拍摄动物图像;
  2. 图像本地校验(清晰度、尺寸、模糊度),不合格直接重拍;
  3. 存在病症文本则拼接为多模态输入;
  4. LangGraph封装请求,上传图像至谷歌云盘获取引用链接;
  5. HTTP请求发送至云端FastAPI,调用VLM推理;
  6. 返回结果进入安全校验节点:置信度低、冲突、急症自动升级人工复核;
  7. 输出仅为初筛预警,严禁生成临床确诊结论;
  8. 全链路时间戳、图像ID、预测结果、校验状态写入云端日志;
  9. 推送通知给养殖户,附带原图链接便于兽医复核。

5.2 图像预处理链路

LangGraph内置图像校验节点,校验维度:文件存在性、分辨率、文件大小、模糊程度、亮度、图片格式;不达标直接进入重拍分支。
图像不直接二进制传输,上传云端后仅传递文件URL,降低网络传输负载。
单次完整执行样例日志:

阶段字段数值
图像采集硬件Camera Module 3
图像采集时间戳2026-06-03
图像采集状态成功
图像采集文件大小296 KB
采集耗时2820.47 ms
云端上传存储位置Google Drive
云端上传文件ID20260603_125355.jpg
上传状态成功
上传耗时1977.86 ms
VLM推理模型Qwen3-VL-32B
预测结果猫牙科疾病
推理耗时925.3 ms

5.3 VLM零样本性能分析

  1. 纯图像输入两类模型效果均极差,犬皮肤病数据集F1仅0.31左右;
  2. 仅病症文本输入基线大幅提升,InternVL3在犬数据集文本输入下达到100%准确率;
  3. 图文融合输入综合表现最优:兼顾视觉特征与文字病症上下文,精确率显著提升;
  4. 仅依赖图像无法完成可靠筛查,多模态融合是畜牧AI核心优化方向。

5.4 请求与响应处理规范

  1. LangGraph输出标准化JSON请求:图像云链接、病症文本、采集时间;
  2. FastAPI校验字段完整性,转发至Ollama VLM;
  3. VLM返回结构化预测、置信度、支撑依据;
  4. 返回数据回流LangGraph做规则校验:
    • 校验输出是否符合预设格式;
    • 判定置信度、证据冲突、紧急病症;
  5. 生成安全初筛通知,记录全链路日志;
  6. OpenClaw推送消息至养殖终端。
    系统可统计端到端总耗时、分段延迟,区分采集、上传、云端推理各阶段开销,用于后续性能优化。

6 研究局限性

  1. 评测仅使用两套中小型公开畜禽数据集,样本多样性不足;
  2. 全部采用零样本Prompt推理,未针对畜牧数据微调模型,临床精准度存在上限;
  3. 预测结果高度依赖Prompt措辞、病症描述完整性;
  4. 摄像头固定拍摄角度,无法捕捉运动动物多角度病灶;
  5. 真实兽医诊疗还包含血常规、行为、音频等多类数据,本系统仅覆盖图像+文本;
  6. 未开展专业兽医人工盲测验证筛查可靠性。

7 结论

本文搭建VetClaw端云多模态智能体系统,基于OpenClaw做边缘调度、LangGraph管控完整疾病筛查工作流,树莓派嵌入式设备采集动物图像,云端VLM完成零样本疫病初筛。
实验证明:仅依靠动物图像识别精度极低,融合养殖户病症文本的多模态输入可显著提升疾病分类准确率。系统内置安全校验、异常重试、人工升级、全链路日志,规避大模型直接输出诊疗结论的安全风险。
后续研究计划:扩充大规模畜禽多模态数据集、对比非智能体静态流水线性能、完善安全规则体系、联合兽医完成临床实测。

伦理说明

本研究仅使用公开开源畜禽图像数据集,无养殖户隐私、动物敏感诊疗数据,不存在数据泄露风险。

资源链接汇总

  1. 论文HTML原文:https://arxiv.org/html/2607.26042v1
  2. 论文PDF原文:https://arxiv.org/pdf/2607.26042
  3. OpenClaw开源框架官网:https://openclaw.ai/
  4. LangGraph开源仓库:https://github.com/langchain-ai/langgraph
  5. 犬皮肤病数据集(Kaggle):https://www.kaggle.com/datasets/yashmotiani/dogs-skin-dataset
  6. 宠物综合疾病数据集(Kaggle):https://www.kaggle.com/datasets/smadive/pet-disease-images
  7. Qwen3-VL模型论文:arXiv:2511.21631
  8. InternVL3模型论文:arXiv:2504.10479
版权声明: 本文来自互联网用户投稿,该文观点仅代表作者本人,不代表本站立场。本站仅提供信息存储空间服务,不拥有所有权,不承担相关法律责任。如若内容造成侵权/违法违规/事实不符,请联系邮箱:809451989@qq.com进行投诉反馈,一经查实,立即删除!
网站建设 2026/7/30 17:11:33

认知场论:语言交流过程与量子场论的结构同构研究

认知场论:语言交流过程与量子场论的结构同构研究 作者:方见华 单位:世毫九实验室 摘要 本文以量子场论的场、真空、场激发、粒子相互作用等核心范式为参照,建立认知场理论框架,尝试揭示人类语言交流背后统一的认知动力…

作者头像 李华
网站建设 2026/7/30 17:10:32

AI扒谱技术解析:从音频分离到乐谱生成

引言在音频处理和音乐信息检索(Music Information Retrieval,MIR)领域,扒谱(Audio Transcription)一直是一个具有挑战性的技术方向。传统扒谱主要依赖音乐人的听觉分析能力,通过反复试听完成音高…

作者头像 李华
网站建设 2026/7/30 17:09:01

关于数据库“EXPLAIN”相关说明

一、在SQL调优的时候,我们经常会使用"EXPLAIN"语句来获取查询执行计划的详细信息,通过执行计划的结果进一步分析调优。二、使用方式:在需要查看执行计划的SQL语句前面加上“explain”即可三、结果参数说明:1、id&#x…

作者头像 李华