文章目录
- 01 现存问题
- 02 论文创新点
- 03 数据收集与处理
- 3.1 数据收集
- 3.2 数据预处理
- 3.3 数据标注
- 04 方法设计
- 4.1 整体框架
- 4.2 三阶段递进式模型训练
- 4.3 多智能体协同运行架构
- 05 实验
01 现存问题
- 农业用户需求文本具有鲜明的领域特征,带来天然具有的挑战
- 内容上
高度专业化:涵盖作物种类、病虫草害、施肥技术、气象灾害等多个子领域。 - 表达方式则呈现出
多样性与非标准化特征:常包含口语化、模糊化和区域化的表述,语义理解高度依赖上下文推理能力。 - 农业需求具有显著的
动态性和多因交互性:受到季节、气候、政策、市场等多重因素影响,其演变规律呈现非线性和非平稳性特征,从而加剧了需求解析的复杂性。
亟待解决的关键问题:如何从海量、非规范的农业需求文本中精准提取核心因子。
- 传统方法存在短板
规则模板与关键词匹配法:对农业用户
需求进行模式化解析。实现简单、计算成本低,但只能处理模式化表达,在面对复杂语义时适应性不足。- 机器学习方法(支持向量机
SVM和随机森林等):依赖人工设计特征,通过统计学习实现文本分类与因子抽取。SVM 对标注语料质量敏感,且难以处理复杂语义和上下文依赖。RF在应对语义歧义与上下文依赖时依旧存在局限,且对高质量标注语料依赖较大,泛化能力有限。
- 现有深度学习方法存在局限
以BERT、BiLSTM为代表的深度学习模型,仅能完成表层语义建模,无法深度解析多维度因子。模型缺乏可解释性,结果难以追溯,限制了其在高风险农业决策中的应用。 - 大语言模型(LLMs)在农业需求分析任务中存在显著缺陷
- 通用 LLMs对方言、农业专业术语的识别精度不足,易导致关键因子遗漏;
- 现有研究多聚焦单一任务,未涉及需求分类-因子提取-解释生成的全流程结构化分析;
- 难以处理多步骤、多维度的复杂需求解析,且可解释性支撑不足,无法满足农业决策对结果透明性的要求。
02 论文创新点
(1) 提出基于LLMs的“3阶段训练+多智能体协同”方法,专项解决农业用户需求关键因子提取的核心痛点。
(2) 提出农业需求分析智能体系统(Agri-NeedAgent)。通过融合LLM能力、多智能体协同与领域知识增强,实现农业用户需求的精准解析与结构化输出。
03 数据收集与处理
3.1 数据收集
构建三层数据体系:8 万条农业领域文本用于领域预训练;2.28 万条来自论坛、热线、专家访谈的真实场景样本用于任务微调;
整合专著、问答、论文、政策的多源异构知识库用于推理支撑与结果溯源。
3.2 数据预处理
建立7大类30个子标签的需求分类体系,覆盖农业全场景需求类型;5 维度关键因子提取标准,涵盖核心实体、属性特征、关键措施、环境条件、量化指标。
3.3 数据标注
采用3人独立双盲标注,以Kappa系数校验一致性(实际值 0.88),经复核筛选出 1.58 万条高质量样本,按比例划分为训练、验证、测试集。样本中种植管理、病虫害防治类占比最高,贴合实际生产需求。
04 方法设计
4.1 整体框架
本研究提出的基于大语言模型的农业用户关键
因子提取方法,以“领域知识注入-多智能体专业 化协同-结构化解析输出”为核心设计思路,由三个模块构成。
- 采用农业领域知识预训练 - 需求因子提取导向优化 - 农业知识低秩适配三阶段递进训练策略,实现大模型的农业领域语义增强与任务专业化适配。
- 构建管理型 + 任务型的多智能体架构,赋予管理智能体 ReAct 推理行动思维模式,通过多智能体动态调度与专业化分工,完成需求分类、关键因子提取、结构化可解释输出的全流程处理。
- 搭建多源异构农业知识库,作为模型推理的语义锚点与结果溯源的证据库,为分析过程提供专业语义支撑与验证依据。
4.2 三阶段递进式模型训练
以Qwen3-1.7B为基础模型,通过逐层递进的训练策略,实现模型从通用语言能力到农业需求解析能力的平滑迁移:
- 领域知识预训练:输入8万条农业领域文本(政策、农技、栽培指南等),让模型掌握农业专业术语、行业表达与上下文逻辑,夯实领域语义基础;
- 需求因子提取导向优化:基于标注样本,以“指令 + 输入 + 输出”三元组格式做指令微调,结合少样本提示与思维链策略,建立“需求文本→类型识别→因子提取”的任务映射能力;
- 农业知识低秩适配:采用LoRA轻量化微调技术,分别对需求分类、关键因子提取两个子任务做专项优化,仅训练少量参数即可提升任务精度,同时完整保留模型通用语言能力,大幅降低训练成本。
4.3 多智能体协同运行架构
构建1 个管理型智能体 + 3 个任务型智能体的分工协作体系,解决单一智能体认知过载、结果完整性不足的问题:
- 管理型智能体(MA):采用 ReAct(推理 + 行动)思维模式,是全流程的调度与管控核心,负责任务拆解、执行顺序调度、中间结果校验、不合格重试,最终整合输出统一格式的分析报告;
- 需求分类智能体(DCA):依据 7 大类 30 个子标签体系,完成需求类型的精准识别;
- 关键因子提取智能体(KFEA):按照 5 类标注维度,提取需求核心要素并结构化输出;
- 综合解释生成智能体(SEGA):整合分类与提取结果,结合知识库生成逻辑清晰、有专业依据的可解释性分析。
05 实验
表4对比了传统BERT模型、多款通用大模型与本文提出的Agri-NeedAgent在农业用户需求分析任务中的表现。Agri-NeedAgent在需求类型准确率、关键因子提取F₁值、接口合规率、可解释性四项核心指标上均全面领先,且结果稳定性最优。通用大模型性能随参数量提升但存在边际效益递减,而基于小参数模型的领域适配与多智能体优化方案,实现了对更大参数通用模型的性能反超,在输出规范性与可解释性上的工程落地优势更突出。
消融实验
表5为Agri-NeedAgent的消融实验结果,通过逐一移除核心组件验证各模块的作用。移除任意组件后各项指标均出现下滑,其中领域预训练、LoRA微调对需求识别与因子提取的核心精度影响最显著,管理智能体与ReAct思维链主要影响输出合规性与稳定性,外部知识库则是可解释性的核心支撑,移除后可解释性评分从90.2大幅降至77.6,充分验证了整套架构各模块的必要性与设计合理性。