观察 2026 年的中国农业 AI,一个有效的切入点是先放下聊天机器人的数量。更值得追踪的信号,是它们背后逐渐成形的一条新链条:农业知识进入模型;传感器与遥感刻画一块具体田地;作物和天气模型推演后续变化;智能体比较各种干预方案;设备执行范围明确的操作;下一次观测再检验建议是否奏效。
这就是田间回路。它比作答农学考试要求更高,因为任何一次交接都能出错。模型掌握教科书中的水分胁迫症状,却会把卫星像元与地块错配。模拟器调用错误的土壤记录,便会算出有误的灌溉收益。智能体给出的处理方案本身合理,时间却错过正确的生育阶段。机器拿到正确处方,施用量仍会出错。语言再流畅,也无法在事后修复其中任何一种误差。
三项进展共同表明,田间回路已成为值得追踪的信号:中国已有开放的农业语言模型和揭示知识层能力的基准;研究系统开始让计算过程与中间产物接受检查;高校团队则明确把大模型接入作物模拟器、遥感和田间设备。政策也朝同一方向移动,从鼓励基础模型,走向要求能在现场核验的窄域应用。[1][7]
变化已经发生,证据仍不均衡。
答案层正在成为基础设施
中国在 2024 年 10 月发布的《全国智慧农业行动计划》,描绘的是一套开放平台和模型库,覆盖作物生长、动物行为、生产决策、设施环境联动控制、育种、饲料配方和农场管理。时间表给出了明确的检验点:到 2026 年底,平台和首批模型库要基本建成;到 2028 年底,推广超过 20 个基础模型算法、通用软件和 SaaS 工具。[1]
司农 1.0 展示了这套基础设施第一层的形态。南京农业大学与南京理工大学团队发布了 8B 和 32B 参数版本,并介绍了一套超过 40 亿 token 的训练语料,材料来自 8,863 本图书、243,897 篇论文,以及 196,748 份政策、标准、专利及相关文件。项目仓库也写下了全项目最重要的警示:输出仍会出现不准确或编造内容,采纳前必须核验。[2]
这项警示划定了能力基线。农业语言模型可以汇集大批文献知识,将提问转换成领域术语,检索政策,或为专业软件提供自然语言入口。仅靠吸收更多文本,模型仍缺少制定干预处方所需的当地天气、土壤、品种、管理历史、设备状态与因果模型。
AgriEval 让这条界线变得可测量。这项中文基准于 2025 年 7 月发布,包含 14,697 道选择题和 2,167 道开放题,覆盖六个农业大类与 29 个子类。作者评测了 51 个商业及开放模型,报告显示大多数模型的准确率低于 60%。打乱答案选项后,准确率平均下降 6.95 个百分点;这项结果提醒人们,表面上的农业知识有一部分来自应试捷径。[3]
AgriEval 的长处也限定了它能说明什么。题目来自大学考试与作业;选择题按答案准确率评分,开放回答则按与参考答案的 ROUGE-L 重合度评分。在明确设定下,这是一项有依据的农业知识测试。至于模型能否诊断某一个农场、选择安全操作或改善结果,则不在它的证据范围内。基准能指出答案层的缺口,回路仍有其余环节等待验证。
计算层正在变得可核查
2026 年 2 月发布的 AgriWorld 预印本,把评测对象换到了计算过程。中山大学团队将 LLM 从纯文本农业推理转入带工具的 Python 环境,工具包括地块查询、遥感时间序列、土壤与地形数据、天气、作物模拟,以及产量、胁迫或病害风险预测。智能体编写代码、观察结果,并修正方法。中间产物保留单位、坐标系、分辨率和数据出处等元数据。[4]
这套设计承认了一个朴素的事实:农业推理最常断在数据拼接处。地块边界和传感器覆盖范围会采用不同的坐标系;降雨总量会对应错误的时间窗口;管理日志记录的是千克,工具预期的却是克;影像也会大半被云遮住。AgriWorld 将这些问题显式交给检查器判退,润色后的答案无法把它们藏起来。
报告中的基准结果要放回它的评测范围内理解。论文使用 LoRA 对 8B 和 32B 的 Qwen3 模型微调,并允许反思型智能体在受控工具环境中执行最多 20 步。作者的消融表显示,完整系统的准确率达到 57.6%,文本版 Kimi/GPT 基线为 21.9%,单次直接调用工具为 48.2%。[4] 这些数字说明,将推理锚定于数据并在执行中纠错,在这套构造出来的设置内具有价值;田间可靠性、跨季节稳健性和增产效果仍需另行验证。
即便如此,系统留下的证据已经具体了一层。单看最终答案,偶然猜中也会算对;执行轨迹则能显示选中了哪块地、用了哪个天气窗口、运行了哪个模拟器、哪些单位流经其中,以及修正发生在何处。对农业 AI 来说,这样的轨迹更接近实验记录簿,比聊天记录更有用,尤其是在出错之后。
智能体开始拥有模型、传感器和双手
下一个信号来自架构趋同。2026 年 5 月 16 日,南京农业大学发布“神农慧种”系列智能体,系统组合了领域语言模型、数据集、知识图谱、作物生长模型、遥感模型、多智能体调度和田间设备输出。校方公布的分工很能说明方向:大模型处理语言与意图,较小的定量模型负责计算与动态预测。校方称,系统可将任务调度给作物模拟和田间设备,并已在江苏、河南、山东、江西和上海演示。[5]
7 月 11 日和 12 日,中国农业大学从两个方向推进了同一架构。神农大模型 4.0 以 API、MCP 服务、方言语音、基因组学功能扩展了感知与交互层,校方公布的病害识别范围达到 1,016 类。同期另行发布的神农·农业世界模型 1.0 面向干预层:输入作物状态与天气后,目标是模拟水、肥、通风、光照或其他操作如何改变未来状态、产量、品质和风险。[6]
校方报告称,系统已在受控设施内完成番茄、生菜和黄瓜的验证,并在吉林 38 个县开展抗旱管理工作;代码、评测基准和数据契约也已开放。[6] 这些主张展现了进展方向。发布文章尚缺误差分布、对比模型、田间与季节数据划分、干预日志,也没有把各项醒目结果逐一链接到可复现产物。在这些细节能够轻松核查之前,数字所标示的是团队声称的验证范围,距离中国农业的通用评分仍很远。
把这些项目放在一起,显现出的共同模式比任何一次发布都更清楚。大模型的角色正在收束为界面和规划器;作物模型、GIS 引擎与机器控制器保留各自职责。专业组件保留自己的数据和物理规律,工具展示中间过程,设备也被纳入系统。相比单一的农学聊天机器人,这套架构更可信,因为每一类故障都有可见的发生位置。
田间验证需要另一套记分牌
2026 年 4 月,农业农村部征集“人工智能+农业”案例时,悄然提高了证据要求。通知倾向于小切口、深应用、可复制的项目,要求申报效益真实准确,要求省级主管部门实地核验,并称部里可随机抽查入选案例。征集类别从育种和疫苗研发,延伸到虫害预测、精准畜牧、物流、可追溯体系,以及产销匹配。[7]
这套流程提示了合适的记分方法。田间回路系统首先要写明适用范围:作物、地区、农场类型、季节、传感器覆盖、允许的干预,以及有权接管系统的人。随后还要保留从原始观测到建议、再到机器指令的完整链条。最重要的是用可信基线比较结果,包括常规做法、随机条带、匹配地块,或经过天气调整的上一季。用户数与模型准确率无法替代农艺效果。
安全与经济账也应进入同一份记录。系统有多大比例选择不作建议?农艺师改了多少条建议?变量施用处方的节水,是否只是减产带来的结果?传感器掉线或品种越出训练分布后发生了什么?这条回路需要多少劳动力、连接条件和校准工作?试点的迁移以此为前提:另一位操作者既能看到收益,也能看清运行约定。
到 2026 年底,中国农业 AI 发布中最有信息量的那一个,衡量点未必是最大模型或最长作物名单。它会把带版本号的模型和数据契约,与逐项干预的田间日志、明确基线、故障率和人工接管率结合起来,并给出跨越多个季节或地区反复验证的结果。答案框解决的是容易的部分。真正的产品从答案碰到田地时开始,田地也会作出回应。
来源
- 中国农业农村部,《全国智慧农业行动计划(2024—2028年)》(2024 年 10 月 23 日印发;国家平台、模型库、应用与推广目标)。
- 南京农业大学与南京理工大学,“司农大语言模型”代码仓库(访问于 2026 年 8 月 4 日;语料说明、开放的 8B/32B 版本、RAG 设计与模型警示)。
- Lian Yan 等,"AgriEval: A Comprehensive Chinese Agricultural Benchmark for Large Language Models," arXiv:2507.21773(2025 年 7 月 29 日;数据集、评测设置、结果与位置偏差测试)。
- Zhixing Zhang 等,"AgriWorld: A World–Tools–Protocol Framework for Verifiable Agricultural Reasoning with Code-Executing LLM Agents," arXiv:2602.15325(2026 年 2 月 17 日;工具环境、可核查执行、基准设置与消融实验)。
- 南京农业大学农学院,“南京农业大学‘神农慧种’系列智能体正式发布”(2026 年 5 月 18 日;智能体架构、模型分工、设备衔接与演示地点)。
- 中国农业大学,“中国农大发布两项农业AI重大成果:神农大模型4.0与神农·农业世界模型1.0同期发布”(2026 年 7 月 14 日;官方发布、声称的验证范围、开放产物说明与来源照片)。
- 中国农业农村部,《关于征集“人工智能+农业”典型应用场景的通知》(2026 年 4 月 20 日;入选范围、证据要求与实地核验流程)。