随着我国磷化工产业的快速发展,磷石膏作为湿法磷酸生产中不可避免产生的大宗副产物,其内含有一定量的酸性物质、重金属及有害杂质,若长期堆存或处理不当,将严重污染土壤与水体,不仅制约绿色制造水平的提升,也对生态环境和公共安全造成深远威胁。当前,磷石膏无害化处理[1-3]与资源化利用普遍存在水洗效率低、杂质去除不彻底、浮选控制粗放、能耗高、自动化与智能化水平不足等问题,已成为制约磷石膏高值利用的关键问题。
近年来,随着工业智能化的推进,国内外学者在磷石膏处理自动化控制与优化策略方面开展了多项研究。针对磷石膏无害化处理工艺中存在的多变量、动态非线性和交叉耦合的复杂工业系统,如何实现高效、稳定的联合调节,已成为磷石膏智能控制领域的核心研究方向。最早应用于磷石膏控制系统的技术是PID控制方法[4]。例如,杨敏敏等[5-7]在新型湿法α石膏生产智能控制系统研究中采用了PID控制,较好地调节了系统中温度、压力等参数指标。该方法结构简单、工程实现成本低,适用于单变量控制问题。但在多变量耦合系统中,PID控制往往为每个变量分别设计独立控制回路,忽略变量间的耦合效应,极易导致控制不稳定或性能下降,尤其在工况变化频繁时呈现明显的响应迟滞。为解决上述问题,有学者引入了模糊控制方法,通过构建模糊规则库代替精确数学模型,实现了对非线性系统的自适应调节。模糊控制具有良好的鲁棒性和对系统不确定性的容忍性,适合磷石膏处理过程中原料波动大、模型难以精确描述的场景。部分研究进一步尝试对多个变量实施模糊控制策略,设计多个模糊控制器协调运行。然而,由于模糊规则往往基于经验设计,当变量间耦合强度较高时,不同控制器之间的协同性差,可能导致系统整体性能下降或引发干扰振荡。在此基础上,徐文敏[8]提出了模糊PID控制[9-10]方法,结合模糊逻辑的非线性处理能力与PID控制的响应速度优势,试图改善系统的响应性能与稳态精度。该方法对部分耦合变量可实现协同调节,且响应速度优于单一模糊控制器。但其控制结构通常仍基于串联或并联的单变量回路,不具备全局优化能力;同时,其模糊规则与PID参数大多依赖人工设定,缺乏动态学习与适应能力,难以应对耦合程度变化或系统扰动。
针对传统控制方法的局限,近年来智能控制领域出现了将机器学习[11]引入控制系统的新趋势。其中,强化学习(reinforcement learning,RL)[12-14]作为人工智能的前沿技术,正逐步成为解决复杂控制问题的新型方法。RL通过智能体与环境的交互反复试错来自主学习最优控制策略,无需依赖精确的物理模型,在处理高度非线性、不确定性以及时变环境方面展现出强大的自学习、自适应能力。
对于如磷石膏生产过程调控等需要对阀门开度等参数进行精细、连续控制的场景,其本质属于连续动作空间问题。深度确定性策略梯度(deep deterministic policy gradient, DDPG)算法[15-16]作为RL的一个重要分支,专门为处理连续动作空间而设计,能够直接输出连续的控制量,非常适用于此类过程控制任务。
鉴于此,本文设计了一种融合模糊控制与DDPG算法的智能控制方法F-DDPG,应用于磷石膏工艺全过程中关键控制环节的优化。该方法以关键过程变量(如pH值、含水率、流量等)的误差及变化率为输入,训练DDPG智能体自动调节模糊控制器的输出权重,从而动态适应复杂工况下的非线性扰动与耦合特性。通过在Simulink平台搭建完整的工业级仿真环境,并结合MATLAB深度学习工具箱进行训练与性能评估,验证了该方法在提升控制精度、降低能耗波动、缩短调节时间、增强系统稳定性等方面的优势。该研究为磷石膏处理的绿色化、智能化、低碳化转型提供了系统解决方案与理论依据,推动了磷化工产业的绿色高值化发展,并为我国固废资源化和“双碳”战略目标的实现贡献了重要技术支撑。
1 F-DDPG控制模型设计
1.1 模型建立
随着工业生产智能化水平的不断提升,磷石膏作为磷肥生产过程中的典型副产物,其资源化利用与绿色处理技术受到广泛关注。在前处理工序中,参数控制的精度与响应速度直接决定产品质量、能耗水平与环境绩效。为响应这一需求,本文以磷石膏预处理工艺为背景,结合其工艺流程,提出F-DDPG控制方法,并建立F-DDPG控制模型,为后续仿真实验与控制策略研究提供理论依据。
如图1所示,磷石膏预处理系统涵盖了从原料入料到干燥出料的多级物理与化学处理过程,包括原料仓、智能加药装置、水洗装置、离心机、干燥机、监控与数据采集控制系统等,具有非线性强、耦合性高、参数扰动频繁等典型特征。
<G:\武汉工程大学\2026\第2期\奚聪-1.tif>
图1 磷石膏本质安全前处理设备智能化系统流程图
Fig. 1 Flowchart of the intelligent system for inherently safe pretreatment of phosphogypsum
在上述系统结构中,pH值、含水率与系统流量构成了系统稳定运行的关键控制参数。由于它们不仅受原料波动、加药量精度、物料浓度等因素影响,同时也相互关联,传统PID或单一模糊控制方法在面对多变量耦合与动态工况时常表现出响应滞后或控制精度不足的问题。本文所提方法中,模糊控制器负责初步控制pH误差、含水率误差、流量误差下的阀门控制信号; DDPG智能体通过学习误差变化趋势及历史输出反馈,对阀门开度的通道增益(k值)进行动态调整,实现对输入信号的智能调控。
通过上述建模,本文在MATLAB/Simulink环境中重构了磷石膏无害化处理系统中关键变量的动态控制过程,使所构建模型既具备工程背景的实际意义,也具备算法验证的可行性,为后续控制器设计与仿真对比分析打下基础。
1.2 F-DDPG控制模型结构
依据装置的逻辑关系与控制需求,本文在 Simulink 平台上建立的F-DDPG控制模型中,模糊控制器为3输入3输出结构,DDPG智能体为9输入3输出结构。两部分的输出信号经乘积模块共同作用于增益模块,实现对输入信号的闭环调节。
模糊控制器的3个输入信号分别对应 pH、含水率和流量,每个输入信号由其误差值及误差变化率共同确定。其输出信号依次为酸碱阀门开度、加水阀开度与流量阀开度(控制强度),通过调节增益实现前级模糊控制器输出幅度的优化,以提升控制精度与收敛速度。3个输入信号经多路复用器合并后输入至模糊控制器,输出信号经解复用器分解为3个独立通道,并分别施加不同的增益权重后反馈至相应输入端,形成闭环控制结构,实现参数的自适应调节。
如图2所示,在该模型中,模糊控制器与DDPG智能体协同实现系统调控。DDPG智能体的输出端信号经解复用器被分解成3个通道增益分量,分别是[kpH]、[km]、[kf],用于调节目标通道的响应性能。DDPG智能体的输入端由9个输入信号经多路复用器合并成输入,分别对应误差值([epH]、[em]、[ef])、误差变化率([dpH]、[dm]、[df])和从输出端反馈到输入端的[kpH]、[km]、[kf]。DDPG智能体输出与模糊控制器输出共同经乘积模块运算,以实现反馈参数的动态调节。
此外,每个输出端均设置增益模块以调节反馈比例,实现不同反馈信号对不同控制参数的加权作用。例如,在加水阀开度路径后分别引入pH与含水率反馈,其比例系数为 4∶15,表明加水阀开度对含水率影响更为显著,而对 pH的影响相对较小;酸碱阀开度路径中pH与含水率反馈的比例系数为 1∶6,表明酸碱阀开度主要影响 pH,而对含水率影响较弱。
F-DDPG控制模型流程如图3所示。
<G:\武汉工程大学\2026\第2期\奚聪-3.tif>[通道增益k]
图3 F-DDPG控制模型流程图
Fig. 3 Flowchart of the F-DDPG control model
1.3 模糊控制器设计
为增强控制器的可解释性与可用性,本文选用模糊控制器中的Mamdani型。该类型控制器以“如果…那么…”规则形式表达控制逻辑,具有良好的经验融合性和结构直观性,适用于复杂工业过程的自动控制。与 Sugeno型相比,Mamdani型能够更有效地刻画操作者对pH、含水率及流量的经验认知,从而提高控制策略的鲁棒性与可解释性。此外,Mamdani型生成的模糊输出便于DDPG智能体进行动态调整,为后续融合控制的实现奠定基础。
基于模糊控制原理,磷石膏生产智能控制系统中,输入变量包括[epH、dpH]、[em、dm]、[ef、df]。各信号的误差和变化率经求和模块合并成新的信号,分别用[cpH]、[cm]、[cf]表示。输出变量对应加水阀、酸碱阀与流量阀的开度。输入变量经模糊化处理后,根据其变化范围与控制精度确定基本论域。[cpH]、[cm]、[cf]的基本论域可以被划分为3种模糊误差:NEG(负)、ZERO(零)、POS(正)。模糊控制器设计包括以下步骤:
(1)确定输入、输出物理量。
(2)选取隶属度函数。本文控制器采用三角形隶属度函数表示各个变量的隶属度,[cpH]、[cm]、[cf]的隶属度函数分别如图4(a)-图4(c)所示。
<G:\武汉工程大学\2026\第2期\奚聪-4-1.tif><G:\武汉工程大学\2026\第2期\奚聪-4-2.tif><G:\武汉工程大学\2026\第2期\奚聪-4-3.tif>[-4 -3 -2 -1 0 1 2 3 4
pH][1.0
0.8
0.6
0.4
0.2
0.0][隶属度][NEG(负)
ZERO(零)
POS(正)
][(a)][1.0
0.8
0.6
0.4
0.2
0.0][隶属度][NEG(负)
ZERO(零)
POS(正)
][(b)][-10 -8 -6 -4 -2 0 2 4 6 8 10
含水率 / %][-30 -20 -10 0 10 20 30
流量 / (L·s-1)][1.0
0.8
0.6
0.4
0.2
0.0][隶属度][NEG(负)
ZERO(零)
POS(正)
][(c)]
图4 不同参数的隶属度函数:(a)pH,(b)含水率,(c)流量
Fig. 4 Membership functions of various parameters:
(a) pH, (b) moisture content, (c) flow rate
(3)设计模糊规则表。模糊规则表是模糊控制系统的核心组成部分,用于描述输入与输出变量之间的映射关系,见表1。其逻辑通过一组“若…则…”规则实现,每条规则将输入变量的模糊集映射至相应输出模糊集。例如,当pH偏低(呈酸性)、含水率正常且流量偏大时,系统应维持水阀状态、提高酸液投加量并提升流量。通过该类模糊规则,控制器能够在系统运行过程中实现实时模糊推理与控制决策。
(4)选择解模糊算法。基于隶属度函数与模糊规则表进行解模糊运算,将模糊输出转换为具体数值信号,得到最终阀门开度,实现对磷石膏生产过程参数的闭环控制。
表1 模糊规则表
Table 1 Fuzzy rule base
[规则
编号 误差值 操作 pH 含水率 流量 加水阀 酸碱阀 流量阀 1 负 负 负 排水 加酸 减小流量 2 负 负 零 排水 加酸 保持不变 3 负 负 正 排水 加酸 增大流量 4 负 零 负 不处理 加酸 减小流量 5 负 零 零 不处理 加酸 保持不变 6 负 零 正 不处理 加酸 增大流量 7 负 正 负 加水 加酸 减小流量 8 负 正 零 加水 加酸 保持不变 9 负 正 正 加水 加酸 增大流量 10 零 负 负 排水 不处理 减小流量 11 零 负 零 排水 不处理 保持不变 12 零 负 正 排水 不处理 增大流量 13 零 零 负 不处理 不处理 减小流量 14 零 零 零 不处理 不处理 保持不变 15 零 零 正 不处理 不处理 增大流量 16 零 正 负 加水 不处理 减小流量 17 零 正 零 加水 不处理 保持不变 18 零 正 正 加水 不处理 增大流量 19 正 负 负 排水 加碱 减小流量 20 正 负 零 排水 加碱 保持不变 21 正 负 正 排水 加碱 增大流量 22 正 零 负 不处理 加碱 减小流量 23 正 零 零 不处理 加碱 保持不变 24 正 零 正 不处理 加碱 增大流量 25 正 正 负 加水 加碱 减小流量 26 正 正 零 加水 加碱 保持不变 27 正 正 正 加水 加碱 增大流量 ]
1.4 DDPG智能体设计
1.4.1 DDPG基本原理 DDPG是一种基于执行者-评价者(Actor-Critic)架构,通过智能体与环境交互以试错方式学习最优策略的深度强化学习算法。如图5所示,智能体根据当前状态选择动作,环境反馈奖励与新状态,智能体据此不断优化策略,目标是最大化长期累积奖励。该方法不依赖精确模型,能够有效应对非线性、时变和强耦合系统的控制挑战,并具备良好的自适应性与泛化能力。
<G:\武汉工程大学\2026\第2期\奚聪-5.tif>
图5 DDPG原理图
Fig. 5 Schematic of DDPG algorithm
为提高模糊控制器对复杂扰动及多变量耦合系统的适应性,在传统模糊控制框架基础上引入DDPG算法,对模糊控制器的输出增益系数实施在线优化,形成F-DDPG控制方法。DDPG算法通过DDPG智能体与模拟环境交互来进行学习,该智能体在 MATLAB/Simulink 环境下实现,整体结构如图6所示。
<G:\武汉工程大学\2026\第2期\奚聪-6.tif>
图6 DDPG智能体整体结构
Fig. 6 Overall structure of the DDPG agent
1.4.2 DDPG结构设计 DDPG智能体以“状态-动作-奖励”三要素为核心构建,定义如下:
(1)状态空间
状态向量维度为 9,包括[epH]、[em]、[ef]、[dpH]、[dm]、[df]、[kpH]、[km]、[kf]。
(2)动作空间
动作空间用于控制模拟器中的[kpH]、[km]、[kf],即智能体通过调整这3个参数的取值实现对系统的控制,取值范围均为[-1, 1]区间。
(3)奖励函数设计
奖励函数r由误差项[re]、误差导数项[rd]与控制动作项[ra]构成,分别用于衡量控制精度、动态平稳性与控制信号幅度。
式(1)中,采用偏差平方形式,并以负权重加入奖励函数,较大偏差会带来更大负奖励,控制策略会被驱动去积极减小误差。[epH]和[em]的权重较高,设为0.8, [ef]的权重较低,设为0.5,旨在更大程度上控制前两者精度。
[re=-0.8?epH2-0.8?em2-0.5?ef2] (1)
式(2)旨在抑制误差的快速变化,从而避免控制过程出现剧烈振荡,促进控制过程以更平滑的方式逼近目标值。将误差变化率平方纳入惩罚项,[dpH]、[dm]的惩罚系数均为0.2,[df]惩罚系数设为0.1。
[rd=-0.2?dpH2-0.2?dm2-0.1?df2] (2)
式(3)旨在抑制过大的控制输入幅值,避免因控制信号过大或频繁剧烈变化而对系统造成冲击。为了对输入平方和进行惩罚,设置权重为0.1,使其远小于[re]和[rd]的权重系数。这意味着在不显著牺牲误差校正效果的前提下,奖励函数会略微偏好幅度较小的控制操作,对过激的控制行为起到抑制作用。为了避免控制信号出现剧烈波动,在奖励函数中惩罚过大的控制动作,因此过大的控制输入将显著降低奖励值,从而促使控制策略倾向于更平稳、幅度适度的调节。这样的控制动作惩罚不仅能防止控制信号剧烈波动,还在一定程度上减少了能耗和执行器磨损,有助于提高系统运行的安全性和稳定性。
[ra=-0.1?(kpH2+km2+kf2)] (3)
将式(1)~式(3)合并得到奖励函数[r],见式(4),其结合了误差、误差变化率与控制行为,更全面地评价控制系统的表现。
[r=re+rd+ra] (4)
为进一步提升奖励函数设计的科学性与说服力,从控制目标的权重分配角度进行了系统设计与说明,构成典型的加权多目标性能指标形式。
该带权组合形式与传统控制理论中线性二次调节器和模型预测控制中的代价函数设计思想类似,可通过调节权重实现精度、平稳性与能耗之间的平衡。权重选择依据如下:参考被控变量对产品质量与系统稳定性的影响程度(如pH精度对脱水效率影响最大);结合实验经验,通过多轮仿真调优最终确定。
目前尚无统一理论可精准确定最优权重组合,但已有研究表明,在DDPG控制设计中,奖励函数结构与权重设定对智能体性能影响显著,常需结合具体工艺进行“目标驱动式”调节。Ahmad等 [17]通过DDPG策略对图像检索梯度进行建模与控制,实验证实了奖励函数中权重配置对控制精度与动态性能的显著影响,验证了多目标加权设计在工程场景中的可行性与必要性。综上,所构造奖励函数具备明确的物理含义与工艺指向性,可有效提升策略学习效率与控制性能。
1.4.3 DDPG智能体构建 采用MATLAB RL工具箱中的DDPG智能体进行训练。DDPG基于Actor-Critic架构,适用于高维、连续动作空间的控制问题。该架构由Actor网络和Critic网络组成:前者用于生成动作,后者用于评估动作价值函数(Q值)。
Actor网络的输入为九维向量(对应关键过程变量)。网络主体由两层全连接层构成,每层128个神经元,采用线性整流单元(rectified linear unit,ReLU)激活,输出层为三维向量,使用双曲正切激活函数进行幅度压缩,使输出范围限定在[-1,1]内,如图7所示。
<G:\武汉工程大学\2026\第2期\奚聪-7.tif>
图7 Actor网络结构
Fig. 7 Structure of Actor network
Critic 网络的输入由状态向量与动作向量组成,两者分别经过全连接层提取特征,并在中间层进行融合。融合后的特征通过 ReLU 激活后映射为标量 Q 值,如图 8 所示。该结构有助于网络充分学习状态与动作之间的耦合关系,提高动作价值函数的估计精度。
<G:\武汉工程大学\2026\第2期\奚聪-8.tif>
图8 Critic网络结构
Fig. 8 Structure of Critic network
Actor-Critic结构有利于体现状态与动作的联合关系,提升连续控制任务中的价值估计精度。基于上述Actor-Critic结构,DDPG智能体在训练过程中表现出较好的稳定性与样本效率。
1.5 控制器融合机制说明
F-DDPG控制方法采用“模糊控制器+DDPG智能体”的复合架构,并以串联融合方式工作:模糊控制器依据预设规则生成基础控制信号,对pH、含水率、流量误差进行方向与幅度的调节;DDPG智能体计算对应的通道增益k,以动态调整模糊控制输出比例。最终控制指令由二者乘积产生,这意味着DDPG智能体并不直接控制系统,而是以“调节器”的角色赋予模糊控制器自适应能力,实现参数层级的在线优化。
F-DDPG控制方法在保持基于专家知识稳定性的同时,引入对非线性与耦合扰动的实时学习能力,适用于变量强关联、工况频繁变化的工业场景。运行初期可依赖规则获得基本性能,随着训练推进,智能体逐步优化策略,提高响应精度与鲁棒性。相较单纯的DDPG方案,该方法降低了早期探索引发的震荡风险;相较固定规则的模糊控制,则增强了对时变与耦合特性的适应性,具有明确的理论依据与工程可行性。
2 仿真结果与对比分析
2.1 仿真环境设置
为验证F-DDPG控制方法在磷石膏前处理工艺中的有效性,基于MATLAB/Simulink构建闭环仿真模型,涵盖加药调节、干燥脱水与多变量反馈控制机制。模型同时引入工况扰动(如进料浓度变化、传感器噪声等),以真实模拟工业环境下的动态响应行为。
实验在 Windows 10(64位)环境下进行,使用 MATLAB R2021b与RL工具箱进行训练。硬件配备 Intel Core i5-7300HQ(2.50 GHz)、8 GB内存、NVIDIA GeForce GTX 1050Ti(2 GB显存),存储为256 GB SSD + 1 TB HDD。未采用并行计算或多GPU加速,全部仿真在单线程CPU与单GPU条件下完成。
系统设定:仿真时间为10 s;输入变量控制目标值为pH =5.5、含水率=12%、流量 =100 L/min,以模拟磷石膏制备过程中真实情况。DDPG的训练参数:执行者学习率1×10-4,评价者学习率5×10-4,每回合最大步数400,最大训练回合数300。
实验中对比方法包括PID控制、模糊控制、模糊PID控制及本文所提出的F-DDPG控制方法。评价指标涵盖误差收敛速度、稳态精度、控制平滑性与响应鲁棒性。
2.2 控制效果对比分析
图9(a)-图9(c)展示了不同方法下的pH值、含水率与流量的误差曲线对比。
不同方法在多变量耦合场景下的控制性能存在显著差异。在PID控制中,整体响应滞后,pH 误差至 8 s 仍未完全收敛,含水率在稳态阶段出现欠调,流量虽趋于收敛但稳定时间较长且精度有限,显示出耦合协调能力不足。模糊 PID 控制相较 PID 控制有所改进,但 pH与含水率的误差收敛较慢,且在流量控制中出现高频振荡。与上述方法相比,模糊控制在非线性初期响应方面较优,pH与含水率误差在3~4 s内快速下降,但稳态波动偏大,存在超调与振荡。
F-DDPG控制方法在3项指标上均取得更优性能:pH误差可在4 s内稳定在0.1左右,含水率波动较小且无显著超调,流量响应呈现良好的阻尼特性并快速收敛,未观察到明显振荡。该结果表明,F-DDPG控制方法可实现在线自适应优化,能够识别并利用变量间耦合关系,进而实现多目标协调下的高精度控制。
2.3 性能对比量化分析
表2展示了4种控制方法在多变量耦合系统中的控制性能对比,其中N表示超调峰个数。
结果显示:PID 控制的误差较大、收敛较慢且耦合干扰明显,难以实现高精度控制;模糊控制与模糊 PID 控制在调节速度与初期响应方面有所提升,但在含水率与流量控制中仍存在过冲与不稳定振荡,其中模糊 PID 控制在强耦合条件下易产生交叉干扰,出现多次超调峰。相比之下,F-DDPG控制方法在全部指标上表现更优:稳态误差更小(如pH误差0.01)、超调更低、振荡次数更少(仅1次),且平均收敛速度达 0.8 s-1。该方法通过自学习机制有效抑制耦合变量间的干扰传播,实现了对pH、含水率与流量的协同优化控制,体现出较高的系统鲁棒性与工程应用潜力。
相比传统模糊控制,F-DDPG控制方法能够更好地应对复杂工况和非线性耦合特性,显著提升了控制的智能化与稳定性,为磷石膏处理工艺的高效、绿色、智能控制提供了有力的技术支撑。该成果为实现磷化工行业智能化、绿色化升级奠定了理论和实践基础。
3 结 论
随着“双碳”战略和“无废城市”建设的深入推进,磷石膏作为典型工业副产物,其资源化处理对控制精度与智能化水平提出了更高要求。传统控制策略难以应对磷石膏预处理过程中多变量耦合、频繁扰动及强非线性等复杂工况,严重制约了其清洁高效利用的提升空间。针对上述问题,本文设计了一种F-DDPG控制方法,并将其应用于磷石膏无害化处理工艺的关键过程控制。
研究工作主要包括:构建多变量动态控制模型,设计F-DDPG控制方法,并开展系统仿真验证与性能对比分析。实验结果表明,F-DDPG控制方法在训练过程中表现出良好的稳定性,可显著提升各项控制性能指标。该方法具有较高的工程可行性与推广价值,为多耦合控制系统的智能化优化及磷石膏处理过程的高效、绿色控制提供了新的技术途径。