機器學習看似新興,但其核心數學概念之一可追溯至1952年,當時Richard Bellman發表了題為「動態規劃理論」的開創性論文,奠定了最佳控制及現今所稱強化學習的基礎。

1950年代晚期,Bellman將其理論延伸至連續時間系統,將最佳條件轉化為偏微分方程(PDE)。他後來發現此結果與一世紀前(1840年代)物理學中發表的Hamilton-Jacobi方程完全相同。

一旦這種結構顯現,許多主題便自然連結起來:本文將聚焦Bellman理論的兩個應用:連續時間強化學習,以及生成模型(擴散模型)訓練如何透過隨機最佳控制來解釋。

Bellman最初於1950年代初提出離散時間的動態規劃。考慮一個馬可夫決策過程,狀態空間為𝓧,動作空間為𝓐,轉移核為P(·|x,a),獎勵函數為r(x,a),折扣因子為γ∈(0,1)。策略π將每個狀態映射至動作分布。若狀態以受控馬可夫鏈演化,且單步獎勵為r(x,a),折扣因子為γ,目標為最大化期望折扣獎勵,價值函數定義為:

在適當條件下,價值函數V滿足Bellman方程:

此方程意指:選擇能最大化即時獎勵與未來價值之動作。連續時間保持相同局部邏輯,但時間步長為h,並令h趨近於0。

為突顯主要概念,先忽略噪聲,考慮非自治確定性控制系統。

定理(HJB,確定性非自治):對於V屬於C^1,價值函數滿足

其中Hamiltonian定義為H(t,x,p):=sup_{a∈𝓐}{r(t,x,a)+p^⊤f(t,x,a)}。

證明:固定(t,x)及h>0,動態規劃原理給出

對於光滑V及確定性動態,對h的一階近似足以在[t,t+h]區間優化常數動作a。

代入動態規劃原理,消去V(t,x),除以h並令h趨近0,得

整理後為-∂_t V(t,x) = H(t,x,∇_x V(t,x))。證畢。

Hamilton-Jacobi的連結:Bellman在1950年代意識到動態規劃產生的偏微分方程與19世紀經典力學中的Hamilton-Jacobi方程結構相同。將即時獎勵寫為負拉格朗日量r(t,x,a)=-L(t,x,a),定義

則HJB方程與Hamilton作用量S(t,q)的方程相同。

在對應S↔V及q↔x下,兩者在偏微分方程結構層面相同。

接著進入隨機設定:連續時間、連續狀態與動作空間,以及Itô動力學。假設系統依據隨機微分方程演化

其中X_t為狀態,a_t為控制,W_t為標準Wiener過程,f與Σ分別描述漂移與擴散。獎勵為r(x,a),目標為最大化無限期望折扣獎勵

其中ρ>0為折扣率。相關價值函數為

定理(受控擴散的Hamilton-Jacobi-Bellman方程):在適當正則條件下,價值函數滿足HJB PDE

其中𝓛^a為動作a下的無窮小生成子

證明:結構與確定性情況相同。新成分為𝔼_x[V(X_h)]的短時間展開:依Itô公式

其中生成子𝓛^a取代方向導數∇V^⊤f,並加入來自W二次變異的曲率項½Tr(ΣΣ^⊤∇^2 V)。其餘步驟不變:代入動態規劃原理,消去V(x),除以h並令h趨近0,得式(1)。證畢。

同理可得非自治HJB,當f、Σ及r明確依時間變化,詳見附錄C。

歷史註記:1960年,Rudolf E. Kalman發表線性二次調節器(LQR)問題的開創性論文,該問題為線性動態與二次成本的連續時間最佳控制問題。LQR問題的解由代數Riccati方程給出,該方程可由連續時間控制問題的HJB方程導出。

定義連續時間Q函數

由HJB(1)可立即得V(x)=max_a Q(x,a),此為策略改進基礎:當估計出V後,貪婪動作為a^*(x)=argmax_a Q(x,a)。

此平穩折扣形式為後續兩節使用的強化學習慣例。

我們以策略迭代(PI)數值求解HJB,交替進行當前策略評估與透過Q函數改進策略。價值V_θ與策略α_φ皆以多層感知器(MLP)表示。

此演算法為模型基礎:假設已知動態f(x,a)與Σ(x,a)(等同於可取得生成子𝓛^a)。模型用於策略評估時模擬閉環軌跡,及策略改進時計算𝓛^aV。

重複以下步驟直至收斂:

策略評估(當前策略α_k下的價值):

實務中以蒙地卡羅模擬閉環SDE軌跡估計V_k≈V^{α_k},並以迴歸擬合V_θ。

策略改進(對V_k貪婪):

有可微演員α_φ時,改進即為對

進行梯度上升,當HJB殘差與參數變化趨於平穩時停止。

直覺上,評估估計當前策略誘發的價值地形,改進則使策略在該地形上向上移動。反覆兩步驟驅動(V,α)趨近HJB不動點。

生成子需∇V與∇^2 V,從V_θ透過自動微分取得。擴散Σ(x,a)由問題給定(模型基礎設定)。

策略改進時,∇V與∇^2 V從θ分離,梯度僅流向φ。

對固定策略α,V^α解線性PDE

依Feynman-Kac表示,對任意截斷時間T>0,

蒙地卡羅策略評估以模擬軌跡近似此期望,並用評論員引導終端值。

在碰撞點,使用分離的∇V_k、∇^2 V_k計算Q_k(x,α_φ(x)),並對φ最大化𝔼[Q_k]:

策略迭代為模型基礎。另一途徑為Q學習,可從採樣轉移中無模型實現。

連續時間下Q函數滿足PDE

其中Q_ψ(評論員)與a_ω(演員)皆為MLP。

利用短期轉移(X_t,a_t,r_t,X_{t+Δt})與小步長Δt,實務TD目標為

此對應典型演員-評論員分工:一網路擬合狀態-動作值,另一網路輸出最大化該值的動作。

線性二次調節器為典型連續時間控制基準:線性動態、二次成本及解析解,適合驗證數值求解器。

動態(加性噪聲,1維標量):

代入二次猜測V(x) = -½Px^2 - c至HJB並對a優化,得(完整推導見附錄A):

學得的V_θ與α_φ與解析解V^*(x) = -½Px^2 - c及a^*(x) = -Kx高度吻合:

在學得策略下模擬軌跡(x_0=1.5)及累積折扣獎勵:

收斂診斷(價值擬合均方誤差、策略目標、HJB殘差):

Merton(1969)投資組合問題探討投資者如何在無風險債券與風險資產間分配財富,並選擇消費率,目標為最大化期望終身CRRA(恆定相對風險厭惡)消費效用。此問題亦有解析解,是乘法噪聲下的第二基準。

狀態:財富X_t > 0。控制:a_t = (π_t, k_t) — 風險資產比例與消費佔財富比率k = c/X。

動態(幾何/乘法噪聲):

獎勵(消費流的CRRA效用,γ ≠ 1):

代入冪次猜測V(x) = A/(1-γ) x^{1-γ}至HJB並對(π,k)優化,得(完整推導見附錄B):

解析控制與價值為:

兩個最優控制皆為常數,與財富及時間無關。

學得價值函數吻合解析冪次形式V^*∝ x^{1-γ};兩控制收斂至解析常數:

在學得策略下模擬財富軌跡(X_0=1)及累積折扣獎勵:

相同HJB機制亦出現在擴散模型中,當逆時采樣被寫成控制問題。令p_{data}(x)為目標資料分布。為簡化,考慮前向擴散,其噪聲係數僅依時間變化,如標準分數基SDE形式:

令p_t(x)為Y_t的邊際密度。依標準正則假設,該過程的時間反轉仍為擴散。非從T倒退至0,而定義

則X_0∼p_T,X_T∼p_{data},且X_t邊際為p_{T-t}。

為揭示控制結構,定義逆時漂移與擴散係數

考慮由任意控制場u(x,t)驅動的受控擴散X_t^u:

目標為選擇u使X_T^u的終端分布匹配p_{data}。

定義候選價值函數

此為逆時邊際的負對數密度,終端值為

為識別V滿足的PDE,回顧前向邊際p_t解Y_t的Fokker-Planck方程。故ρ_t(x):=p_{T-t}(x)=e^{-V(x,t)}滿足逆時Fokker-Planck PDE

代入ρ_t=e^{-V},∇_x ρ_t = -e^{-V}∇_x V,∇_x^2 ρ_t = e^{-V}(∇_x V ∇_x V^⊤ - ∇_x^2 V),並除以-e^{-V},得

為將此改寫為控制問題,引入控制變數u,利用二次函數g(y) = ½‖y‖^2的凸共軛恆等式:

設y = -Σ^⊤ ∇_x V,將二次梯度項改寫為

此為關鍵步驟:將二次梯度項替換為線性項,可解釋為受控漂移。

代回V的PDE,乘以-1,並將u無關項收於內部下界,得有限時間HJB方程

此PDE顯示V(x,t) = -log p_{T-t}(x)正是隨機控制問題的價值函數,動態為X_t^u,成本為

最優控制律u^*(x,t)為HJB方程中的極小化者。由上述二次優化,令u對u的導數為零,得

因V(x,t) = -log p_{T-t}(x),故∇_x V = -∇_x log p_{T-t}(x)。代入得精確最優控制律

因此受控漂移為

正是逆時分數修正。

對任意受控軌跡應用Itô公式於V(X_s^u,s),再利用HJB得驗證恆等式

此恆等式為擴散模型的控制理論基石:

故基於擴散的生成建模可視為有限時間隨機最佳控制問題,其最優策略即為分數誘導的逆時漂移修正。