VB FTRL 直接延續 Cover 嘅在線投資組合問題,喺近似維持 Universal Portfolio 遺憾保證下,改善運算負擔。[7] Kelly 對數效用可用作 DRL 投資組合研究嘅可驗證目標;有研究喺模擬環境推導解析最優策略,檢驗智能體有冇學啱。[14] 交易成本同市場衝擊唔係回測最後先加嘅「附加項」:成本模型可以改變不同 RL 算法嘅相對排名。[11]
發布者圖片由 GPT Image 2 生成
研究答案

Create a landscape editorial hero image for this Studio Global article: 你现在是一位顶级的量化金融研究员与学术文献挖掘专家。请运用高级 SEO 检索技巧,帮我挖掘关于 Thomas M. Cover 的“Universal Portfolio (通用投资组合)”、“Growth Optimal Investment (增长最优投资)”在最新金融量化. Article summary: `. Topic tags: deepresearch, general web, automation, workflow, productivity. Style: premium digital editorial illustration, source-backed research mood, clean composition, high detail, modern web publication hero. Use reference image context only for broad subject, composition, and topical grounding; do not copy the exact image. Avoid: logos, brand marks, copyrighted characters, real person likenesses, fake screenshots, UI text, readable text, watermarks, charts with fake numbers, clickbait thumbnails, icons, and tiny thumbnail layouts. Make it useful as an illustrative visual, not as factual evidence.
Cover 嘅 Universal Portfolio(通用投資組合) 同 Kelly/增長最優投資,近年最有價值嘅發展,唔係單純將舊理論套入神經網絡,而係形成一套更容易驗證嘅量化工程流程:用在線凸優化(OCO)做資金配置基線、用對數財富做 DRL 訓練與驗證目標、再將成本與市場衝擊正式放入評價框架。7
14
11
不過要先講清楚:現有資料支持佢哋有好強研究價值,但未足以證明「Universal Portfolio 加 DRL」已經係可穩定複製、可直接落實盤嘅超額收益方案。7
14
11
Cover 通用投資組合比較嘅對象,係事後先知道邊個最好嘅固定權重、持續再平衡組合。其「通用性」意思係唔需要預先假設市場一定跟隨某一個隨機模型;但佢唔係話可以擊敗所有動態交易策略。8
Kelly/增長最優投資則以最大化長期對數財富增長為核心。近期 DRL 組合研究就直接用 Kelly 對數效用做目標,但「用咗 log reward」並唔代表模型自動擁有 Cover 定理嘅通用保證。14
8
如果以 $x_t$ 表示資產嘅價格相對值、$w_t$ 表示當期權重,喺冇交易成本而且財富保持正數嘅情況下:
$$
W_T=W_0\prod_{t=1}^{T}w_t^\top x_t.
$$
相應嘅在線損失可以寫成:
$$
\ell_t(w)=-\log(w^\top x_t).
$$
因此,OCO 所講嘅累積遺憾,本質上正正係策略相對「事後最佳固定再平衡組合」損失咗幾多對數財富:
\log\frac{W_T^\star}{W_T}.
$$
呢個係三個領域嘅交匯點:OCO 處理累積對數財富差距,Kelly 處理增長目標,DRL 則可用嚟求解有狀態、跨期同執行約束嘅動態決策。數學上有共通之處,但理論保證唔可以互相搬字過紙。7
8
14
Efficient and Near-Optimal Online Portfolio Selection 提出 VB-FTRL(Volumetric-Barrier enhanced Follow-The-Regularized-Leader),直接處理 Cover 式在線投資組合選擇問題。7
論文嘅重點唔係預測下一支股票升跌,而係:當資產回報一路到嚟,點樣逐期調整配置,同時保持接近 Universal Portfolio 嘅遺憾保證。作者表示,方法基本維持 Universal Portfolio 級別嘅保證,只係涉及常數因子及將 $\log(T)$ 換成 $\log(T+d)$;其每輪運算時間報告為:
$$
\widetilde{O}(d^2(T+d)).
$$
最實際嘅定位係做:
即係話,研究重點可以由「估中市場」轉去「已經有幾條收益流時,資金點分先合理」。呢類問題一般比端到端同時學訊號、槓桿、倉位同執行更容易診斷。
但都唔好過度解讀:理論上更快,唔等於已經適合高頻生產環境。資產數目 $d$、交易期數 $T$、數值穩定性、記憶體、延遲同成本處理,全部仍然要獨立壓測。7
Evaluation of Deep Reinforcement Learning Algorithms for Portfolio Optimisation 用模擬數據評估 DRL 投資組合方法,並以 Kelly 對數效用 作目標。14
佢最有價值嘅設計係:喺冇市場衝擊嘅情況下,研究者可以推導出解析最優策略;加入衝擊後,再將該結果當成表現參照上界。換句話講,唔係淨係睇一條回測淨值線靚唔靚,而係問:個 agent 有冇喺一個可知正解嘅世界入面學到正確決策?14
論文摘要指出,DDPG、TD3 同 SAC 等 off-policy 方法會因獎勵雜訊而未能學到正確 Q-function;PPO 同 A2C 配合 generalized advantage estimation,則較能處理相關問題。14
金融 DRL 最常見嘅問題之一,係環境本身可能有錯:交易時點對唔上、成本漏計、槓桿暗中放大,或者資料穿越。就算回測賺錢,都未必知道收益係來自策略能力,定係模擬器漏洞。
所以,一個較穩陣嘅開發次序係:
呢個唔係保證賺錢,但係大幅提高研究可重現性同除錯效率。14
High order universal portfolios 探索一個有意思嘅擴展:將原有 Universal Portfolio 加入市場,視為一項新嘅合成資產,再遞迴建立更高階嘅通用投資組合。16
作者指出,高階 UP 同原始 Cover UP 確實唔同,並能打破時間排列不變性(time permutation invariance)。16
對工程師嚟講,最自然嘅啟發係「策略作為資產」:唔一定淨係喺股票之間配錢,亦可以喺趨勢跟隨、均值回歸、套利,或者其他可交易子策略之間做上層配置。16
不過,呢一步有一個非常現實嘅陷阱:每條子策略嘅收益一定要先扣埋內部交易成本;上層組合仲要處理重疊持倉、淨額交易、融資同資本佔用。唔可以將幾條「各自回測好靚」嘅策略,直接當成零摩擦資產去配。
關於強化學習交易,最值得配套閱讀嘅係市場衝擊研究。Realistic Market Impact Modeling for Reinforcement Learning 指出,成本模型唔止影響絕對收益,仲會影響不同演算法嘅相對排名。11
文中一個例子係:優化後 PPO 喺基準成本設定下嘅樣本外回報為 20%、Sharpe 為 1.06;改用 AC 衝擊模型後,回報跌至 15%。同期 TD3 則由 15% 升至 18%。11
重點唔係邊個模型「最勁」,而係:成本假設本身可以改寫結論。
因此,研究增長最優或 DRL 策略時,建議最少分三層測試:
最唔應該做嘅,係先喺無成本世界訓練同揀策略,最後先從淨值一筆過扣個固定費用。11
設 $c_t$ 係交易成本佔交易前財富嘅比例,一個簡化自融資模型可寫成:
$$
W_t=W_{t-1}(1-c_t)w_t^\top x_t,
\qquad 0\le c_t<1.
$$
相應嘅淨增長 reward 為:
$$
r_t=\log(w_t^\top x_t)+\log(1-c_t).
$$
如果成本取決於實際成交量,應該由價格變動後嘅持倉權重開始計,而唔係只睇目標權重嘅差:
$$
\widetilde{w}{t-1,i}=
\frac{w{t-1,i}x_{t-1,i}}
{w_{t-1}^\top x_{t-1}}.
$$
呢個做法可避免將「目標權重改變」錯當成「真實需要成交嘅數量」。但要留意,呢個仍然只係簡化模型,未自動涵蓋買賣價差、衝擊、融資、借券、最小交易單位同成交失敗等問題。
QuantInsti 關於風險約束 Kelly Criterion 嘅教程,可作為由預測訊號走向下注規模/倉位管理嘅入門線索。其發布方材料將風險約束 Kelly 與數據處理、技術指標、機器學習及倉位管理連結起來。
不過,呢類內容應視為工程導讀,而唔係策略有效性證明:單靠發布方推廣資料,唔能夠驗證程式有冇資料洩漏、回測假設係咪合理,或者結果能否獨立重現。
另外,NYU Stern 托管嘅 Online Quantitative Trading Strategies 有討論以 Monte Carlo 抽樣近似 Cover Universal Portfolio,反映原始連續權重積分喺實作上嘅計算難題。10 呢份材料適合作為由理論走去回測原型嘅補充,但機構托管唔等於同行評審,更唔等於實盤驗證。
10
而家真正值得立項嘅問題,唔係籠統地問「DRL 可唔可以打贏 Universal Portfolio」,而係:
喺同一資訊集、同一成本模型、同一風險約束下,DRL 相比在線增長最優基線嘅增益,到底係來自有效嘅跨期狀態資訊,定係來自環境設定與回測假設?
一個務實研究設計可以係:
Cover 理論至今仍然有穿透力,正正因為佢提供咗一個唔依賴事前市場模型、又可量化比較嘅基準;而 Kelly 目標則令「複利財富」變成清晰可檢驗嘅優化對象。DRL 最有價值嘅角色,未必係取代兩者,而係喺存在狀態、衝擊同跨期約束時,證明自己真係能夠帶來超越結構化基線嘅增量。7
8
14
7: https://arxiv.org/pdf/2209.13932v2
8: https://arxiv.org/html/1611.09631v1
10: https://www.stern.nyu.edu/sites/default/files/2025-05/Glucksman_Lahanis.pdf
11: https://arxiv.org/html/2603.29086v1
14: https://arxiv.org/pdf/2307.07694
16: https://arxiv.org/abs/2311.13564
: https://x.com/QuantInsti/status/1883885141472514215
Studio Global AI
此頁麵包含一個有來源支援的答案,您可以在 Studio Global 內繼續。
VB FTRL 直接延續 Cover 嘅在線投資組合問題,喺近似維持 Universal Portfolio 遺憾保證下,改善運算負擔。[7]
VB FTRL 直接延續 Cover 嘅在線投資組合問題,喺近似維持 Universal Portfolio 遺憾保證下,改善運算負擔。[7] Kelly 對數效用可用作 DRL 投資組合研究嘅可驗證目標;有研究喺模擬環境推導解析最優策略,檢驗智能體有冇學啱。[14]
交易成本同市場衝擊唔係回測最後先加嘅「附加項」:成本模型可以改變不同 RL 算法嘅相對排名。[11]