VB FTRL, Cover के ऑनलाइन पोर्टफोलियो चयन ढांचे को करीब करीब समान regret guarantee के साथ अधिक संगणनात्मक रूप से व्यावहारिक बनाने की दिशा में महत्वपूर्ण प्रगति है।[7] Kelly log utility पर आधारित DRL परीक्षण ढांचा यह जांचने देता है कि एजेंट नियंत्रित वातावरण में ज्ञात इष्टतम नीति तक पहुंच पाता है या नहीं।[14] मार्केट...
प्रकाशितकर्ताGPT Image 2 से चित्र बनाए गए
शोध उत्तर

Create a landscape editorial hero image for this Studio Global article: 你现在是一位顶级的量化金融研究员与学术文献挖掘专家。请运用高级 SEO 检索技巧,帮我挖掘关于 Thomas M. Cover 的“Universal Portfolio (通用投资组合)”、“Growth Optimal Investment (增长最优投资)”在最新金融量化. Article summary: `. Topic tags: deepresearch, general web, automation, workflow, productivity. Style: premium digital editorial illustration, source-backed research mood, clean composition, high detail, modern web publication hero. Use reference image context only for broad subject, composition, and topical grounding; do not copy the exact image. Avoid: logos, brand marks, copyrighted characters, real person likenesses, fake screenshots, UI text, readable text, watermarks, charts with fake numbers, clickbait thumbnails, icons, and tiny thumbnail layouts. Make it useful as an illustrative visual, not as factual evidence.
Thomas M. Cover के Universal Portfolio और growth-optimal/Kelly विचार आज भी क्वांट रिसर्च के उपयोगी आधार हैं—लेकिन इन्हें सीधे “डीप लर्निंग से बेहतर रिटर्न” के दावे में बदलना सही नहीं होगा। हालिया प्रगति मुख्यतः तीन मोर्चों पर है: ऑनलाइन कॉन्वेक्स ऑप्टिमाइज़ेशन (OCO) से अधिक कुशल कैपिटल-एलोकेशन, Kelly log-utility के साथ DRL का नियंत्रित मूल्यांकन, और ट्रेडिंग लागत व मार्केट इम्पैक्ट को मॉडल में शामिल करना।7
14
11
सबसे व्यावहारिक पाठ यह है: पहले मजबूत ऑनलाइन या ग्रोथ-ऑप्टिमल बेसलाइन बनाइए, फिर जांचिए कि DRL वास्तव में अतिरिक्त सूचना, समय-आधारित निर्णय या निष्पादन संबंधी लाभ ला रहा है या नहीं।
Cover का Universal Portfolio उस सर्वश्रेष्ठ स्थिर पुनर्संतुलित पोर्टफोलियो से तुलना करता है जिसे केवल भविष्य देखकर, अर्थात hindsight में, चुना जा सकता है। इसकी प्रसिद्ध universality property किसी पूर्वनिर्धारित स्टोकेस्टिक मार्केट मॉडल पर निर्भर नहीं है।8
Kelly अथवा growth-optimal निवेश का उद्देश्य अपेक्षित लॉग-वेल्थ वृद्धि को अधिकतम करना है। DRL में log-utility reward लेने से लक्ष्य चक्रवृद्धि संपत्ति-वृद्धि के करीब आता है, लेकिन इससे Cover-जैसी universality guarantee अपने-आप नहीं मिलती।14
8
यदि (x_t) एसेटों का price-relative vector और (w_t) समय (t) पर पोर्टफोलियो वेट है, तो बिना लागत वाले सरल मॉडल में:
[
W_T = W_0 \prod_{t=1}^{T} w_t^\top x_t.
]
इसी से ऑनलाइन लॉस को इस रूप में लिखा जा सकता है:
[
\ell_t(w)=-\log(w^\top x_t).
]
ऐसे में OCO का regret, सर्वश्रेष्ठ hindsight स्थिर पोर्टफोलियो की तुलना में लॉग-वेल्थ का अंतर मापता है। यही वह गणितीय पुल है जो Universal Portfolio, growth-optimal allocation और online learning को जोड़ता है—पर तीनों की गारंटी एक-दूसरे के स्थान पर नहीं रखी जा सकती।7
8
14
Efficient and Near-Optimal Online Portfolio Selection में Rémi Jézéquel, Dmitrii M. Ostrovskii और Pierre Gaillard ने VB-FTRL प्रस्तावित किया। यह Universal Portfolio के लगभग समान regret guarantee—स्थिर कारक और (\log(T)) की जगह (\log(T+d)) जैसे अंतर के साथ—देने का दावा करता है, जबकि इसकी प्रति-राउंड रनटाइम सीमा (\widetilde{O}(d^2(T+d))) बताई गई है।7
इसका महत्व केवल तेज एल्गोरिद्म होना नहीं है। मूल प्रश्न—निरंतर पोर्टफोलियो-वेट स्पेस में प्रदर्शन-भारित औसत कैसे निकाला जाए—को एक स्पष्ट ऑनलाइन-ऑप्टिमाइज़ेशन समस्या के रूप में संभालने की दिशा मिलती है।
फिर भी, सैद्धांतिक computational improvement को low-latency production readiness नहीं मानना चाहिए। वास्तविक सिस्टम में asset dimension, rebalance frequency, numerical stability, मेमोरी और transaction-cost accounting अलग से जांचने होंगे।7
Evaluation of Deep Reinforcement Learning Algorithms for Portfolio Optimisation ने simulated data में portfolio-optimization DRL algorithms का मूल्यांकन किया और Kelly criterion, यानी log utility, को objective रखा। अध्ययन में बिना market impact के analytic optimal policy निकाली गई, जिसे market impact जोड़ने पर प्रदर्शन की upper-bound reference के रूप में इस्तेमाल किया गया।14
यह ढांचा खास तौर पर उपयोगी है क्योंकि यह सिर्फ पूछता नहीं कि “बैकटेस्ट रिटर्न अच्छा है या नहीं”; यह पूछता है कि जिस वातावरण में इष्टतम उत्तर ज्ञात है, क्या DRL एजेंट उसे सीख सकता है?
पेपर के अनुसार noisy rewards के कारण off-policy algorithms DDPG, TD3 और SAC को सही Q-function सीखने में कठिनाई हुई, जबकि PPO और A2C जैसे on-policy तरीकों ने generalized advantage estimation के साथ बेहतर ढंग से काम किया।14
किसी वास्तविक मार्केट बैकटेस्ट से पहले इस तरह का नियंत्रित परीक्षण उपयोगी है, क्योंकि इससे निम्न त्रुटियां अलग की जा सकती हैं:
हालांकि, simulated environment में सफलता वास्तविक बाजार में टिकाऊ लाभ का प्रमाण नहीं है।14
High order universal portfolios में Cover Universal Portfolio को स्वयं एक synthetic asset के रूप में बाजार में जोड़कर पुनरावृत्त रूप से higher-order universal portfolios बनाने का अध्ययन किया गया है। लेखकों के अनुसार ये higher-order constructions मूल Cover UP से अलग हैं और time-permutation invariance को तोड़ सकते हैं।16
इससे एक रोचक इंजीनियरिंग विचार निकलता है: शेयरों के बीच ही नहीं, बल्कि ट्रेंड, मीन-रिवर्ज़न, कैरी या अन्य ट्रेडेबल उप-रणनीतियों के बीच भी पूंजी आवंटित की जा सकती है।
लेकिन यहां सावधानी अनिवार्य है। किसी strategy sleeve को synthetic asset मानने से पहले उसके return stream में internal trading cost शामिल होनी चाहिए। ऊपर के allocator को overlapping holdings, netting, margin और capital usage भी संभालने होंगे। इसलिए यह विचार उपयोगी शोध-दिशा है, वास्तविक लागत में श्रेष्ठ प्रदर्शन का सिद्ध निष्कर्ष नहीं।16
2026 के एक preprint में realistic market-impact modeling के साथ RL trading systems का परीक्षण किया गया। अध्ययन ने पाया कि cost model absolute performance के साथ-साथ algorithms की relative ranking को भी प्रभावित कर सकता है। उदाहरण के तौर पर, उसके stock-trading environment में optimized PPO का out-of-sample return baseline cost model में 20% और Almgren–Chriss (AC) मॉडल में 15% बताया गया, जबकि TD3 का आंकड़ा 15% से बढ़कर 18% हुआ।11
यह Cover के सिद्धांत का प्रत्यक्ष विस्तार नहीं है, लेकिन growth-optimal या DRL strategy की वास्तविक उपयोगिता जांचने में अत्यंत महत्वपूर्ण है। यदि लागत मॉडल बदलने से ranking बदलती है, तो किसी एक friction assumption के अंतर्गत विजेता बना मॉडल निवेश-निर्णय में वास्तव में बेहतर हो, यह जरूरी नहीं।11
किसी भी portfolio-allocation या RL research stack में कम-से-कम तीन चरण होने चाहिए:
सिर्फ अंतिम equity curve से एक स्थिर शुल्क घटा देना पर्याप्त cost model नहीं है।
यदि (c_t) ट्रेडिंग लागत का अनुपात है और (0\leq c_t<1), तो एक सरलीकृत self-financing wealth recursion है:
[
W_t=W_{t-1}(1-c_t)w_t^\top x_t.
]
तब नेट लॉग-ग्रोथ reward होगा:
[
r_t=\log(w_t^\top x_t)+\log(1-c_t).
]
इसका मतलब है कि turnover cost को reward के बाहर रखने के बजाय wealth process में शामिल करना चाहिए। यदि लागत trade size पर निर्भर है, तो target weights के सीधे अंतर के बजाय price move के बाद की वास्तविक holdings से transaction calculation शुरू होनी चाहिए।
फिर भी, यह केवल एक सरल मॉडल है। इसमें order-book depth, nonlinear impact, borrow cost, financing, partial fills और discrete execution जैसी समस्याएं पूरी तरह शामिल नहीं होतीं।
QuantInsti का risk-constrained Kelly criterion पर ट्यूटोरियल growth-optimal position sizing को समझने के लिए उपयोगी शुरुआती सामग्री हो सकता है। इसके प्रकाशित प्रचार-विवरण में risk-constrained Kelly को data processing, technical indicators, machine learning और position management से जोड़ा गया है।
इसे उपयोगी educational material समझना चाहिए, न कि strategy profitability का स्वतंत्र प्रमाण। इसी तरह, NYU Stern पर उपलब्ध Online Quantitative Trading Strategies दस्तावेज़ Universal Portfolio के Monte Carlo approximation का उल्लेख करता है, क्योंकि मूल continuum averaging को सीधे लागू करने में computational constraints आते हैं।10
Cover की विरासत आज भी प्रासंगिक है, क्योंकि वह predictive signal से पहले capital allocation के अनुशासन पर जोर देती है। VB-FTRL जैसी OCO प्रगति Universal Portfolio को अधिक संगणनात्मक रूप से उपयोगी research baseline बनाती है।7 Kelly-based DRL evaluation यह सिखाता है कि neural agent को पहले ज्ञात optimum के खिलाफ परखना चाहिए।
14 और market-impact research याद दिलाती है कि लागत को अनदेखा करने पर रणनीति की रैंकिंग तक भ्रामक हो सकती है।
11
वर्तमान साक्ष्य के आधार पर सबसे मजबूत व्यावहारिक निष्कर्ष यह नहीं है कि “Universal Portfolio + DRL” ने लाइव ट्रेडिंग में विश्वसनीय अतिरिक्त रिटर्न सिद्ध कर दिया है। अधिक ठोस निष्कर्ष यह है कि यह संयोजन एक बेहतर, अधिक audit-friendly क्वांट रिसर्च ढांचा दे सकता है—बशर्ते तुलना, लागत और निष्पादन मॉडल को गंभीरता से लिया जाए।
7: https://arxiv.org/pdf/2209.13932v2
8: https://arxiv.org/html/1611.09631v1
10: https://www.stern.nyu.edu/sites/default/files/2025-05/Glucksman_Lahanis.pdf
11: https://arxiv.org/html/2603.29086v1
14: https://arxiv.org/pdf/2307.07694
16: https://arxiv.org/abs/2311.13564
: https://x.com/QuantInsti/status/1883885141472514215
Studio Global AI
इस पृष्ठ में एक स्रोत-समर्थित उत्तर शामिल है जिसे आप Studio Global के अंदर जारी रख सकते हैं।
VB FTRL, Cover के ऑनलाइन पोर्टफोलियो चयन ढांचे को करीब करीब समान regret guarantee के साथ अधिक संगणनात्मक रूप से व्यावहारिक बनाने की दिशा में महत्वपूर्ण प्रगति है।[7]
VB FTRL, Cover के ऑनलाइन पोर्टफोलियो चयन ढांचे को करीब करीब समान regret guarantee के साथ अधिक संगणनात्मक रूप से व्यावहारिक बनाने की दिशा में महत्वपूर्ण प्रगति है।[7] Kelly log utility पर आधारित DRL परीक्षण ढांचा यह जांचने देता है कि एजेंट नियंत्रित वातावरण में ज्ञात इष्टतम नीति तक पहुंच पाता है या नहीं।[14]
मार्केट इम्पैक्ट और लागत मॉडल बदलने पर DRL एल्गोरिद्म की रैंकिंग भी बदल सकती है; इसलिए बिना लागत वाले बैकटेस्ट पर्याप्त नहीं हैं।[11]