VB FTRL menawarkan lanjutan langsung kepada masalah Universal Portfolio dengan jaminan regret yang hampir sama, tetapi kos pengiraan lebih rendah.[7] Kajian DRL berasaskan utiliti log Kelly memberi penanda aras analitik untuk menguji sama ada agen benar benar mempelajari dasar pelaburan yang betul.[14] Model kos dan...
Diterbitkan olehImej dijana dengan GPT Image 2
Research answer

Create a landscape editorial hero image for this Studio Global article: 你现在是一位顶级的量化金融研究员与学术文献挖掘专家。请运用高级 SEO 检索技巧,帮我挖掘关于 Thomas M. Cover 的“Universal Portfolio (通用投资组合)”、“Growth Optimal Investment (增长最优投资)”在最新金融量化. Article summary: `. Topic tags: deepresearch, general web, automation, workflow, productivity. Style: premium digital editorial illustration, source-backed research mood, clean composition, high detail, modern web publication hero. Use reference image context only for broad subject, composition, and topical grounding; do not copy the exact image. Avoid: logos, brand marks, copyrighted characters, real person likenesses, fake screenshots, UI text, readable text, watermarks, charts with fake numbers, clickbait thumbnails, icons, and tiny thumbnail layouts. Make it useful as an illustrative visual, not as factual evidence.
Dalam lima tahun kebelakangan ini, kebangkitan semula idea Universal Portfolio Thomas M. Cover lebih banyak berlaku melalui tiga laluan praktikal: pengoptimuman konveks dalam talian (online convex optimization, OCO), objektif pertumbuhan log/Kelly untuk menguji deep reinforcement learning (DRL), dan pemodelan kos dagangan serta impak pasaran. Ini penting untuk pembangun strategi kuantitatif kerana ia mengalihkan tumpuan daripada “ramalan harga yang nampak hebat” kepada soalan lebih asas: bagaimana modal diagihkan, bagaimana strategi dibandingkan secara adil, dan sama ada keuntungan masih wujud selepas kos.7
14
11
Namun, had bukti mesti dijelaskan dari awal: literatur yang dirujuk menyokong nilai teori dan nilai kejuruteraan sebagai rangka kerja penyelidikan. Ia tidak membuktikan bahawa gabungan Universal Portfolio dengan DRL sudah menghasilkan pulangan lebihan yang stabil, boleh diulang dan boleh diskalakan dalam pasaran sebenar.7
14
11
Universal Portfolio Cover membandingkan prestasi pelabur dalam talian dengan portfolio imbangan semula berat tetap terbaik yang hanya diketahui selepas tempoh pelaburan berakhir. Sifat “universal” itu bersifat bebas model: ia tidak memerlukan andaian awal tentang proses stokastik pasaran.8
Sebaliknya, pelaburan pertumbuhan optimum atau kriteria Kelly memaksimumkan pertumbuhan kekayaan secara logaritma. DRL boleh menggunakan objektif ini sebagai ganjaran, tetapi penggunaan ganjaran log sahaja tidak secara automatik memberi agen DRL jaminan universal Cover.14
8
Jika (x_t) ialah vektor relatif harga aset pada masa (t), dan (w_t) ialah wajaran portfolio, kekayaan tanpa kos transaksi boleh ditulis sebagai:
$$
W_T = W_0 \prod_{t=1}^{T} w_t^\top x_t.
$$
Kerugian dalam bentuk OCO pula ialah:
$$
\ell_t(w) = -\log(w^\top x_t).
$$
Dengan (W_T^\star) sebagai kekayaan portfolio berat tetap terbaik secara retrospektif, regret kumulatif bersamaan jurang kekayaan log:
$$
R_T = \sum_{t=1}^{T}\ell_t(w_t)-\min_{w\in\Delta_d}\sum_{t=1}^{T}\ell_t(w)
=\log\frac{W_T^\star}{W_T}.
$$
Di sinilah tiga bidang ini bertemu: OCO mengukur jurang berbanding portfolio tetap terbaik, Kelly menyatakan objektif pertumbuhan, manakala DRL ialah satu pendekatan untuk mencari dasar dinamik. Struktur matematiknya berkait, tetapi jaminan teorinya tidak boleh ditukar ganti secara sewenang-wenangnya.7
8
14
Kertas Efficient and Near-Optimal Online Portfolio Selection oleh Rémi Jézéquel, Dmitrii M. Ostrovskii dan Pierre Gaillard ialah bacaan utama bagi sesiapa yang mahu memahami lanjutan moden kepada masalah Cover.7
Penulis memperkenalkan VB-FTRL (Volumetric-Barrier enhanced Follow-The-Regularized-Leader), iaitu algoritma pemilihan portfolio dalam talian yang mengekalkan jaminan regret yang pada asasnya setanding dengan Universal Portfolio, tertakluk pada faktor pemalar dan penggantian (\log(T)) dengan (\log(T+d)). Kertas itu melaporkan masa jalan per pusingan sebanyak (\widetilde{O}(d^2(T+d))).7
Nilai praktikalnya bukan sekadar algoritma yang lebih baharu. Ia mengubah masalah daripada pengamiran wajaran kekayaan merentasi ruang portfolio berterusan kepada prosedur pengoptimuman dalam talian dengan struktur dan analisis kerumitan yang jelas.7
Bagi pasukan kuantitatif, VB-FTRL lebih munasabah dijadikan penanda aras pengagihan modal berbanding terus dianggap enjin dagangan frekuensi tinggi. Kerumitan teorinya masih bergantung pada bilangan aset (d) dan bilangan pusingan (T). Kependaman, penggunaan memori, kestabilan numerik, kekangan kecairan dan kos transaksi tetap perlu diuji secara berasingan sebelum sebarang penggunaan produksi.
Kertas Evaluation of Deep Reinforcement Learning Algorithms for Portfolio Optimisation menggunakan data simulasi dan objektif Kelly, iaitu utiliti log, untuk menilai algoritma DRL dalam pengoptimuman portfolio.14
Reka bentuk ini amat berguna: dalam keadaan tanpa impak pasaran, dasar optimum boleh diterbitkan secara analitik. Dasar tersebut kemudian menjadi rujukan atau had atas apabila eksperimen diperluas kepada keadaan yang mengandungi impak pasaran.14
Dapatan pentingnya ialah bukan semua agen DRL mengendalikan ganjaran kewangan yang hingar dengan sama baik. Kajian itu melaporkan bahawa algoritma luar dasar seperti DDPG, TD3 dan SAC gagal mempelajari fungsi-Q yang tepat dalam tetapan mereka kerana hingar ganjaran, manakala PPO dan A2C dengan generalised advantage estimation dapat mengurus hingar tersebut dengan lebih baik.14
Sudut penyelidikan yang patut diambil ialah: sebelum melatih agen pada data sejarah sebenar, uji dahulu sama ada persekitaran, urutan transaksi dan fungsi ganjaran mampu mengembalikan jawapan yang diketahui. Jika penanda aras analitik pun gagal dicapai, graf nilai portfolio yang menarik dalam backtest tidak cukup untuk membuktikan bahawa agen telah menemui kelebihan pasaran.
Kertas High order universal portfolios mengembangkan Universal Portfolio dengan memasukkan Universal Portfolio sedia ada sebagai satu aset sintetik dalam pasaran, lalu membina portfolio universal peringkat lebih tinggi secara berulang.16
Penulis menunjukkan bahawa konstruk peringkat tinggi ini berbeza daripada Universal Portfolio Cover asal dan boleh memecahkan sifat invarians terhadap permutasi masa.16
Dari sudut kejuruteraan, idea ini menarik untuk masalah portfolio-of-strategies. Daripada hanya mengagihkan modal antara saham atau ETF, pengurus kuantitatif boleh menilai aliran pulangan daripada strategi trend, mean reversion, arbitraj atau strategi faktor sebagai komponen yang hendak diagihkan modal.
Tetapi ini ialah inferens reka bentuk, bukannya bukti keuntungan sebenar. Setiap aliran pulangan strategi mesti sudah menolak kos dagangan dalaman. Di lapisan portfolio pula, pasukan perlu mengurus pegangan bertindih, netting pesanan, margin, pembiayaan dan kos pelaksanaan tambahan. Menggabungkan beberapa backtest yang cantik tidak menjadikannya aset tanpa geseran.
Kertas 2026 mengenai pemodelan impak pasaran yang lebih realistik melaporkan bahawa spesifikasi model kos memberi kesan material kepada prestasi mutlak dan juga kedudukan relatif algoritma DRL merentas persekitaran yang diuji.11
Sebagai contoh, di bawah satu tetapan perdagangan saham yang dilaporkan, PPO yang dioptimumkan memperoleh pulangan luar sampel 20% dengan Sharpe 1.06 dalam model asas, tetapi pulangannya turun kepada 15% dalam model Almgren–Chriss; dalam keadaan sama, TD3 meningkat daripada 15% kepada 18%.11
Kertas ini bukan lanjutan langsung kepada teori Cover. Namun, ia sangat relevan untuk semua strategi pertumbuhan optimum dan DRL: strategi yang kelihatan terbaik mungkin menang kerana andaian kos menyebelahi corak pusing gantiannya, bukannya kerana keputusan pelaburannya benar-benar lebih baik.11
Oleh itu, kajian yang kukuh perlu memisahkan sekurang-kurangnya tiga lapisan ujian:
Kelly dan Universal Portfolio memaksa penyelidik membezakan dua perkara: adakah model mempunyai isyarat yang berguna, dan berapakah modal yang patut diperuntukkan kepada isyarat itu? Ini mengelakkan kesilapan lazim apabila skor ramalan atau kebarangkalian model terus diterjemahkan menjadi saiz posisi tanpa lapisan pengurusan modal.
Bahan Stanford tentang Risk-Constrained Kelly Gambling juga menunjukkan bahawa kekangan risiko pengeluaran boleh dirumuskan melalui pendekatan pengoptimuman konveks dalam masalah Kelly.13 Ia berguna sebagai rujukan apabila objektif pertumbuhan perlu diseimbangkan dengan had risiko laluan kekayaan.
Portfolio tetap terbaik secara retrospektif ialah penanda aras OCO; dasar Kelly analitik dalam simulasi pula ialah penanda aras untuk persekitaran DRL.8
14
Kedua-duanya menjawab soalan yang berbeza:
Portfolio retrospektif terbaik bukan strategi yang boleh terus dilaksanakan. Nilainya ialah sebagai kayu ukur yang telus, bukan sebagai isyarat dagangan masa nyata.
Urutan penyelidikan yang praktikal ialah:
Untuk kos (c_t) sebagai bahagian daripada kekayaan sebelum dagangan, model kendiri yang dipermudah boleh ditulis sebagai:
$$
W_t=W_{t-1}(1-c_t)w_t^\top x_t, \qquad 0\le c_t<1.
$$
Ganjaran pertumbuhan bersih ialah:
$$
r_t=\log(w_t^\top x_t)+\log(1-c_t).
$$
Jika kos bergantung pada jumlah dagangan, wajaran sebenar selepas pergerakan harga perlu digunakan, bukan hanya perubahan wajaran sasaran. Tanpa dagangan pertengahan, wajaran selepas harga bergerak ialah:
$$
\widetilde{w}{t-1,i}=\frac{w{t-1,i}x_{t-1,i}}{w_{t-1}^\top x_{t-1}}.
$$
Ini masih model ringkas; ia tidak secara automatik meliputi pinjaman saham, pembiayaan, saiz lot, pesanan separa terisi atau impak silang aset.
Nota Online Quantitative Trading Strategies yang dihoskan oleh NYU Stern menerangkan pendekatan anggaran Monte Carlo untuk Universal Portfolio kerana kekangan pengiraan.10 Ia berguna sebagai jambatan antara definisi teori dan prototaip backtest, tetapi status bahan institusi tidak sama dengan pengesahan semakan rakan sebaya atau bukti dagangan sebenar.
10
Untuk Kelly berasaskan pengurusan risiko, tutorial QuantInsti mengenai risk-constrained Kelly criterion boleh dijadikan bahan pengenalan kepada pemisahan antara ramalan, pengurusan posisi dan kawalan risiko. Namun, bahan blog atau promosi penerbit tidak patut dianggap sebagai pengesahan bebas bahawa kod, backtest atau hasil strateginya bebas kebocoran data dan boleh diulang.13
Soalan yang lebih berguna untuk projek kuantitatif ialah: di bawah kos, risiko dan set maklumat yang sama, adakah DRL memberi nilai tambahan berbanding asas pengoptimuman dalam talian berasaskan pertumbuhan?
Jika ya, penyelidik perlu menunjukkan bahawa nilai tambahan itu datang daripada penggunaan keadaan rentas masa, kekangan pelaksanaan atau struktur impak pasaran — bukan daripada kebocoran data, leverage tersirat atau andaian kos yang terlalu lembut. VB-FTRL menyediakan asas OCO yang kuat untuk perbandingan tersebut; objektif Kelly menyediakan bahasa pertumbuhan yang jelas; dan kajian impak pasaran mengingatkan bahawa strategi hanya bernilai apabila ia kekal berfungsi selepas realiti pelaksanaan dimasukkan.7
14
11
7: https://arxiv.org/pdf/2209.13932v2
8: https://arxiv.org/html/1611.09631v1
10: https://www.stern.nyu.edu/sites/default/files/2025-05/Glucksman_Lahanis.pdf
11: https://arxiv.org/html/2603.29086v1
13: https://stanford.edu/~boyd/papers/kelly.html
14: https://arxiv.org/pdf/2307.07694
16: https://arxiv.org/abs/2311.13564
Studio Global AI
This page includes a source-backed answer you can continue inside Studio Global.
VB FTRL menawarkan lanjutan langsung kepada masalah Universal Portfolio dengan jaminan regret yang hampir sama, tetapi kos pengiraan lebih rendah.[7]
VB FTRL menawarkan lanjutan langsung kepada masalah Universal Portfolio dengan jaminan regret yang hampir sama, tetapi kos pengiraan lebih rendah.[7] Kajian DRL berasaskan utiliti log Kelly memberi penanda aras analitik untuk menguji sama ada agen benar benar mempelajari dasar pelaburan yang betul.[14]
Model kos dan impak pasaran boleh mengubah kedudukan relatif algoritma; keputusan backtest tidak boleh dipisahkan daripada andaian pelaksanaan.[11]