VB FTRL gir en mer beregningsvennlig tilnærming til Cover lignende online porteføljevalg med sterke regret garantier.[7] DRL studier med Kellys logaritmiske nytte er særlig nyttige fordi de kan testes mot analytisk avledede referansestrategier.[14] Handelskostnader og markedspåvirkning kan endre rangeringen mellom R...
Publisert avBilder generert med GPT Image 2
Research answer

Create a landscape editorial hero image for this Studio Global article: 你现在是一位顶级的量化金融研究员与学术文献挖掘专家。请运用高级 SEO 检索技巧,帮我挖掘关于 Thomas M. Cover 的“Universal Portfolio (通用投资组合)”、“Growth Optimal Investment (增长最优投资)”在最新金融量化. Article summary: `. Topic tags: deepresearch, general web, automation, workflow, productivity. Style: premium digital editorial illustration, source-backed research mood, clean composition, high detail, modern web publication hero. Use reference image context only for broad subject, composition, and topical grounding; do not copy the exact image. Avoid: logos, brand marks, copyrighted characters, real person likenesses, fake screenshots, UI text, readable text, watermarks, charts with fake numbers, clickbait thumbnails, icons, and tiny thumbnail layouts. Make it useful as an illustrative visual, not as factual evidence.
Thomas M. Covers Universal Portfolio og vekstoptimal investering i Kelly-tradisjonen er igjen aktuelle i kvantitativ finans. Det mest interessante i nyere arbeid er imidlertid ikke et generelt løfte om at «AI slår markedet». Det er koblingen mellom tre konkrete problemstillinger:
Covers Universal Portfolio sammenlignes med den beste konstante, rebalanserte porteføljen valgt i ettertid. Den klassiske universalitetsegenskapen er modellfri: den forutsetter ikke at markedet følger en bestemt sannsynlighetsmodell.8
Kelly-kriteriet, eller vekstoptimal investering, handler derimot om å maksimere forventet logaritmisk formuesvekst. DRL kan bruke dette som belønningsfunksjon, men en agent med logaritmisk belønning arver ikke automatisk Covers universalitetsgaranti.14
8
Med prisrelative avkastninger (x_t) og porteføljevekter (w_t) kan formuen uten kostnader skrives som:
$$
W_T = W_0 \prod_{t=1}^{T} w_t^\top x_t.
$$
Den negative log-formuesveksten gir et naturlig online-tap:
$$
\ell_t(w) = -\log(w^\top x_t).
$$
Forskjellen mot den beste konstante porteføljen i ettertid blir da:
\log\frac{W_T^\star}{W_T}.
$$
Dette er en viktig bro mellom online konveks optimalisering (OCO), vekstoptimal investering og maskinlæring: alle kan uttrykkes gjennom kumulert logaritmisk formuesvekst, men de har ulike garantier og ulike praktiske formål.7
14
Artikkelen Efficient and Near-Optimal Online Portfolio Selection av Rémi Jézéquel, Dmitrii M. Ostrovskii og Pierre Gaillard er den mest direkte nyere videreføringen av Covers problemstilling.7
Forskerne introduserer VB-FTRL (Volumetric-Barrier enhanced Follow-The-Regularized-Leader), en metode for online porteføljevalg som i hovedsak beholder regret-garantiene fra Universal Portfolio, samtidig som den reduserer beregningskostnaden betydelig. Den rapporterte kjøretiden per runde er
$$
\widetilde{O}(d^2(T+d)),
$$
hvor (d) er antall aktiva og (T) antall handelsperioder.7
Den opprinnelige Universal Portfolio krever i prinsippet en prestasjonsvektet integrasjon over et kontinuerlig rom av mulige porteføljevekter. Det er elegant teoretisk, men krevende når antall aktiva og antall observasjoner vokser.
VB-FTRL flytter derfor problemstillingen fra en tung integralberegning til en mer eksplisitt online-optimaliseringsmetode. Det gjør metoden relevant som referansemodell for:
Det betyr likevel ikke at metoden automatisk passer for høyfrekvent produksjonshandel. Teoretisk kompleksitet sier ikke alene nok om latenstid, minnebruk, numerisk stabilitet, markedsdata, porteføljerestriksjoner eller transaksjonskostnader.7
I Evaluation of Deep Reinforcement Learning Algorithms for Portfolio Optimisation undersøkes DRL-algoritmer på simulerte porteføljeproblemer med Kellys logaritmiske nytte som mål.14
Det sentrale bidraget er metodisk: uten markedspåvirkning kan forfatterne analytisk utlede den optimale policyen. Denne brukes som en øvre referanse når markedspåvirkning senere tas inn i miljøet.14
Det gir et langt sterkere testoppsett enn en vanlig historisk backtest. I en historisk test er det vanskelig å vite om en RL-agent faktisk har lært et økonomisk relevant mønster, om den utnytter en feil i miljøet, eller om resultatet skyldes skjult gearing, lekkasje eller mangelfull kostnadsmodellering.
Studien rapporterer at off-policy-metodene DDPG, TD3 og SAC hadde problemer med å lære riktig Q-funksjon under støyende belønninger, mens on-policy-metodene PPO og A2C med generalisert fordelestimering håndterte dette bedre i det simulerte oppsettet.14
Før en DRL-modell vurderes på markedsdata, bør den klare et kontrollert miljø der den optimale løsningen er kjent. Først da blir det mulig å kontrollere:
Arbeidet High order universal portfolios utforsker hva som skjer når en eksisterende Universal Portfolio legges til markedet som et nytt, syntetisk aktivum, før man igjen konstruerer en Universal Portfolio over det utvidede markedet.16
Forfatterne viser blant annet at disse høyereordens-porteføljene er ulike den opprinnelige Cover-porteføljen og kan bryte tidspermutasjonsinvarians.16
For en kvantforvalter peker dette mot en interessant arkitektur: I stedet for bare å fordele kapital mellom aksjer, renter eller råvarer, kan man fordele kapital mellom strategier. Trendfølgere, statistisk arbitrasje, faktorstrategier og markedsnøytrale modeller kan i prinsippet behandles som avkastningsstrømmer i et overordnet allokeringslag.
Men dette krever ekstra disiplin. En strategi er ikke et friksjonsfritt aktivum. Den underliggende avkastningen må allerede inneholde interne handelskostnader, og den samlede porteføljen må håndtere overlappende posisjoner, nettohandel, marginbehov og kapasitet.16
En nyere preprint om realistisk modellering av markedspåvirkning i RL-handel viser at kostnadsmodellen påvirker både absolutte resultater og den relative rangeringen mellom algoritmer.11
I studien falt eksempelvis optimalisert PPO fra 20 % avkastning og Sharpe 1,06 i en basismodell til 15 % under en Almgren–Chriss-inspirert kostnadsmodell, mens TD3 forbedret seg fra 15 % til 18 % i den samme sammenligningen.11
Dette er ikke en direkte utvidelse av Cover-teorien, men det er svært relevant for alle forsøk på å bruke vekstoptimalisering eller DRL i handel. En strategi kan se best ut under én kostnadsantakelse og svakere ut under en annen. Dermed kan tilbakeblikktester ikke tolkes uten å beskrive utførelsesmodellen.
Et forenklet selvfinansierende oppsett med kostnad (c_t) kan skrives som:
$$
W_t = W_{t-1}(1-c_t)w_t^\top x_t,
\qquad 0\leq c_t<1.
$$
Da blir netto belønning:
$$
r_t = \log(w_t^\top x_t)+\log(1-c_t).
$$
I praksis bør (c_t) avhenge av faktisk omsatt volum, ikke bare endringen i målvekter. Prisbevegelsen mellom to rebalanseringer må også tas hensyn til når reell handelsmengde beregnes.
For vekstoptimal posisjonering er risikobegrenset Kelly et relevant supplement. Forskning fra Stanford viser hvordan en grense for sannsynligheten for formuesfall kan erstattes med en konveks restriksjon som gir en garanti for at drawdown-kravet holdes.13
Dette er verdifullt fordi ren Kelly-optimalisering ofte kan gi aggressive vekter. Men det er viktig å holde begrepene fra hverandre: å legge til drawdown-, likviditets- eller gearingsrestriksjoner endrer det opprinnelige optimaliseringsproblemet. Man kan ikke uten videre hevde både original Universal Portfolio-garanti og en separat praktisk risikogaranti samtidig.13
8
En robust utviklingsprosess bør starte med enkle, målbare referanser før et ende-til-ende RL-system trenes:
Den mest troverdige nyere utviklingen rundt Cover og vekstoptimal investering ligger i bedre online-optimalisering, mer testbare DRL-miljøer og strengere modellering av friksjoner.7
14
11
For praktisk kvantutvikling er den beste inngangen trolig ikke å la en dyp RL-agent styre alt. Et mer etterprøvbart oppsett er å bruke Universal Portfolio- og Kelly-inspirerte metoder som baseline for kapitalallokering, og så undersøke om DRL gir en målbar forbedring når den får tilgang til reell tidsavhengig informasjon, utførelsesbegrensninger eller markedspåvirkning.
Det finnes foreløpig ikke tilstrekkelig belegg for at kombinasjonen Universal Portfolio og DRL alene gir stabil, replikerbar meravkastning i live-handel. Den tydeligste verdien ligger derfor i bedre benchmarker, mer presise mål og færre utestede antakelser.
7: https://arxiv.org/pdf/2209.13932v2
8: https://arxiv.org/html/1611.09631v1
10: https://www.stern.nyu.edu/sites/default/files/2025-05/Glucksman_Lahanis.pdf
11: https://arxiv.org/html/2603.29086v1
13: https://stanford.edu/~boyd/papers/kelly.html
14: https://arxiv.org/pdf/2307.07694
16: https://arxiv.org/abs/2311.13564
Studio Global AI
This page includes a source-backed answer you can continue inside Studio Global.
VB FTRL gir en mer beregningsvennlig tilnærming til Cover lignende online porteføljevalg med sterke regret garantier.[7]
VB FTRL gir en mer beregningsvennlig tilnærming til Cover lignende online porteføljevalg med sterke regret garantier.[7] DRL studier med Kellys logaritmiske nytte er særlig nyttige fordi de kan testes mot analytisk avledede referansestrategier.[14]
Handelskostnader og markedspåvirkning kan endre rangeringen mellom RL algoritmer, ikke bare den absolutte avkastningen.[11]