VB FTRL делает задачу онлайн выбора портфеля существенно более вычислимо управляемой, сохраняя гарантию, близкую к Universal Portfolio.[7] Kelly цель позволяет строить для DRL контролируемые тесты с аналитическим ориентиром, но не доказывает прибыльность на реальном рынке.[14] Рыночный импакт и модель издержек спосо...
ОпубликовалИзображения созданы с помощью GPT Image 2
Ответ на исследование

Create a landscape editorial hero image for this Studio Global article: 你现在是一位顶级的量化金融研究员与学术文献挖掘专家。请运用高级 SEO 检索技巧,帮我挖掘关于 Thomas M. Cover 的“Universal Portfolio (通用投资组合)”、“Growth Optimal Investment (增长最优投资)”在最新金融量化. Article summary: `. Topic tags: deepresearch, general web, automation, workflow, productivity. Style: premium digital editorial illustration, source-backed research mood, clean composition, high detail, modern web publication hero. Use reference image context only for broad subject, composition, and topical grounding; do not copy the exact image. Avoid: logos, brand marks, copyrighted characters, real person likenesses, fake screenshots, UI text, readable text, watermarks, charts with fake numbers, clickbait thumbnails, icons, and tiny thumbnail layouts. Make it useful as an illustrative visual, not as factual evidence.
Идеи Томаса М. Ковера — Universal Portfolio («универсальный портфель») и рост-оптимальное инвестирование, обычно связанное с критерием Kelly, — часто ставят в один ряд с глубоким обучением с подкреплением. Но смешивать их нельзя.
Universal Portfolio сравнивает результат онлайн-алгоритма с лучшим постоянным ребалансируемым портфелем, выбранным только задним числом. Его ключевое свойство — модельная независимость: гарантия не требует заранее задать вероятностную модель рынка.8
Критерий Kelly, напротив, максимизирует ожидаемый логарифм богатства. Современные работы по DRL используют именно эту цель для построения и проверки агентов, но сам по себе логарифмический reward не переносит на нейросеть гарантию универсальности Ковера.14
8
Если $x_t$ — вектор относительных цен активов, а $w_t$ — веса портфеля, то при отсутствии издержек:
$$
W_T = W_0 \prod_{t=1}^{T} w_t^\top x_t.
$$
Отрицательный логарифм роста богатства задаёт естественную онлайн-функцию потерь:
$$
\ell_t(w)=-\log(w^\top x_t).
$$
Для лучшего постоянного портфеля, найденного ретроспективно, разница накопленных потерь равна логарифму отношения богатств:
\log\frac{W_T^\star}{W_T}.
$$
Именно здесь сходятся три направления: OCO оценивает сожаление (regret) относительно фиксированного портфеля, рост-оптимальное инвестирование задаёт понятную целевую функцию, а DRL может выступать способом строить динамическую политику. Однако их теоретические результаты не взаимозаменяемы.
Работа Efficient and Near-Optimal Online Portfolio Selection предлагает алгоритм VB-FTRL — Volumetric-Barrier enhanced Follow-The-Regularized-Leader.7 Это один из наиболее важных современных результатов именно для линии Cover: авторы заявляют гарантию сожаления, близкую к Universal Portfolio, с заменой $\log(T)$ на $\log(T+d)$ и существенно меньшими вычислительными затратами.
7
Заявленная вычислительная сложность на один раунд составляет:
$$
\widetilde{O}(d^2(T+d)).
$$
Здесь $d$ — число активов, а $T$ — число торговых периодов.7
Классический Universal Portfolio концептуально требует усреднять по непрерывному множеству постоянных портфелей, взвешивая их прошлым успехом. Для большого числа инструментов это быстро становится тяжёлой задачей. VB-FTRL переводит её в форму онлайн-оптимизации с явной регуляризацией и анализом сложности.7
Практический вывод: такой алгоритм особенно уместен как базовая модель для:
Но «более эффективен теоретически» не означает «готов для высокочастотного продакшена». На практике отдельно нужно измерять задержки, память, численную устойчивость, ограничения на оборот и стоимость исполнения.
В работе Evaluation of Deep Reinforcement Learning Algorithms for Portfolio Optimisation DRL-алгоритмы тестируются на симулированных данных при целевой функции Kelly, то есть логарифмической полезности.14 Существенная особенность подхода: без рыночного импакта авторы получают аналитически оптимальную политику и используют её как верхний ориентир для среды, где импакт уже добавлен.
14
Это очень полезный исследовательский дизайн. До выхода на исторический рынок можно проверить фундаментальный вопрос: способен ли агент восстановить правильное решение в среде, где правильный ответ известен?
Авторы сообщают, что off-policy алгоритмы DDPG, TD3 и SAC не справлялись с обучением корректной Q-функции из-за шумных наград, тогда как on-policy методы PPO и A2C с generalized advantage estimation лучше работали с шумом и выводили правильную политику в рассматриваемой постановке.14
Хорошая последовательность работы выглядит так:
Красивая кривая капитала без этого цикла не говорит, вызван ли результат обучением, утечкой данных, ошибкой в среде, скрытым плечом или отсутствующими расходами.
Работа High order universal portfolios развивает интересную конструкцию: Universal Portfolio добавляется в рынок как новый синтетический актив, после чего на расширенном наборе строится следующий универсальный портфель.16 Авторы отмечают, что такие портфели отличаются от исходного портфеля Ковера и способны нарушать его инвариантность к перестановке временных периодов.
16
Для инженера это даёт естественную аналогию: объектами аллокации могут быть не только акции или ETF, но и стратегии — трендовые, арбитражные, факторные, опционные или маркет-мейкерские мандаты.
Однако перенос этой идеи в продакшен требует дисциплины:
То есть это перспективная архитектура распределения капитала, а не доказательство того, что многоуровневая схема неизбежно обгонит обычный UP после комиссий.
Исследование Realistic Market Impact Modeling for Reinforcement Learning показывает неприятный, но крайне важный для практики результат: модель издержек влияет не только на абсолютную доходность, но и на относительное ранжирование алгоритмов.11
В приведённых авторами экспериментах оптимизированный PPO показывал лучший out-of-sample результат в базовой постановке, но его доходность снижалась при использовании модели Almgren–Chriss; у TD3, напротив, результат в этой конфигурации улучшался.11
Это означает, что победа алгоритма в бэктесте может быть частично следствием того, как именно модель расходов благоприятствует его обороту, а не более качественного инвестиционного решения.
Для стратегии с логарифмической целью стоит отдельно тестировать:
Нельзя выбирать модель в нулевых издержках, а затем просто вычитать фиксированную комиссию из итоговой кривой капитала.
Пусть $c_t$ — доля богатства, потерянная на торговых издержках в период $t$. В упрощённой самофинансируемой модели:
$$
W_t=W_{t-1}(1-c_t)w_t^\top x_t,
\qquad 0\leq c_t<1.
$$
Тогда чистая награда роста равна:
$$
r_t=\log(w_t^\top x_t)+\log(1-c_t).
$$
Если расходы зависят от объёма ребалансировки, считать оборот нужно от фактических весов после движения рынка, а не просто от разности целевых весов. При отсутствии промежуточных сделок:
$$
\widetilde{w}{t-1,i}=
\frac{w{t-1,i}x_{t-1,i}}
{w_{t-1}^\top x_{t-1}}.
$$
Это важная техническая деталь: иначе исследователь рискует неверно оценить объём сделок и завысить чистую эффективность стратегии. Но даже такая формула не заменяет полноценную модель исполнения: она не покрывает все эффекты импакта, финансирования, займа бумаг и дискретности заявок.
Для прикладного знакомства с риск-ограниченным Kelly полезна работа Стэнфордского университета Risk-Constrained Kelly Gambling. Авторы рассматривают ограничение на вероятность просадки богатства и показывают, как заменить его оценочной границей, получив выпуклую оптимизационную задачу с гарантией выполнения ограничения на риск просадки.13
Это особенно полезно для разделения двух вопросов, которые в проектах часто смешивают:
Риск-ограниченный Kelly — не новая версия теоремы Cover и не доказательство практической эффективности конкретной торговой системы. Зато это полезный мост между максимизацией долгосрочного роста и формальными ограничениями на путь капитала.13
В качестве инженерного дополнения можно также рассмотреть учебную работу NYU Stern Online Quantitative Trading Strategies: в ней Universal Portfolio аппроксимируется методом Монте-Карло из-за вычислительных ограничений.10 Это не рецензируемое доказательство торговой эффективности, но наглядный пример перехода от непрерывной теоретической конструкции к конечной реализации.
Самый продуктивный вопрос сегодня — не «может ли DRL победить Universal Portfolio?», а когда сложной динамической политике действительно нужен DRL.
Если стратегия не использует содержательную межвременную информацию — состояние ликвидности, прогнозируемый импакт, режим рынка, ограничения исполнения, риск инвентаря, — то прозрачный OCO- или Kelly-бенчмарк может оказаться предпочтительнее: его проще проверять, объяснять и поддерживать.
DRL становится более обоснованным, когда именно динамика состояния и исполнения создаёт ценность, которую не улавливает статический или простейший онлайн-аллокатор.
Современное развитие идей Cover и Kelly действительно имеет высокую ценность для количественных финансов — прежде всего как основа для проверяемой онлайн-аллокации капитала, корректных целей обучения и строгих бенчмарков для DRL.
VB-FTRL важен как вычислительно более практичная линия Universal Portfolio.7 Kelly-постановка важна как способ тестировать RL-агентов там, где доступен аналитический ориентир.
14 Исследования рыночного импакта важны как напоминание: без честной модели исполнения даже рейтинг алгоритмов может оказаться артефактом бэктеста.
11
Данных недостаточно, чтобы утверждать, что связка «Universal Portfolio + DRL» уже обеспечивает стабильно воспроизводимую доходность в реальной торговле. Зато она даёт гораздо более сильную исследовательскую методологию: сначала доказуемые и интерпретируемые базовые модели, затем сложное обучение, и только после этого — проверка реальной торгуемости.
7: https://arxiv.org/pdf/2209.13932v2
8: https://arxiv.org/html/1611.09631v1
10: https://www.stern.nyu.edu/sites/default/files/2025-05/Glucksman_Lahanis.pdf
11: https://arxiv.org/html/2603.29086v1
13: https://stanford.edu/~boyd/papers/kelly.html
14: https://arxiv.org/pdf/2307.07694
16: https://arxiv.org/abs/2311.13564
Studio Global AI
На этой странице есть ответ, подтвержденный источником, который вы можете продолжить внутри Studio Global.
VB FTRL делает задачу онлайн выбора портфеля существенно более вычислимо управляемой, сохраняя гарантию, близкую к Universal Portfolio.[7]
VB FTRL делает задачу онлайн выбора портфеля существенно более вычислимо управляемой, сохраняя гарантию, близкую к Universal Portfolio.[7] Kelly цель позволяет строить для DRL контролируемые тесты с аналитическим ориентиром, но не доказывает прибыльность на реальном рынке.[14]
Рыночный импакт и модель издержек способны менять не только доходность, но и рейтинг алгоритмов — их нельзя добавлять в самом конце исследования.[11]