MDP в зависимых системах: информационное преимущество, достаточные статистики и контрмеры

В системах с зависимыми событиями (где извлечение элементов из конечного набора изменяет вероятности будущих исходов) решения участника напрямую влияют на математическое ожидание. Данная статья формализует такие системы через Марковский процесс принятия решений (MDP), анализирует мониторинг состава выборки как достаточную статистику и рассчитывает реальную ожидаемую доходность с учётом контрмер оператора.

Что делает систему «зависимой»

В IID-системах каждое событие генерируется независимо от предыдущих (IID vs компенсированные). В зависимых системах элементы извлекаются без возвращения из конечного набора:

\[ P(X_{n+1} = x \mid X_1, \ldots, X_n) \neq P(X_{n+1} = x). \]

Каждое извлечение изменяет состав оставшегося набора → изменяет вероятности → создаёт информационное преимущество для того, кто отслеживает состав.

Формализация через MDP

Марковский процесс принятия решений (MDP) определяется кортежем \((\mathcal{S}, \mathcal{A}, P, R, \gamma)\):

КомпонентВ контексте зависимой системы
\(\mathcal{S}\) — множество состоянийТекущая конфигурация участника + видимый элемент оператора + оценка состава оставшегося набора
\(\mathcal{A}\) — множество действий{Запросить элемент, Остановиться, Удвоить позицию, Разделить конфигурацию}
\(P(s' \mid s, a)\) — функция переходовВероятность нового состояния при действии \(a\) в состоянии \(s\), зависящая от состава набора
\(R(s, a)\) — наградаВыплата при достижении терминального состояния
\(\gamma\) — дисконтирование\(\gamma = 1\) (конечный горизонт)

Оптимальная политика

Оптимальная политика \(\pi^*\) максимизирует ожидаемый возврат из каждого состояния:

\[ V^*(s) = \max_{a \in \mathcal{A}} \left[R(s, a) + \gamma \sum_{s'} P(s' \mid s, a) V^*(s')\right]. \]

Решение (уравнение Беллмана) даёт таблицу оптимальных решений — для каждой комбинации (конфигурация участника, видимый элемент оператора) указывается оптимальное действие.

При точном следовании \(\pi^*\) Edge оператора снижается до минимального значения:

\[ \text{Edge}_{\pi^*} \approx 0{,}5\%, \quad \text{vs} \quad \text{Edge}_{\text{интуитивный}} \approx 2{-}5\%. \]

Таблица оптимальных решений — подробнее в оптимальные решения.

Мониторинг состава: достаточная статистика

Полное состояние набора — вектор \(\mathbf{c} = (c_1, c_2, \ldots, c_{10})\), где \(c_i\) — число оставшихся элементов номинала \(i\). Размерность: \(10^6+\) возможных комбинаций для стандартного набора из 6 × 52 элементов.

Сжатие информации: Hi-Lo

Вместо полного вектора \(\mathbf{c}\) используется скалярная проекция — текущий счёт (Running Count, RC):

\[ \text{RC} = \sum_{\text{извлечённые}} w_i, \quad w_i = \begin{cases} +1 & \text{номинал 2–6 (малые)} \\ 0 & \text{номинал 7–9 (средние)} \\ -1 & \text{номинал 10, фигуры, туз (крупные)} \end{cases} \]

Высокий RC → в наборе осталось больше крупных элементов → вероятности смещены в пользу участника. Низкий RC → в пользу оператора.

Истинный счёт (True Count)

Нормализация на число оставшихся поднаборов:

\[ \text{TC} = \frac{\text{RC}}{D_{\text{remaining}}}, \]

где \(D_{\text{remaining}}\) — число оставшихся поднаборов (52 элемента каждый). TC — достаточная статистика для оценки Edge:

\[ \text{Edge}(\text{TC}) \approx \text{Edge}_0 - 0{,}5\% \times \text{TC}, \]

где \(\text{Edge}_0 \approx 0{,}5\%\) — Edge при оптимальной политике и полном наборе.

Положительное ожидание: когда?

\[ \text{Edge}(\text{TC}) < 0 \iff \text{TC} > \frac{\text{Edge}_0}{0{,}5\%} = \frac{0{,}5}{0{,}5} = 1. \]

При \(\text{TC} > +1\) ожидание временно становится положительным (Edge < 0 для оператора). Преимущество участника:

\[ \text{Advantage} = 0{,}5\% \times (\text{TC} - 1). \]
TCEdge оператораПреимущество участникаРекомендуемое действие
−2+1,5%−1,5%Минимальная позиция
0+0,5%−0,5%Минимальная позиция
+1≈ 0%≈ 0%Безубыточность
+2−0,5%+0,5%Увеличение позиции
+3−1,0%+1,0%Значительное увеличение
+5−2,0%+2,0%Максимальная позиция

Оптимальное управление позицией: критерий Келли

Размер позиции как функция TC:

\[ s(\text{TC}) = \frac{\text{Advantage}(\text{TC})}{\sigma^2} \cdot K = \frac{0{,}005 \cdot (\text{TC} - 1)}{1{,}15^2} \cdot K \approx 0{,}0038 \cdot (\text{TC} - 1) \cdot K, \]

где \(\sigma \approx 1{,}15\) — стандартное отклонение на одно событие, \(K\) — текущий капитал. На практике используется дробный Келли (\(f^*/2\)).

Пример

Капитал \(K = 10\,000\) у.е., TC = +3 (преимущество +1,0%):

\[ s = 0{,}5 \times \frac{0{,}01}{1{,}32} \times 10\,000 \approx 38 \text{ у.е. (полу-Келли).} \]

При TC = 0: \(s = s_{\min}\) (минимальная позиция для маскировки).

Подробнее о критерии Келли — модели управления капиталом.

Глубина проникновения: ключевая переменная

Глубина проникновения \(d\) — доля набора, используемая до перемешивания:

\[ d = \frac{N_{\text{использованных}}}{N_{\text{total}}}. \]

Чем выше \(d\), тем больше информации доступно участнику, и тем чаще TC достигает экстремальных значений:

Глубина \(d\)% времени с TC ≥ +2Ожидаемый EV/часПрактическая оценка
50%~15%≈ 0 у.е.Информации недостаточно
65%~22%+5–10 у.е.Минимально жизнеспособно
75%~28%+15–25 у.е.Стандартная цель
85%~35%+30–50 у.е.Оптимально

При \(d < 50\%\) мониторинг состава практически бесполезен.

Контрмеры операторов

КонтрмераМеханизмЭффект на информационное преимущество
Непрерывное перемешивание (CSM) Использованные элементы возвращаются в набор после каждого события Полная нейтрализация. Состав набора постоянен → IID-система → мониторинг бесполезен
Увеличение числа поднаборов 6–8 поднаборов вместо 1–2 Снижение дисперсии TC → реже экстремальные значения
Снижение глубины \(d < 50\%\) — частое перемешивание TC редко достигает +2 → нет моментов положительного ожидания
Ограничение позиции \(s_{\max}/s_{\min} \leq 4{-}8\) Невозможно реализовать полный Келли
AI-детекция Корреляция \(s_i\) с оценкой TC: \(\text{corr}(s_i, \widehat{\text{TC}}_i) > \theta\) Аккаунт классифицируется как «стратегический» → ограничения

Подробнее о системах детекции — velocity rules и ML.

CSM: формальное доказательство нейтрализации

При непрерывном перемешивании:

\[ P(X_{n+1} = x \mid X_1, \ldots, X_n) = P(X_{n+1} = x) = p_x \quad \forall n. \]

Система становится IID. Мониторинг состава не даёт информации: \(\text{TC} \equiv 0\), \(\text{Advantage} \equiv -\text{Edge}_0 < 0\).

Ожидаемая почасовая доходность: реалистичный расчёт

При реалистичных параметрах:

\[ \text{EV/час} = N_{\text{событий/час}} \times \bar{s} \times \overline{\text{Advantage}}, \]

где \(\bar{s}\) — средний размер позиции (с учётом вариации по TC), \(\overline{\text{Advantage}}\) — средневзвешенное преимущество.

ПараметрЗначение
Событий в час60–80
Доля событий с TC ≥ +225% (при d = 75%)
Средний Advantage при TC ≥ +2+1,0%
Средний размер позиции при TC ≥ +240 у.е.
Средний Advantage при TC < +2−0,5%
Средний размер позиции при TC < +210 у.е. (минимум)
\[ \text{EV/час} = 70 \times [0{,}25 \times 40 \times 0{,}01 + 0{,}75 \times 10 \times (-0{,}005)] \]
\[ = 70 \times [0{,}10 - 0{,}0375] = 70 \times 0{,}0625 \approx 4{,}4 \text{ у.е./час.} \]

Стандартное отклонение: \(\sigma_{\text{час}} \approx 1{,}15 \times \bar{s} \times \sqrt{70} \approx 200\) у.е. Соотношение EV/σ = 0,022 → огромная дисперсия относительно ожидания. Для 95% вероятности прибыли за период:

\[ T_{95\%} \approx \left(\frac{1{,}645 \times \sigma_{\text{час}}}{\text{EV/час}}\right)^2 \approx \left(\frac{329}{4{,}4}\right)^2 \approx 5\,600 \text{ часов.} \]

~5 600 часов (~700 полных рабочих дней) для 95% вероятности суммарной прибыли.

Правовой статус мониторинга состава

Выводы

  1. Зависимые системы допускают информационное преимущество — в отличие от IID-систем, где прошлые результаты бесполезны.
  2. Оптимальная политика (MDP) снижает Edge до 0,5%. Это необходимое условие, без которого мониторинг состава бессмыслен.
  3. Hi-Lo — достаточная статистика: TC > +1 → положительное ожидание. Преимущество ≈ 0,5% × (TC − 1).
  4. Глубина проникновения \(d\) — ключевой параметр. При \(d < 50\%\) мониторинг неэффективен. CSM нейтрализует преимущество полностью.
  5. Реалистичная доходность ≈ 4–5 у.е./час при капитале 10 000 у.е. и σ ≈ 200 у.е./час. Для 95% вероятности прибыли — ~5 600 часов.
  6. AI-детекция через корреляцию размера позиции с оценкой TC — основная угроза. Ограничения аккаунта вероятны при систематическом использовании.
Предупреждение о рисках: Все материалы на данном сайте носят исключительно образовательный и информационный характер. Они не являются руководством к действию, финансовой рекомендацией или побуждением к участию в какой-либо деятельности. Любые решения в условиях неопределённости сопряжены с рисками, включая полную потерю капитала.