Раздельная физика
Политика принимает решение, симулятор выполняет движение. Так можно менять RL-агента без переписывания физики полигона.
Цель нейросетевого-обучающего тренажера — последовательно усложнять среду и формировать интуитивную политику управления дроном, пригодную для переноса в бортовой контроллер. Обучение не смешивает принятие решений с физикой: агент выбирает действие, а полигон проверяет его на достоверной динамике, шумах, задержках и ограничениях аппарата.
Политика принимает решение, симулятор выполняет движение. Так можно менять RL-агента без переписывания физики полигона.
Ударный дрон и антидрон обучаются раздельно, но проходят совместимую лестницу усложнения сценариев.
Кооперация появляется после одиночных задач, когда агент уже стабильно решает наведение, обзор и вертикальный профиль.
Идеальная кинематика в плоскости. Агент учится идти к точке без инерции, шумов и противника.
Добавляются скорость, ускорение, радиус разворота и ограничения управляющего воздействия.
Частичная наблюдаемость, шумы сенсоров, потеря контакта и работа по неполной информации.
Плоский полигон без препятствий. Агент учится управлять высотой, набором, снижением и безопасным высотным коридором.
Преследование или уклонение от движущейся цели с учетом скорости сближения и предсказания траектории.
Противник меняет маневр. Политика должна сохранять устойчивость, а не запоминать один сценарий.
Несколько антидронов распределяют цели, избегают дублирования и сохраняют рабочие зоны ответственности.
Групповая плотность, деконфликт траекторий, согласованное движение и устойчивость к потере отдельных агентов.
Полная физика, ветер, задержки, ошибки датчиков и randomized-сценарии для подготовки к sim-to-real.
Смешанные сценарии, статистическая сдача, проверка робастности и экспорт политики в бортовой runtime.