К использованию LLM в системах жёсткого реального времени (Сергей Старолетов, OSDAY-2026)
Материал из 0x1.tv
- Докладчик
- Сергей Старолетов
Как встроить LLM в систему жёсткого реального времени так, чтобы она не разрушала ключевые требования: предсказуемое время выполнения, изоляцию и контроль дедлайнов.
Берём микроядро POK с моделью ARINC 653, где LLM-компонент можно поместить в отдельный раздел с фиксированным временным слотом и изолированной памятью. Для эксперимента выбрана небольшая модель TinyStories 15M на базе llama2.c: чистый C, минимум зависимостей, int8-квантование весов и статическое включение модели в ELF-образ раздела. Инференс LLM может быть достаточно предсказуемым: токенизация детерминирована, embedding читается из таблицы, слои трансформера имеют фиксированные размеры, а вычисления в основном сводятся к одинаковым матричным операциям без ветвлений, зависящих от данных.
Ключевая идея — проверять время на границах слоёв: если дедлайн превышен, генерация прерывается без вытеснения потока и без порчи состояния модели. Рассматриваются портирование в POK, отказ от динамической памяти, двухступенчатый дедлайн для грамматически завершённого ответа и результаты демо в QEMU.
Видео
