30.08.2026
Генеративный продукт на своём железе: локальный инференс, LoRA-пайплайн, 11 субагентов
Elviora — генеративный B2C-продукт, работающий целиком на собственном железе: локальный инференс на 2×RTX 5090, пайплайн обучения LoRA, модульный монолит на Kotlin/Spring. Полный цикл до платящих пользователей.
- ИИ-агенты
- локальный инференс
- Kotlin
Задача
Elviora — генеративный B2C-продукт, в котором генерация работает не через внешние API, а целиком на собственном железе. Полный цикл — от идеи до платящих пользователей.
Техника
- Локальный инференс на 2×RTX 5090. Генерация не покидает свой контур: никакой зависимости от внешних API — ни по цене, ни по лимитам, ни по данным.
- Пайплайн обучения LoRA на связке Kohya SS + ComfyUI: обучение и применение кастомных моделей поставлено как конвейер, а не как ручные эксперименты.
- Модульный монолит на Kotlin/Spring — бэкенд продукта: границы модулей внутри одного деплоя вместо преждевременных микросервисов.
- 11 субагентов Claude Code — разработка продукта разложена по ролям агентской команды.
Что здесь переносимого
Главное в этом кейсе — не продукт, а схема: генеративная система, которая работает на своём железе. Это прямой ответ для тех, кому во внешние API нельзя — по регуляторике, по данным или по экономике. Локальный инференс, поставленный как пайплайн, переносится в такие контуры целиком: модели, обучение, применение — всё внутри периметра.
Нужна генерация внутри своего периметра — без внешних API? Напишите — расскажу, как это устроено у нас.