30.08.2026

Генеративный продукт на своём железе: локальный инференс, LoRA-пайплайн, 11 субагентов

Elviora — генеративный B2C-продукт, работающий целиком на собственном железе: локальный инференс на 2×RTX 5090, пайплайн обучения LoRA, модульный монолит на Kotlin/Spring. Полный цикл до платящих пользователей.

  • ИИ-агенты
  • локальный инференс
  • Kotlin

Задача

Elviora — генеративный B2C-продукт, в котором генерация работает не через внешние API, а целиком на собственном железе. Полный цикл — от идеи до платящих пользователей.

Техника

  • Локальный инференс на 2×RTX 5090. Генерация не покидает свой контур: никакой зависимости от внешних API — ни по цене, ни по лимитам, ни по данным.
  • Пайплайн обучения LoRA на связке Kohya SS + ComfyUI: обучение и применение кастомных моделей поставлено как конвейер, а не как ручные эксперименты.
  • Модульный монолит на Kotlin/Spring — бэкенд продукта: границы модулей внутри одного деплоя вместо преждевременных микросервисов.
  • 11 субагентов Claude Code — разработка продукта разложена по ролям агентской команды.

Что здесь переносимого

Главное в этом кейсе — не продукт, а схема: генеративная система, которая работает на своём железе. Это прямой ответ для тех, кому во внешние API нельзя — по регуляторике, по данным или по экономике. Локальный инференс, поставленный как пайплайн, переносится в такие контуры целиком: модели, обучение, применение — всё внутри периметра.

Нужна генерация внутри своего периметра — без внешних API? Напишите — расскажу, как это устроено у нас.