← Все проекты
<project>
Pet-проект · Работает
Локальный LLM-сервис — Saiga Nemo 12B
ML-инженер · DevOps · архитектор решения
Русскоязычная LLM, развёрнутая локально на 3× майнинговых NVIDIA P104-100 (по 8 ГБ VRAM) с tensor splitting и квантизацией GGUF. 22–28 токенов/с при аптайме 99%+ на доступном железе. Мультиплатформенная архитектура: веб-интерфейс и Telegram-бот с синхронизированным состоянием.
Стек
Saiga Nemo 12B
llama.cpp
GGUF Q4_K_M
NVIDIA P104-100 ×3
Tensor splitting
Python
FastAPI
aiogram
Docker
Производительность
12B
Параметры
128K
Контекст
28
Токенов/с
99%
Аптайм
Хотите поработать вместе?
Беру проекты на фрилансе, рассматриваю удалённую работу на полный день и интересное сотрудничество. Давайте обсудим.
Связаться