<C/> loading...
Локальный LLM-сервис — Saiga Nemo 12B
Pet-проект · Работает
Локальный LLM-сервис — Saiga Nemo 12B
ML-инженер · DevOps · архитектор решения

Русскоязычная LLM, развёрнутая локально на 3× майнинговых NVIDIA P104-100 (по 8 ГБ VRAM) с tensor splitting и квантизацией GGUF. 22–28 токенов/с при аптайме 99%+ на доступном железе. Мультиплатформенная архитектура: веб-интерфейс и Telegram-бот с синхронизированным состоянием.

Стек
Saiga Nemo 12B llama.cpp GGUF Q4_K_M NVIDIA P104-100 ×3 Tensor splitting Python FastAPI aiogram Docker
Производительность
12B
Параметры
128K
Контекст
28
Токенов/с
99%
Аптайм

Хотите поработать вместе?

Беру проекты на фрилансе, рассматриваю удалённую работу на полный день и интересное сотрудничество. Давайте обсудим.

Связаться