Google DeepMind розширив лінійку відкритих моделей, презентувавши Gemma 4 12B. Це середньорозмірна мультимодальна модель з параметрами 12 мільярдів, яка закриває розрив між ультралегкими мобільними версіями та важкими MoE-архітектурами. Головна фішка новинки — вона створена спеціально для запуску на звичайних споживчих ноутбуках і ПК, але водночас пропонує можливості флагманських систем.

Головне про архітектуру, системні вимоги та підтримувані мови — у нашому детальному розборі.
1. Унікальна архітектура: Більше ніяких енкодерів
Раніше мультимодальні моделі (що працюють із текстом, фото та звуком) нагадували «монстра Франкенштейна»: окремий енкодер обробляв картинку, окремий — звук, а потім усе це передавалося в мовну модель (LLM). Це споживало купу пам’яті та створювало затримки (latency).
У Gemma 4 12B реалізовано повністю уніфіковану архітектуру (Encoder-Free):
- Важкий візуальний енкодер замінили на надлегкий ембеддінг-модуль (~35 млн параметрів).
- Аудіоенкодер взагалі видалили: сирий аудіосигнал проєктується безпосередньо у простір текстових токенів.
- Картинки, звук і текст обробляються разом у єдиному декодері мовної моделі.
Результат: Зменшення споживання пам’яті, миттєвий старт генерації (низька затримка) та значне спрощення локального розгортання — ідеально для self-hosted рішень.
2. На чому працює: Системні вимоги та квантизація
Завдяки технології QAT (Quantization-Aware Training), яку Google інтегрувала прямо в процес навчання, стислі (квантовані) версії моделі майже не втрачають у якості порівняно з базовою BF16.
Модель без проблем «заводиться» на звичайному залізі. Ось вимоги до пам’яті (RAM / VRAM) залежно від обраного кванту:
| Формат моделі | Вага файлу | Скільки треба пам’яті (RAM/VRAM) | Оптимальне залізо |
| Q4_0 (4-bit) | ~6.7 GB | 8 GB | Базові ноутбуки, MacBook Air (8GB), Mini-PC |
| SFP8 (8-bit) | ~13.4 GB | 14–16 GB | Ноутбуки з 16GB RAM, Mac з Unified Memory, відеокарти на кшталт RTX 4060/4070 |
| Unquantized (BF16) | ~26.7 GB | 25+ GB | Робочі станції, Mac з 32GB+ RAM, професійні GPU (RTX 3090 / 4090) |
Що потрібно для запуску?
Модель поширюється під ліцензією Apache 2.0 (повна свобода для комерційного використання) і вже підтримується топовим софтом для локального запуску:
- Ollama: запускається однією командою
ollama run gemma4:12b. - LM Studio: через пошук GGUF-репозиторіїв від Hugging Face.
- vLLM / Llama.cpp: для розгортання на серверах або створення API.
Важливо: Для роботи з зображеннями та аудіо локально, окрім основного файлу ваг, обов’язково потрібно завантажувати файл мультимодального проєктора (mmproj).
3. Які мови та контекст підтримує
- Контекстне вікно: Фантастичні 256K токенів. Це дозволяє “годувати” модель величезними логами, цілими книгами або кодовою базою невеликого проєкту за один прохід.
- Мовна підтримка: Модель є повноцінно мультиязичною і підтримує понад 140 мов, включаючи якісну роботу з українською мовою (як на зчитування аудіо/тексту, так і на генерацію).
4. Що вона вміє (Сценарії використання)
Gemma 4 12B наближається за бенчмарками до значно більшої версії 26B MoE. Її головні юзкейси:
- Голосові асистенти (Audio Q&A): Модель може приймати аудіозаписи (до 30 секунд), транскрибувати їх, перекладати або відповідати голосом без сторонніх сервісів типу Whisper.
- Аналіз документів (DocVQA): Можна завантажувати скани інвойсів, чеків, скріншоти інтерфейсів — модель чудово розпізнає текст та таблиці на зображеннях.
- Аналітика та кодинг: Завдяки вбудованим механізмам Multi-Token Prediction (MTP) модель видає високу швидкість генерації коду та складних логічних міркувань.
Вердикт ivan.net.ua: Google створила ледь не найкращий збалансований інструмент для розробників, яким потрібен приватний, безкоштовний та швидкий ШІ-асистент безпосередньо на робочому лептопі.