Google DeepMind розширив лінійку відкритих моделей, презентувавши Gemma 4 12B. Це середньорозмірна мультимодальна модель з параметрами 12 мільярдів, яка закриває розрив між ультралегкими мобільними версіями та важкими MoE-архітектурами. Головна фішка новинки — вона створена спеціально для запуску на звичайних споживчих ноутбуках і ПК, але водночас пропонує можливості флагманських систем.

Головне про архітектуру, системні вимоги та підтримувані мови — у нашому детальному розборі.

1. Унікальна архітектура: Більше ніяких енкодерів

Раніше мультимодальні моделі (що працюють із текстом, фото та звуком) нагадували «монстра Франкенштейна»: окремий енкодер обробляв картинку, окремий — звук, а потім усе це передавалося в мовну модель (LLM). Це споживало купу пам’яті та створювало затримки (latency).

У Gemma 4 12B реалізовано повністю уніфіковану архітектуру (Encoder-Free):

  • Важкий візуальний енкодер замінили на надлегкий ембеддінг-модуль (~35 млн параметрів).
  • Аудіоенкодер взагалі видалили: сирий аудіосигнал проєктується безпосередньо у простір текстових токенів.
  • Картинки, звук і текст обробляються разом у єдиному декодері мовної моделі.

Результат: Зменшення споживання пам’яті, миттєвий старт генерації (низька затримка) та значне спрощення локального розгортання — ідеально для self-hosted рішень.

2. На чому працює: Системні вимоги та квантизація

Завдяки технології QAT (Quantization-Aware Training), яку Google інтегрувала прямо в процес навчання, стислі (квантовані) версії моделі майже не втрачають у якості порівняно з базовою BF16.

Модель без проблем «заводиться» на звичайному залізі. Ось вимоги до пам’яті (RAM / VRAM) залежно від обраного кванту:

Формат моделіВага файлуСкільки треба пам’яті (RAM/VRAM)Оптимальне залізо
Q4_0 (4-bit)~6.7 GB8 GBБазові ноутбуки, MacBook Air (8GB), Mini-PC
SFP8 (8-bit)~13.4 GB14–16 GBНоутбуки з 16GB RAM, Mac з Unified Memory, відеокарти на кшталт RTX 4060/4070
Unquantized (BF16)~26.7 GB25+ GBРобочі станції, Mac з 32GB+ RAM, професійні GPU (RTX 3090 / 4090)

Що потрібно для запуску?

Модель поширюється під ліцензією Apache 2.0 (повна свобода для комерційного використання) і вже підтримується топовим софтом для локального запуску:

  1. Ollama: запускається однією командою ollama run gemma4:12b.
  2. LM Studio: через пошук GGUF-репозиторіїв від Hugging Face.
  3. vLLM / Llama.cpp: для розгортання на серверах або створення API.

Важливо: Для роботи з зображеннями та аудіо локально, окрім основного файлу ваг, обов’язково потрібно завантажувати файл мультимодального проєктора (mmproj).

3. Які мови та контекст підтримує

  • Контекстне вікно: Фантастичні 256K токенів. Це дозволяє “годувати” модель величезними логами, цілими книгами або кодовою базою невеликого проєкту за один прохід.
  • Мовна підтримка: Модель є повноцінно мультиязичною і підтримує понад 140 мов, включаючи якісну роботу з українською мовою (як на зчитування аудіо/тексту, так і на генерацію).

4. Що вона вміє (Сценарії використання)

Gemma 4 12B наближається за бенчмарками до значно більшої версії 26B MoE. Її головні юзкейси:

  • Голосові асистенти (Audio Q&A): Модель може приймати аудіозаписи (до 30 секунд), транскрибувати їх, перекладати або відповідати голосом без сторонніх сервісів типу Whisper.
  • Аналіз документів (DocVQA): Можна завантажувати скани інвойсів, чеків, скріншоти інтерфейсів — модель чудово розпізнає текст та таблиці на зображеннях.
  • Аналітика та кодинг: Завдяки вбудованим механізмам Multi-Token Prediction (MTP) модель видає високу швидкість генерації коду та складних логічних міркувань.

Вердикт ivan.net.ua: Google створила ледь не найкращий збалансований інструмент для розробників, яким потрібен приватний, безкоштовний та швидкий ШІ-асистент безпосередньо на робочому лептопі.