---
title: "Vocalizer: локальний синтез мовлення для PHP"
url: https://laravelukraine.com/blog/vocalizer-lokalnii-sintez-movlennia-dlia-php
date: 2026-07-18
source: https://laravel-news.com/vocalizer-local-text-to-speech-for-php?utm_medium=feed&utm_source=feedpress.me&utm_campaign=Feed%3A+laravelnews
---

# Vocalizer: локальний синтез мовлення для PHP

Vocalizer - це нативне PHP-розширення від [Akram Zerarka](https://github.com/AkramZerarka), яке виконує синтез мовлення з тексту локально, без API-викликів і залежностей під час виконання. Розширення вбудовує два бекенди виведення - sherpa-onnx (ONNX Runtime) та audio.cpp (ggml) - і поставляється як готовий бінарний файл `.so`, тому компіляція не потрібна.

## Ключові можливості

Розширення надає наступний функціонал:

- **Вісім сімейств моделей, один API** - Chatterbox, Supertonic, Piper/VITS, Pocket, Kokoro, Kitten, Matcha та ZipVoice з автоматичним визначенням з директорії моделі
- **Клонування голосу** - Chatterbox клонує будь-який голос з 3-10 секундного WAV-зразка для 23 мов
- **Захист від артефактів** - вивід Chatterbox перевіряється на пропущений текст, цикли та тишу, і повторно синтезується з новим seed при виявленні проблем
- **Ізоляція збоїв** - моделі за замовчуванням працюють у fork-режимі, тому збій двигуна обробляється повторною спробою та перезавантаженням замість падіння PHP-воркера
- **Кешування моделей** - моделі завантажуються один раз на PHP-воркер (витіснення LRU, `vocalizer.max_models`) і залишаються активними для наступних запитів
- **Асинхронний синтез** - `speakAsync()` повертає завдання, на яке можна викликати `wait()`, з таймаутами для кожного виклику
- **WAV або raw PCM вивід** - збереження у файл, отримання WAV як рядка або float32 PCM

## Єдиний API для восьми сімейств моделей

`Engine::load()` вказує на директорію моделі й автоматично визначає бекенд з її вмісту. Синтез виконується одним викликом `speak()`:

```php
use Vocalizer\Engine;
$engine = Engine::load('/opt/voices/sherpa-onnx-supertonic-3-tts-int8-2026-05-11');
$res = $engine->speak('Votre commande est prête.', [
  'lang'       => 'fr',   // обов'язково для Supertonic
  'voice'      => 0,      // 0-9 попередньо налаштовані голоси
  'speed'      => 1.0,
  'timeout_ms' => 30_000,
]);
$res->save('/var/www/audio/notice.wav');
echo $res->seconds, " s in ", $res->generationMs, " ms\n";
```

Вибір моделі залежить від ваших цілей:

| Мета | Модель | Затримка (CPU) |
|------|--------|----------------|
| Найкращий реалізм, клонування голосу | Chatterbox | Повільно (~20× реального часу) |
| Швидка багатомовність (31 мова) | Supertonic 3 | Реальний час |
| Легке клонування FR/EN | Pocket TTS | Швидко |
| Найшвидша, одна модель на локаль | Piper/VITS | Дуже швидко |

## Клонування голосу з Chatterbox

Chatterbox охоплює 23 мови з однією моделлю ~7.5 ГБ і клонує голос з короткого WAV-зразка цільовою мовою:

```php
$engine = Engine::load('/opt/voices/chatterbox', [
  'threads' => 4,
  'opts'    => ['weight_type' => 'f16'],   // за замовчуванням: q8_0
]);
$res = $engine->speak('Bonjour, votre commande est prête.', [
  'lang'       => 'fr',
  'reference'  => '/opt/voices/refs/fr.wav',
  'opts'       => [
    'temperature'        => 0.6,
    'repetition_penalty' => 1.2,
    'seed'               => 42,
  ],
  'timeout_ms' => 600_000,
]);
echo $res->qualityRetries;   // повторні спроби (0 = перший результат прийнято)
$res->save('/tmp/out.wav');
```

Авторегресивні TTS-моделі можуть пропускати текст, зациклюватися або генерувати тишу - саме тут спрацьовує захист від артефактів. Vocalizer перевіряє кожен вивід Chatterbox на відповідність довжині тексту та енергії сигналу, і повторно синтезує підозріле аудіо з новим seed - дві додаткові спроби за замовчуванням, налаштовується через `verify_retries`. Якщо всі спроби невдалі, викидається `Vocalizer\Exception` замість повернення пошкодженого аудіо, що спрощує перехід до швидшої моделі:

```php
try {
  $res = $engine->speak($text, ['lang' => 'fr', 'reference' => $ref]);
} catch (\Vocalizer\Exception $e) {
  $res = Engine::load('/opt/voices/sherpa-onnx-supertonic-3-tts-int8-2026-05-11')
    ->speak($text, ['lang' => 'fr']);
}
```

## Ізоляція збоїв та асинхронність

Нативні двигуни виведення можуть падати, і segfault всередині PHP-розширення зазвичай вбиває FPM-воркер разом з ним. Режим ізоляції `fork` за замовчуванням у Vocalizer запускає синтез у форкнутому дочірньому процесі, тому збій перехоплюється, повторюється (до `vocalizer.max_retries`), а модель перезавантажується - `Vocalizer\CrashException` викидається лише коли відновлення неможливе. Chatterbox - виняток: його пул потоків ggml не безпечний для fork, тому він завжди працює в прямому режимі.

Для довших текстів `speakAsync()` виносить синтез за межі шляху запиту:

```php
$job = $engine->speakAsync($paragraph);
$res = $job->wait(30_000) ?? throw new RuntimeException('still running');
```

Поведінка налаштовується через директиви `php.ini`: `vocalizer.isolation` (fork проти direct), `vocalizer.timeout_ms`, `vocalizer.max_models` для кешу моделей на воркер та `vocalizer.max_concurrency` для асинхронного пулу. Важлива примітка з README: RAM моделей виділяється на кожен FPM-воркер, і сам Chatterbox потребує кілька ГБ.

## Встановлення

Vocalizer вимагає Linux x86-64 (glibc ≥ 2.28) та PHP 8.4 або 8.5 NTS - Alpine/musl, ARM та ZTS-збірки не підтримуються. Скрипт встановлення завантажує готове розширення (~44 МБ) і перевіряє його через SHA256:

```bash
curl -fsSL https://raw.githubusercontent.com/akramzerarka/vocalizer/main/install.sh | bash
```

Моделі завантажуються окремо через вбудований скрипт:

```bash
./scripts/download-model.sh chatterbox                                    # ~7.5 ГБ
./scripts/download-model.sh sherpa-onnx-supertonic-3-tts-int8-2026-05-11  # ~120 МБ
./scripts/download-model.sh vits-piper-en_US-amy-low                      # ~65 МБ
```

Розширення ліцензовано під MIT і статично компонує свої залежності, включаючи sherpa-onnx (Apache-2.0), audio.cpp/ggml (MIT), ONNX Runtime (MIT) та espeak-ng (GPL-3.0 дані фонемізації).

Повний довідник API, деталі конфігурації та каталог моделей доступні на [GitHub](https://github.com/AkramZerarka/vocalizer).
