Увійти Реєстрація
Блог Серії
Кар'єра
Вакансії Компанії
Навчання
Документація Співбесіди Тестування Відео
Екосистема
Пакети Ресурси Проєкти
Інше
Події Про нас
Новини 18 липня 2026

Vocalizer: локальний синтез мовлення для PHP

Vocalizer - це нативне PHP-розширення від Akram Zerarka, яке виконує синтез мовлення з тексту локально, без API-викликів і залежностей під час виконання. Розширення вбудовує два бекенди виведення - sherpa-onnx (ONNX Runtime) та audio.cpp (ggml) - і поставляється як готовий бінарний файл .so, тому компіляція не потрібна.

Ключові можливості

Розширення надає наступний функціонал:

  • Вісім сімейств моделей, один API - Chatterbox, Supertonic, Piper/VITS, Pocket, Kokoro, Kitten, Matcha та ZipVoice з автоматичним визначенням з директорії моделі
  • Клонування голосу - Chatterbox клонує будь-який голос з 3-10 секундного WAV-зразка для 23 мов
  • Захист від артефактів - вивід Chatterbox перевіряється на пропущений текст, цикли та тишу, і повторно синтезується з новим seed при виявленні проблем
  • Ізоляція збоїв - моделі за замовчуванням працюють у fork-режимі, тому збій двигуна обробляється повторною спробою та перезавантаженням замість падіння PHP-воркера
  • Кешування моделей - моделі завантажуються один раз на PHP-воркер (витіснення LRU, vocalizer.max_models) і залишаються активними для наступних запитів
  • Асинхронний синтез - speakAsync() повертає завдання, на яке можна викликати wait(), з таймаутами для кожного виклику
  • WAV або raw PCM вивід - збереження у файл, отримання WAV як рядка або float32 PCM

Єдиний API для восьми сімейств моделей

Engine::load() вказує на директорію моделі й автоматично визначає бекенд з її вмісту. Синтез виконується одним викликом speak():

use Vocalizer\Engine;
$engine = Engine::load('/opt/voices/sherpa-onnx-supertonic-3-tts-int8-2026-05-11');
$res = $engine->speak('Votre commande est prête.', [
  'lang'       => 'fr',   // обов'язково для Supertonic
  'voice'      => 0,      // 0-9 попередньо налаштовані голоси
  'speed'      => 1.0,
  'timeout_ms' => 30_000,
]);
$res->save('/var/www/audio/notice.wav');
echo $res->seconds, " s in ", $res->generationMs, " ms\n";

Вибір моделі залежить від ваших цілей:

Мета Модель Затримка (CPU)
Найкращий реалізм, клонування голосу Chatterbox Повільно (~20× реального часу)
Швидка багатомовність (31 мова) Supertonic 3 Реальний час
Легке клонування FR/EN Pocket TTS Швидко
Найшвидша, одна модель на локаль Piper/VITS Дуже швидко

Клонування голосу з Chatterbox

Chatterbox охоплює 23 мови з однією моделлю ~7.5 ГБ і клонує голос з короткого WAV-зразка цільовою мовою:

$engine = Engine::load('/opt/voices/chatterbox', [
  'threads' => 4,
  'opts'    => ['weight_type' => 'f16'],   // за замовчуванням: q8_0
]);
$res = $engine->speak('Bonjour, votre commande est prête.', [
  'lang'       => 'fr',
  'reference'  => '/opt/voices/refs/fr.wav',
  'opts'       => [
    'temperature'        => 0.6,
    'repetition_penalty' => 1.2,
    'seed'               => 42,
  ],
  'timeout_ms' => 600_000,
]);
echo $res->qualityRetries;   // повторні спроби (0 = перший результат прийнято)
$res->save('/tmp/out.wav');

Авторегресивні TTS-моделі можуть пропускати текст, зациклюватися або генерувати тишу - саме тут спрацьовує захист від артефактів. Vocalizer перевіряє кожен вивід Chatterbox на відповідність довжині тексту та енергії сигналу, і повторно синтезує підозріле аудіо з новим seed - дві додаткові спроби за замовчуванням, налаштовується через verify_retries. Якщо всі спроби невдалі, викидається Vocalizer\Exception замість повернення пошкодженого аудіо, що спрощує перехід до швидшої моделі:

try {
  $res = $engine->speak($text, ['lang' => 'fr', 'reference' => $ref]);
} catch (\Vocalizer\Exception $e) {
  $res = Engine::load('/opt/voices/sherpa-onnx-supertonic-3-tts-int8-2026-05-11')
    ->speak($text, ['lang' => 'fr']);
}

Ізоляція збоїв та асинхронність

Нативні двигуни виведення можуть падати, і segfault всередині PHP-розширення зазвичай вбиває FPM-воркер разом з ним. Режим ізоляції fork за замовчуванням у Vocalizer запускає синтез у форкнутому дочірньому процесі, тому збій перехоплюється, повторюється (до vocalizer.max_retries), а модель перезавантажується - Vocalizer\CrashException викидається лише коли відновлення неможливе. Chatterbox - виняток: його пул потоків ggml не безпечний для fork, тому він завжди працює в прямому режимі.

Для довших текстів speakAsync() виносить синтез за межі шляху запиту:

$job = $engine->speakAsync($paragraph);
$res = $job->wait(30_000) ?? throw new RuntimeException('still running');

Поведінка налаштовується через директиви php.ini: vocalizer.isolation (fork проти direct), vocalizer.timeout_ms, vocalizer.max_models для кешу моделей на воркер та vocalizer.max_concurrency для асинхронного пулу. Важлива примітка з README: RAM моделей виділяється на кожен FPM-воркер, і сам Chatterbox потребує кілька ГБ.

Встановлення

Vocalizer вимагає Linux x86-64 (glibc ≥ 2.28) та PHP 8.4 або 8.5 NTS - Alpine/musl, ARM та ZTS-збірки не підтримуються. Скрипт встановлення завантажує готове розширення (~44 МБ) і перевіряє його через SHA256:

curl -fsSL https://raw.githubusercontent.com/akramzerarka/vocalizer/main/install.sh | bash

Моделі завантажуються окремо через вбудований скрипт:

./scripts/download-model.sh chatterbox                                    # ~7.5 ГБ
./scripts/download-model.sh sherpa-onnx-supertonic-3-tts-int8-2026-05-11  # ~120 МБ
./scripts/download-model.sh vits-piper-en_US-amy-low                      # ~65 МБ

Розширення ліцензовано під MIT і статично компонує свої залежності, включаючи sherpa-onnx (Apache-2.0), audio.cpp/ggml (MIT), ONNX Runtime (MIT) та espeak-ng (GPL-3.0 дані фонемізації).

Повний довідник API, деталі конфігурації та каталог моделей доступні на GitHub.

9

Коментарі

Увійдіть, щоб залишити коментар

Будьте першим, хто залишить коментар!

Читайте також

Laracon US 2026: відео першого дня вже доступне Рекомендовано
Новини 29 липня 2026

Laracon US 2026: відео першого дня вже доступне

У Бостоні стартував Laracon US 2026, і запис першого дня вже доступний. Головне з кейноуту: офіційний Laravel LSP для редакторів, Laravel Cloud деплоїть Hono, Flask, Go та Rails, Pest 5 із Tia Engine. Аарон Френсіс приєднався до команди Laravel.

Pest 5: Tia Engine, плагін для AI-агентів і evals для LLM
Новини 29 липня 2026

Pest 5: Tia Engine, плагін для AI-агентів і evals для LLM

На першому дні Laracon US 2026 Нуно Мадуро представив Pest 5. Головне - Tia Engine, що переганяє лише зачеплені змінами тести й скорочує десятихвилинний прогін до кількох секунд, плюс плагіни для AI-агентів, evals, PHPStan і Rector.

Вакансії за темою

ConveyThis Нова
Сьогодні

Middle PHP Developer

Middle PHP розробник для SaaS стартапу розробляє та оптимізує веб-додатки на Laravel, SQL/NoSQL, JavaScript та Bootstrap. Вимагається 3+ років досвіду з PHP/Laravel, глибоке розуміння баз даних, навички OOP та чистого коду. Повна віддаленість (часовий пояс Нью-Йорка), робота в швидкому стартап-середовищі з фокусом на масштабованість та якість кода.

PHP Developer

Senior PHP/Laravel розробник для створення та підтримки API-сервісів та систем інтеграції. Основні обов'язки: проектування partner-facing APIs, реалізація механізмів синхронізації даних у реальному часі, робота з REST API та вебхуками. Вимоги: 5+ років досвіду, експертиза PHP/Laravel, глибоке розуміння REST API, досвід з Git/CI-CD та AI-інструментами для розробки.

Digis Нова
Сьогодні

Senior Laravel Developer (EU based)

Розробка та підтримка frontend та backend компонентів хмарної платформи для управління житловим сектором на Vue.js та Laravel. Вимоги: 5+ років PHP/Laravel, 1+ рік Vue.js, англійська B2+. Обов'язки включають розробку функцій, вдосконалення адмін-панелі, виправлення дефектів та підтримку клієнтських імплементацій.