GGUF conversions of Aratako/Irodori-TTS-600M-v3-VoiceDesign for the CrispASR irodori-tts backend.
Source du modèle
Description de la source
GGUF conversions of Aratako/Irodori-TTS-600M-v3-VoiceDesign for the CrispASR irodori-tts backend.
Irodori-TTS VoiceDesign is a rectified-flow diffusion transformer (RF-DiT) for Japanese text-to-speech with three conditioning modes:
Sources
1 sourceVérifié 7 août
Artefacts du modèle
3 artefactsirodori-tts-600m-v3-voicedesign-f16.gguf
gguf · 1,15 GB · SHA-256 597064c47d75…ecfb · Hugging Face
TéléchargerExtraits de sources
2 extraits| Mode | Inputs | Use case |
|---|---|---|
| Pure Voice Design | Text + Caption | Generate diverse voices from text descriptions alone |
| Style-Controlled Cloning | Text + Caption + Ref audio | Clone a voice while controlling emotion/delivery |
| Unconditional | Text only | Neutral synthesis (no caption, no reference) |
| File | Size | Description |
|---|---|---|
irodori-tts-600m-v3-voicedesign-q4_k.gguf | 525 MB | Q4_K quantized (recommended) |
irodori-tts-600m-v3-voicedesign-f16.gguf | 1.2 GB | F16 full precision |
dacvae-ja-32dim-f16.gguf | 135 MB | DAC-VAE codec (required companion) |
# Voice Design — generate a voice from a text description:
crispasr --backend irodori-tts \
-m irodori-tts-600m-v3-voicedesign-q4_k.gguf \
--codec-model dacvae-ja-32dim-f16.gguf \
--instruct "落ち着いた大人の男性。フォーマルな場で、深く響く声で丁寧に話している。" \
--tts "こんにちは、世界。" \
--tts-output voicedesign.wav
# Style-controlled voice cloning:
crispasr --backend irodori-tts \
-m irodori-tts-600m-v3-voicedesign-q4_k.gguf \
--codec-model dacvae-ja-32dim-f16.gguf \
--voice reference.wav --i-have-rights \
--instruct "元気で明るい女性。笑顔で楽しそうに話している。" \
--tts "今日はいい天気ですね!" \
--tts-output cloned_styled.wav
# Auto-download (fetches both model + codec):
crispasr --backend irodori-tts-voicedesign -m auto --auto-download \
--instruct "優しい声の女性。" \
--tts "テスト。" --tts-output out.wav
| Variable | Default | Description |
|---|---|---|
CRISPASR_IRODORI_CAPTION | — | Caption text (alternative to --instruct) |
CRISPASR_IRODORI_CFG_TEXT | 3.0 | Text CFG guidance scale |
CRISPASR_IRODORI_CFG_SPEAKER | 5.0 | Speaker CFG guidance scale |
CRISPASR_IRODORI_CFG_CAPTION | 3.0 | Caption CFG guidance scale |
CRISPASR_IRODORI_ODE_STEPS | 40 | Number of Euler ODE steps |
Diff harness results against the original PyTorch implementation:
| Stage | F16 vs Python | Q4_K vs Python |
|---|---|---|
| text_state | cos=1.000000, max_abs=3.96e-04 | — |
| v_pred_step0 | cos=1.000000, max_abs=8.46e-04 | cos=0.996491, max_abs=4.66e-01 |
MIT (same as the original model). See Aratako/Irodori-TTS-600M-v3-VoiceDesign for usage restrictions (no impersonation without consent, AI-generated audio disclaimer required for caption-only outputs).
Aratako.mit. This repository redistributes under the same terms; it grants no rights the upstream licence does not.irodori-tts-600m-v3-voicedesign-q4_k.gguf
gguf · 525 MB · SHA-256 a619bd6cb3fd…5aad · Hugging Face
--- language: ja license: mit tags: - gguf - tts - text-to-speech - japanese - voice-design - voice-cloning - flow-matching - diffusion-transformer - crispasr base_model: Aratako/Irodori-TTS-600M-v3-VoiceDesign pipeline_tag: text-to-speech --- # Irodori-TTS-600M-v3-VoiceDesign — GGUF GGUF conversions of [Aratako/Irodori-TTS-600M-v3-VoiceDesign](https://huggingface.co/Aratako/Irodori-TTS-600M-v3-VoiceDesign) for the [CrispASR](https://github.com/CrispStrobe/CrispASR) `irodori-tts` backend. **Irodori-TTS VoiceDesign** is a rectified-flow diffusion transformer (RF-DiT) for Japanese text-to-speech with three conditioning modes: | Mode | Inputs | Use case | |------|--------|----------| | Pure Voice Design | Text + Caption | Generate diverse voices from text descriptions alone | | Style-Controlled Cloning | Text + Caption + Ref audio | Clone a voice while controlling emotion/delivery | | Unconditional | Text only | Neutral synthesis (no caption, no reference) | ## Architecture - **TextEncoder**: 10-layer RoPE transformer (512-dim, 8 heads, llm-jp-3-150m tokenizer) - **CaptionEncoder**: 10-layer RoPE transformer (same architecture as text encoder) — encodes style/emotion descriptions - **ReferenceLatentEncoder**: 8-layer transformer (768-dim, 12 heads) — encodes speaker identity from DAC-VAE latents - **DiT**: 12 DiffusionBlock layers (1280-dim, 20 heads) with LowRankAdaLN + JointAttention (text + speaker + caption KV) + half-RoPE + SwiGLU - **DurationPredictor**: token_sum_dual_adarn_zero — speaker + caption dual modulation - **DAC-VAE decoder**: Semantic-DACVAE-Japanese-32dim (48 kHz, 32-dim latent) - **ODE solver**: Euler RF with independent text/speaker/caption CFG ## Files | File | Size | Description | |------|------|-------------| | `irodori-tts-600m-v3-voicedesign-q4_k.gguf` | 525 MB | Q4_K quantized (recommended) | | `irodori-tts-600m-v3-voicedesign-f16.gguf` | 1.2 GB | F16 full precision | | `dacvae-ja-32dim-f16.gguf` | 135 MB | DAC-VAE codec (required companion) | ## Usage with CrispASR ```bash # Voice Design — generate a voice from a text description: crispasr --backend irodori-tts \ -m irodori-tts-600m-v3-voicedesign-q4_k.gguf \ --codec-model dacvae-ja-32dim-f16.gguf \ --instruct "落ち着いた大人の男性。フォーマルな場で、深く響く声で丁寧に話している。" \ --tts "こんにちは、世界。" \ --tts-output voicedesign.wav # Style-controlled voice cloning: crispasr --backend irodor...
Source context: 621 downloads · 2 likes · Pipeline text-to-speech · Repo cstr/irodori-tts-voicedesign-GGUF