بهترین مدلهای TTS فارسی | راهنمای تبدیل متن به گفتار فارسی

تبدیل متن به گفتار (Text-to-Speech یا TTS) یکی از مهمترین ابزارهای هوش مصنوعی برای زبان فارسی است. با پیشرفت مدلهای متنباز، امروزه میتوانید صداهای طبیعی و باکیفیت فارسی را روی سیستم خودتان تولید کنید، بدون نیاز به سرویسهای ابری گرانقیمت.
در این مقاله مدلهای TTS فارسی با کیفیت خوب روی Hugging Face را معرفی میکنیم، نقاط قوت هر کدام را بررسی میکنیم و راهنمای انتخاب مناسبترین مدل را ارائه میدهیم.
چرا مدلهای TTS فارسی مهم هستند؟
زبان فارسی ویژگیهای خاصی دارد (مثل اِعراب، اتصال حروف، واجهای خاص و ریتم طبیعی گفتار) که مدلهای عمومی اغلب در آنها ضعیف عمل میکنند. مدلهای fine-tune شده روی دادههای فارسی، تلفظ دقیقتر، ریتم طبیعیتر و کیفیت بالاتری ارائه میدهند.
کاربردهای رایج این مدلها:
- ساخت محتوای صوتی و پادکست
- سیستمهای خواندن متن برای نابینایان
- دستیارهای صوتی فارسی
- دوبله و تولید صدای شخصیت
- آموزش زبان و تمرین تلفظ
بهترین مدلهای TTS فارسی روی Hugging Face
۱. Gooya Bozorg v1.5
یکی از قویترین مدلهای فعلی. Gooya Bozorg v1.5 مدل fine-tune شده از Chatterbox (Resemble AI) است و روی دادههای تمیز و فیلترشده فارسی آموزش دیده.
نقاط قوت:
- کیفیت تلفظ و ریتم بسیار خوب
- پشتیبانی از Voice Cloning صفرشات (با یک نمونه صوتی کوتاه)
- مناسب تولید محتوای طبیعی
۲. KEYHAN-A/aava-tts-persian-3b
aava مبتنی بر Orpheus 3B که روی حدود ۲۵۰۰ ساعت داده فارسی آموزش دیده و خروجی ۲۴ کیلوهرتز تولید میکند.
نقاط قوت:
- کیفیت بالا و جزئیات صوتی خوب
- مناسب پروژههای تحقیقاتی و تولید محتوای حرفهای
۳. مدلهای Piper (Mana-Persian-Piper و نسخههای مشابه)
Piper مدلهای سبک و سریعی هستند که برای اجرا روی CPU و حتی دستگاههای ضعیف مناسباند.
مدلهای پیشنهادی:
MahtaFetrat/Mana-Persian-Piper(کیفیت خوب + سرعت بالا)SadeghK/persian-text-to-speech(صداهای امیر و گنجی)- نسخههای Gooya مبتنی بر Piper
نقاط قوت:
- سرعت بسیار بالا
- حجم کم
- مناسب استفاده بلادرنگ و روی دستگاه
۴. مدلهای قدیمیتر اما هنوز مفید
MahtaFetrat/Persian-Tacotron2-on-ManaTTS(آموزش روی دیتاست بزرگ ManaTTS)- مدلهای VITS از Kamtera
facebook/mms-tts-fas(مدل چندزبانه Meta)
این مدلها هنوز برای تست و پروژههای سبک کاربرد دارند، اما از نظر طبیعی بودن صدا معمولاً ضعیفتر از مدلهای جدیدتر هستند.
چگونه مدل مناسب را انتخاب کنیم؟
| نیاز شما | مدل پیشنهادی |
|---|---|
| بهترین کیفیت + Voice Cloning | Chatterbox / Gooya-Bozorg |
| کیفیت بالا با داده زیاد | Aava 3B |
| سرعت و سبک بودن | Mana-Persian-Piper یا سایر Piperها |
| تحقیق و fine-tune | مدلهای مبتنی بر ManaTTS |
اگر منابع سختافزاری محدود دارید (فقط CPU)، از مدلهای Piper شروع کنید. اگر GPU دارید و کیفیت برایتان اولویت است، Chatterbox یا Aava انتخاب بهتری هستند.
نتیجهگیری
در سال ۲۰۲۶، مدلهای Chatterbox (و نسخههای Gooya)، Aava و سری Piper بهترین گزینههای متنباز برای TTS فارسی روی Hugging Face هستند. بسته به نیازتان به کیفیت، سرعت یا امکان Voice Cloning میتوانید مدل مناسب را انتخاب کنید.
اگر میخواهید این مدلها را روی سیستم خودتان نصب و تست کنید، میتوانید از پرامپت آماده زیر استفاده کنید و آن را به ایجنتهای کدنویسی خود (مثل Claude Code، Codex، OpenCode، Hermes و …) بدهید تا نصب را انجام دهند.
پرامپت آماده برای ارسال به ایجنت (کپی و استفاده کنید):
من میخواهم مدلهای TTS فارسی زیر را روی سیستمم نصب و آماده استفاده کنم. لطفاً مرحلهبهمرحله و با دقت این کار را انجام بده: مدلهای مورد نظر (به ترتیب اولویت): ۱. Thomcles/Chatterbox-TTS-Persian-Farsi یا Reza2kn/Gooya-Bozorg-v1.5 (ترجیح با کیفیت بالاتر) ۲. MahtaFetrat/Mana-Persian-Piper ۳. KEYHAN-A/aava-tts-persian-3b (اگر منابع سختافزاری اجازه داد) کارهایی که باید انجام دهی: - بررسی سیستمعامل، وجود GPU/CUDA، مقدار RAM و فضای دیسک - نصب تمام dependencyهای لازم (با pip یا روش مناسب) - دانلود مدلها از Hugging Face (با huggingface_hub یا git lfs در صورت نیاز) - ساخت یک محیط مجازی (venv یا conda) جداگانه برای این پروژه - نوشتن یک اسکریپت ساده inference برای هر مدل که متن فارسی را بگیرد و فایل wav تولید کند - تست کردن هر مدل با یک متن نمونه فارسی (مثل: «سلام، حالت چطوره؟ امروز هوا خیلی خوب است.») - اگر خطایی رخ داد، آن را رفع کن و دوباره تست کن - در پایان یک README کوتاه بنویس که نحوه استفاده از هر مدل را توضیح دهد اولویتها: - اگر GPU موجود نبود، مدلهای سبکتر (Piper) را اولویت بده - از روشهای رسمی و مستند مدلها استفاده کن - همه چیز را تمیز و قابل استفاده مجدد نگه دار بعد از اتمام کار، خلاصهای از آنچه نصب شده و نحوه اجرای هر مدل را به من بده.
این پرامپت را مستقیماً کپی کنید و به ایجنت مورد نظرتان بدهید. ایجنت بر اساس سختافزار شما بهترین مسیر نصب را انتخاب میکند.
بیشتر بخوانید:
لیست کامل کدهای دستوری در ChatGPT: پرامپتهای طولانی را فراموش کنید
راهنمای جامع اصطلاحات و مفاهیم کلیدی هوش مصنوعی
ترجمه سریع زیرنویس فیلم و سریال با هوش مصنوعی



