بهترین اپلیکیشن تبدیل صدا به متن فارسی را چطور انتخاب کنیم؟
گوگل، ChatGPT، صفحهکلید گوشی، پیامرسانها یا ابزار فایل صوتی؟ معیارهای مهم برای فارسی، یک آزمون شصتثانیهای که خودتان تکرار میکنید و نتیجهٔ یک آزمایش واقعی.
بهترین اپلیکیشن تبدیل صدا به متن برای فارسی، به این بستگی دارد که میخواهید همان لحظه حرف بزنید و متن ببینید یا یک فایل صوتی ضبطشده دارید. برای تایپ زنده، میکروفون صفحهکلید گوشی یا Voice typing در Google Docs کافی است؛ برای ویس، جلسه و کلاس به ابزاری نیاز دارید که فایل بگیرد، فارسی را بشناسد و نقطهگذاری و زمانبندی بدهد، مثل ابزار تبدیل صدا به متن تاپگیفت. پیش از انتخاب نهایی، یک فایل آزمایشی شصتثانیهای را که پایینتر آمده در دو یا سه گزینه امتحان کنید؛ نتیجهٔ همین آزمون از هر فهرست «برترینها» قابلاعتمادتر است.
اول مشخص کنید: تایپ زنده یا فایل صوتی؟
بیشتر سردرگمیها از اینجا شروع میشود که دو کار متفاوت با یک اسم جستوجو میشوند:
- تایپ زنده (دیکته): حرف میزنید و کلمهها همان لحظه در پیام یا سند نوشته میشوند. صفحهکلیدهای گوشی، Google Docs و دکمهٔ میکروفون چتباتها در این دستهاند. راهاندازی هر کدام در راهنمای تایپ صوتی فارسی آمده است.
- تبدیل فایل (پیادهسازی): یک فایل صوتی یا ویس از قبل دارید و متن کامل آن را میخواهید، ترجیحاً با زمان هر بخش. برای جلسه، کلاس، مصاحبه و ویسهای بلند همین را لازم دارید.
اگر کارتان دومی است، ابزارهای دیکته هر قدر هم خوب باشند جواب نمیدهند، چون اصلاً فایل نمیگیرند.
معیارهایی که برای صدای فارسی مهماند
- دقت واژهها در فارسی محاورهای: بیشتر ضبطها رسمی نیستند؛ «میخوام» و «بریم» باید درست نوشته شوند.
- نامها، عددها و اصطلاحهای انگلیسی: نام آدمها، تاریخها، مبلغها و واژههایی مثل API یا Laravel بیشترین خطا را دارند و مهمترین بخش متناند.
- نقطهگذاری و نیمفاصله: متن بینقطه و بدون نیمفاصله خواندنی نیست و ویرایشش وقت میگیرد.
- زمانبندی: برای پیدا کردن یک جمله در فایل یکساعته، زمان کنار متن ضروری است.
- قالب و طول فایل: ویس تلگرام OGG است، ضبط آیفون M4A و ضبطهای قدیمی WAV. سقف مدت و حجم هر فایل را هم ببینید.
- جدا کردن گویندهها: اگر صورتجلسهٔ چندنفره میخواهید، بپرسید ابزار گویندهها را جدا میکند یا نه.
- حریم خصوصی: صدا کجا پردازش و تا کی نگه داشته میشود؟ برای جلسههای کاری این سؤال از دقت کماهمیتتر نیست.
یک آزمون ساده که خودتان تکرار کنید
این متن خیالی حدود شصت ثانیه طول میکشد و عمداً همهٔ بخشهای سخت را دارد: نام، تاریخ، عدد، واژهٔ انگلیسی، نشانی ایمیل و کلمههای نیمفاصلهدار.
سلام، من سارا محمدی هستم از شرکت نمونه. جلسهٔ بعدی ما دوشنبه، پانزدهم آبان، ساعت ده و نیم برگزار میشود. لطفاً گزارش فروش سهماههٔ دوم را تا یکشنبه بفرستید؛ رقم کل حدود دوازده میلیون و چهارصد هزار است. تیم فنی هم دربارهٔ بهروزرسانی Laravel و اتصال API پرداخت توضیح میدهد. اگر سؤالی دارید، به info@example.com ایمیل بزنید یا با داخلی 214 تماس بگیرید.
- متن را دو بار با گوشی ضبط کنید: یک بار در اتاق ساکت و یک بار با صدای پسزمینه، مثلاً پنکه یا تلویزیون با صدای کم.
- هر دو فایل را به گزینههایی که فایل میگیرند بدهید؛ برای ابزارهای دیکته، همان متن را با صدای خودتان دوباره بخوانید.
- خروجی را با متن اصلی مقایسه کنید و برای هر کلمهٔ جاافتاده، اضافه یا اشتباه یک خطا بشمارید. تعداد خطا را بر تعداد کل واژهها تقسیم کنید تا درصد خطا به دست بیاید.
- جدا یادداشت کنید: نام «سارا محمدی»، تاریخ، عدد، Laravel و API و ایمیل درست آمد؟ نقطهگذاری و نیمفاصلهها چطور بود؟ زمانبندی داشت؟

نسخهٔ نویزدار مهمتر است، چون ضبطهای واقعی کمتر در اتاق ساکت انجام میشوند. گزینهای که در صدای تمیز کمی بهتر است ولی در صدای نویزدار نامها را خراب میکند، برای جلسه انتخاب خوبی نیست.
گزینهها، دسته به دسته
صفحهکلید گوشی (Gboard و صفحهکلید سامسونگ)
برای پیام و یادداشت کوتاه سریعترین راه است. راهنمای Gboard میگوید تایپ با صدا با همهٔ زبانها کار نمیکند و نقطهگذاری با صدا هم ممکن است در همهٔ زبانها نباشد؛ پس فارسی را روی گوشی خودتان آزمایش کنید. فایل نمیگیرد و زمانبندی ندارد.
تبدیل صدا به متن فارسی با گوگل (Google Docs)
در راهنمای Voice typing گوگل داکس، Farsi در فهرست زبانها آمده و این قابلیت در نسخهٔ تازهٔ Chrome، Edge و Safari کار میکند. همان صفحه میگوید فرمانهای صوتی ویرایش فقط انگلیسیاند و نقطهگذاری ممکن است در همهٔ زبانها نباشد. برای نوشتن یک متن با صدای خودتان پشت کامپیوتر گزینهٔ خوبی است؛ اما ورودی آن میکروفون است، نه فایل.
دیکتهٔ آیفون، ویندوز و ورد
طبق صفحههای رسمی، فارسی در فهرست زبانهای Dictation آیفون، تایپ صوتی ویندوز و Dictate ورد نیست. پس این سه، با همهٔ کیفیتشان در زبانهای دیگر، برای فارسی گزینه نیستند.
تبدیل صدا به متن با چت جی پی تی
راهنمای OpenAI حالت دیکته را اینطور توضیح میدهد: آیکون میکروفون جعبهٔ متن را میزنید، حرف میزنید، حرفتان به متن تبدیل میشود و پیش از فرستادن میتوانید آن را ویرایش کنید. یعنی برای گفتن یک درخواست به چتبات طراحی شده، نه برای تحویل متن زمانبندیشدهٔ یک فایل یکساعته. برنامهنویسها میتوانند از API تبدیل گفتار OpenAI استفاده کنند؛ مستندات آن سقف هر فایل را 25 مگابایت گفته و دربارهٔ مدل whisper-1 نوشته که 98 زبان را پشتیبانی میکند ولی دقت از زبانی به زبان دیگر فرق دارد. اگر میخواهید مدلهای چت را از جنبههای دیگر مقایسه کنید، مقایسهٔ ChatGPT، Claude، Gemini و DeepSeek را ببینید.
قابلیت داخلی پیامرسانها
تلگرام تبدیل ویس به متن را برای کاربران پرمیوم دارد و طبق مستندات خودش کاربران عادی هفتهای تعداد محدودی ویس را میتوانند تبدیل کنند. واتساپ رونوشت پیام صوتی را روی خود گوشی میسازد و زبانش را در تنظیمات انتخاب میکنید. هیچکدام در این صفحهها فارسی را صریحاً جزو زبانها نیاوردهاند و متن داخل همان گفتگو نمایش داده میشود.
ابزار ویژهٔ فایل صوتی: آنچه تاپگیفت دارد و ندارد
- ورودی: ضبط در همان صفحه، بارگذاری فایل MP3، M4A، WAV، AAC، OGG، OGA، OPUS و WEBM، و ویس تلگرام از طریق ربات.
- طول فایل: بدون ثبتنام تا 90 ثانیه و روزانه چند بار؛ با ورود به حساب هر فایل تا 60 دقیقه و 100 مگابایت.
- زبان: فارسی، انگلیسی یا تشخیص خودکار.
- نوع متن: دقیق، خوانا (با نقطهگذاری و جملهبندی) یا پاکسازیشده (بدون واژههای پرکننده).
- زمانبندی: صدا در مکثها تکه میشود و زمان هر تکه از خود فایل خوانده میشود، نه حدس هوش مصنوعی.
- آنچه ندارد: گویندهها را جدا نمیکند، فایل ویدئویی نمیگیرد و فایل بلندتر از 60 دقیقه را باید چند تکه کنید.
نتیجهٔ یک آزمایش واقعی
ما این آزمون را روی ابزار تاپگیفت انجام دادیم، با فایلی که خودمان ساختیم: یک یادداشت خیالی جلسه (226 نویسه) را ابزار تبدیل متن به صدای تاپگیفت با گویندهٔ آرمان خواند و فایل MP3 بیستوسهثانیهای ساخت. همان فایل بدون ثبتنام و در حالت «متن خوانا» به متن تبدیل شد.

از 39 واژه، همه درست برگشتند و نام «خانم رضایی» و تاریخ «پانزدهم آبان» هم درست نوشته شد. تفاوتها: پنج نشانهٔ «ـٔ» (مثل «جلسهٔ» که «جلسه» شد) نوشته نشد و دونقطهٔ بعد از «داریم» به نقطه تبدیل شد. یک زمانبندی (00:00) هم کنار متن آمد، چون کل فایل یک تکه بود.
این نتیجه را درست بخوانید: صدای ساختگی، تمیز و تکگوینده بهترین حالت ممکن است و ضبط واقعی شما با نویز و لهجه و حرف همزمان خطای بیشتری خواهد داشت. ما گزینههای دیگر را با همین فایل نسنجیدهایم، پس نمرهای برای مقایسه نمیدهیم؛ کارنامهٔ بالا را خودتان با فایلهای خودتان پر کنید.
جمعبندی: کدام را انتخاب کنیم؟
| نیاز شما | گزینهٔ مناسب | چه چیزی را آزمایش کنید |
|---|---|---|
| پیام کوتاه با صدا | میکروفون صفحهکلید گوشی | اینکه فارسی را روی گوشی شما درست بنویسد |
| نوشتن یک متن پشت کامپیوتر | Voice typing در Google Docs | نقطهگذاری و نامها |
| ویس تلگرام و واتساپ | قابلیت داخلی پیامرسان یا ابزار فایل صوتی | پشتیبانی فارسی و سهمیهٔ استفاده |
| جلسه، کلاس، مصاحبه | ابزار فایل صوتی با زمانبندی | نسخهٔ نویزدار آزمون، سقف مدت فایل، جدا شدن گویندهها |
برای جلسه و کلاس، نکتههای ضبط و ویرایش را در راهنمای تبدیل ویس جلسه و کلاس به متن نوشتهایم. اگر فایل آزمون را آماده کردهاید، نسخهٔ نویزدارش را در صفحهٔ تبدیل فایل صوتی به متن امتحان کنید و با گزینههای دیگر بسنجید.