xAI مدل Grok Voice Transcribe 2.0 را معرفی کرد؛ پشتیبانی از فارسی و امکانات تازه برای تبدیل صدا به متن
مقدمه

xAI در ۱۸ سپتامبر ۲۰۲۶ از Grok Voice Transcribe 2.0 رونمایی کرد؛ مدلی برای تبدیل فایل صوتی و صدای زنده به متن که برای استفاده از طریق API طراحی شده است. این خبر برای کسبوکارها، تولیدکنندگان محتوا و توسعهدهندگانی که به پیادهسازی پیادهسازی صوتی، زیرنویس، ثبت جلسات یا دستیار صوتی نیاز دارند اهمیت دارد؛ بهویژه چون مستندات رسمی xAI، زبان فارسی را نیز در فهرست زبانهای پشتیبانیشده برای قالببندی متن قرار دادهاند.
این یک قابلیت عمومیِ تأییدشده برای همه کاربران اپلیکیشن Grok نیست. اعلامیه و مستندات رسمی، عرضه فعلی را بر API گفتاربهمتن متمرکز میدانند؛ بنابراین دسترسی، هزینه و امکان استفاده عملی در ایران میتواند به وضعیت حساب توسعهدهنده، روش پرداخت و شرایط سرویس وابسته باشد.
چه چیزی معرفی شده است؟

Grok Voice Transcribe 2.0 نسل دوم مدل تبدیل گفتار به متن xAI است. طبق اعلامیه رسمی xAI، این مدل برای صوتهای واقعی و دشوار مانند تماس تلفنی، گفتوگوهای چندنفره، لهجهها و محیطهای پرنویز بهینه شده است. xAI ادعا میکند نسخه ۲ در ارزیابیهای داخلی خود نسبت به نسخه قبل بهبود چشمگیری دارد؛ این ادعا را باید دادهای از سوی خود شرکت دانست، نه نتیجه یک آزمایش مستقل عمومی.
مدل با شناسه grok-voice-transcribe-2.0 در API در دسترس قرار گرفته و مستندات فعلی xAI آن را مدل پیشفرض درخواستهای گفتاربهمتن معرفی میکنند. کاربران فعلی نسخه ۱ که به رفتار قبلی وابستهاند، میتوانند شناسه نسخه قدیمی را صریحاً در درخواست خود تعیین کنند.
امکانات مهم برای پروژههای صوتی

مدل جدید فقط متن نهایی را برنمیگرداند و برای سناریوهای حرفهای امکانات تکمیلی دارد. مهمترین آنها عبارتاند از:
- تبدیل فایل و صدای زنده: امکان پیادهسازی فایلهای ضبطشده و دریافت متن بهصورت بلادرنگ از طریق اتصال WebSocket.
- زمانبندی در سطح کلمه: زمان شروع و پایان هر واژه در خروجی ثبت میشود؛ قابلیتی کاربردی برای ساخت زیرنویس و جستوجو در ویدئو.
- تشخیص گوینده: مدل میتواند گویندگان را برچسبگذاری کند؛ برای جلسه، مصاحبه یا تماس پشتیبانی مفید است، هرچند نتیجه در فایلهای شلوغ باید بازبینی شود.
- پشتیبانی چندکاناله: تا ۸ کانال صوتی بهصورت مستقل قابل پردازش است؛ مثلاً در ضبطی که صدای اپراتور و مشتری روی کانالهای جدا ثبت شدهاند.
- واژههای کلیدی: توسعهدهنده میتواند تا ۱۰۰ اصطلاح تخصصی مانند نام محصول، برند یا واژه پزشکی را برای بهبود تشخیص به مدل بدهد.
- حذف کلمات پُرکننده و تشخیص پایان نوبت گفتوگو: دو گزینهای که میتوانند متن خروجی و رفتار دستیارهای صوتی را روانتر کنند.
جزئیات فنی، فرمتهای صوتی پذیرفتهشده، محدودیت حجم فایل و نحوه ارسال درخواست در مستندات گفتاربهمتن xAI آمده است.
وضعیت فارسی؛ نکتهای مهم برای کاربران ایرانی
در فهرست زبانهای مستندات xAI، Persian با کد fa وجود دارد. بر اساس همان مستندات، تعیین زبان در درخواست میتواند قالببندی شکل نوشتاری اعداد، واحدها و ارزها را فعال کند. با این حال، حضور فارسی در فهرست پشتیبانی بهتنهایی تضمینکننده دقت یکسان در همه لهجهها، گفتار محاورهای، نامهای فارسی یا فایلهای پرنویز نیست.
اگر قرار است خروجی برای کار حساس مانند قرارداد، پرونده پزشکی، متن آموزشی یا زیرنویس رسمی استفاده شود، بازبینی انسانی ضروری است. نام اشخاص، اصطلاحات محلی، کدها، شماره تلفنها و ترکیب فارسی و انگلیسی معمولاً بخشهایی هستند که باید با نمونه صوت واقعی خودتان آزموده شوند. قابلیت واژههای کلیدی میتواند برای نام برندها، مدل کالاها و اصطلاحات تخصصی کمککننده باشد.
قیمت و دسترسی چه وضعی دارد؟
xAI اعلام کرده قیمت نسخه ۲ نسبت به نسخه ۱ تغییر نکرده است: پردازش دستهای ۰٫۱۰ دلار برای هر ساعت صوت و پردازش جریانی ۰٫۲۰ دلار برای هر ساعت صوت. تشخیص گوینده، زمانبندی کلمهبهکلمه و واژههای کلیدی بنا بر اعلام شرکت در همین قیمت لحاظ شدهاند.
این ارقام قیمت فهرستشده API هستند و نباید با هزینه نهایی برای کاربران ایرانی یکی دانسته شوند. نرخ ارز، مالیات، محدودیتهای پرداخت بینالمللی، شرایط منطقهای حساب و تغییرات بعدی قیمتگذاری میتوانند هزینه و حتی امکان دسترسی را تغییر دهند. پیش از طراحی محصول یا خرید اعتبار، صفحه قیمت و شرایط حساب xAI را بررسی کنید.
جمعبندی
Grok Voice Transcribe 2.0 یک خبر مهم در حوزه ابزارهای صوتی هوش مصنوعی است، چون قابلیتهای رایج پروژههای حرفهای مانند پیادهسازی زنده، تشخیص گوینده، پردازش چندکاناله و زمانبندی واژهها را در یک API گرد هم میآورد. پشتیبانی مستند از کد فارسی نیز آن را برای آزمون در پروژههای فارسیزبان قابل توجه میکند. با این حال، ارزش واقعی آن برای مخاطب ایرانی پس از سنجش کیفیت روی فایلهای فارسی واقعی و بررسی وضعیت دسترسی و پرداخت مشخص خواهد شد؛ نه صرفاً بر پایه ادعای بنچمارک شرکت.
