xAI مدل Grok Voice Transcribe 2.0 را معرفی کرد؛ پشتیبانی از فارسی و امکانات تازه برای تبدیل صدا به متن

پریسا اصغری یکشنبه 29 شهریور 1405 - 20:41
xAI مدل Grok Voice Transcribe 2.0 را معرفی کرد؛ پشتیبانی از فارسی و امکانات تازه برای تبدیل صدا به متن
مدل جدید گفتاربه‌متن xAI با قابلیت‌هایی مانند تشخیص گوینده، زمان‌بندی کلمه‌به‌کلمه و پشتیبانی از قالب‌بندی فارسی منتشر شده است؛ اما فعلاً محصولی APIمحور برای توسعه‌دهندگان محسوب می‌شود.

مقدمه

تصویر رسمی xAI مدل Grok Voice Transcribe 2.0 را معرفی کرد؛ پشتیبانی از فارسی و امکانات تازه برای تبدیل صدا به متن؛ مقدمه

xAI در ۱۸ سپتامبر ۲۰۲۶ از Grok Voice Transcribe 2.0 رونمایی کرد؛ مدلی برای تبدیل فایل صوتی و صدای زنده به متن که برای استفاده از طریق API طراحی شده است. این خبر برای کسب‌وکارها، تولیدکنندگان محتوا و توسعه‌دهندگانی که به پیاده‌سازی پیاده‌سازی صوتی، زیرنویس، ثبت جلسات یا دستیار صوتی نیاز دارند اهمیت دارد؛ به‌ویژه چون مستندات رسمی xAI، زبان فارسی را نیز در فهرست زبان‌های پشتیبانی‌شده برای قالب‌بندی متن قرار داده‌اند.

این یک قابلیت عمومیِ تأییدشده برای همه کاربران اپلیکیشن Grok نیست. اعلامیه و مستندات رسمی، عرضه فعلی را بر API گفتاربه‌متن متمرکز می‌دانند؛ بنابراین دسترسی، هزینه و امکان استفاده عملی در ایران می‌تواند به وضعیت حساب توسعه‌دهنده، روش پرداخت و شرایط سرویس وابسته باشد.

چه چیزی معرفی شده است؟

تصویر رسمی xAI مدل Grok Voice Transcribe 2.0 را معرفی کرد؛ پشتیبانی از فارسی و امکانات تازه برای تبدیل صدا به متن؛ چه چیزی معرفی شده است؟

Grok Voice Transcribe 2.0 نسل دوم مدل تبدیل گفتار به متن xAI است. طبق اعلامیه رسمی xAI، این مدل برای صوت‌های واقعی و دشوار مانند تماس تلفنی، گفت‌وگوهای چندنفره، لهجه‌ها و محیط‌های پرنویز بهینه شده است. xAI ادعا می‌کند نسخه ۲ در ارزیابی‌های داخلی خود نسبت به نسخه قبل بهبود چشمگیری دارد؛ این ادعا را باید داده‌ای از سوی خود شرکت دانست، نه نتیجه یک آزمایش مستقل عمومی.

مدل با شناسه grok-voice-transcribe-2.0 در API در دسترس قرار گرفته و مستندات فعلی xAI آن را مدل پیش‌فرض درخواست‌های گفتاربه‌متن معرفی می‌کنند. کاربران فعلی نسخه ۱ که به رفتار قبلی وابسته‌اند، می‌توانند شناسه نسخه قدیمی را صریحاً در درخواست خود تعیین کنند.

امکانات مهم برای پروژه‌های صوتی

تصویر رسمی xAI مدل Grok Voice Transcribe 2.0 را معرفی کرد؛ پشتیبانی از فارسی و امکانات تازه برای تبدیل صدا به متن؛ امکانات مهم برای پروژه‌های صوتی

مدل جدید فقط متن نهایی را برنمی‌گرداند و برای سناریوهای حرفه‌ای امکانات تکمیلی دارد. مهم‌ترین آن‌ها عبارت‌اند از:

  • تبدیل فایل و صدای زنده: امکان پیاده‌سازی فایل‌های ضبط‌شده و دریافت متن به‌صورت بلادرنگ از طریق اتصال WebSocket.
  • زمان‌بندی در سطح کلمه: زمان شروع و پایان هر واژه در خروجی ثبت می‌شود؛ قابلیتی کاربردی برای ساخت زیرنویس و جست‌وجو در ویدئو.
  • تشخیص گوینده: مدل می‌تواند گویندگان را برچسب‌گذاری کند؛ برای جلسه، مصاحبه یا تماس پشتیبانی مفید است، هرچند نتیجه در فایل‌های شلوغ باید بازبینی شود.
  • پشتیبانی چندکاناله: تا ۸ کانال صوتی به‌صورت مستقل قابل پردازش است؛ مثلاً در ضبطی که صدای اپراتور و مشتری روی کانال‌های جدا ثبت شده‌اند.
  • واژه‌های کلیدی: توسعه‌دهنده می‌تواند تا ۱۰۰ اصطلاح تخصصی مانند نام محصول، برند یا واژه پزشکی را برای بهبود تشخیص به مدل بدهد.
  • حذف کلمات پُرکننده و تشخیص پایان نوبت گفت‌وگو: دو گزینه‌ای که می‌توانند متن خروجی و رفتار دستیارهای صوتی را روان‌تر کنند.

جزئیات فنی، فرمت‌های صوتی پذیرفته‌شده، محدودیت حجم فایل و نحوه ارسال درخواست در مستندات گفتاربه‌متن xAI آمده است.

وضعیت فارسی؛ نکته‌ای مهم برای کاربران ایرانی

در فهرست زبان‌های مستندات xAI، Persian با کد fa وجود دارد. بر اساس همان مستندات، تعیین زبان در درخواست می‌تواند قالب‌بندی شکل نوشتاری اعداد، واحدها و ارزها را فعال کند. با این حال، حضور فارسی در فهرست پشتیبانی به‌تنهایی تضمین‌کننده دقت یکسان در همه لهجه‌ها، گفتار محاوره‌ای، نام‌های فارسی یا فایل‌های پرنویز نیست.

اگر قرار است خروجی برای کار حساس مانند قرارداد، پرونده پزشکی، متن آموزشی یا زیرنویس رسمی استفاده شود، بازبینی انسانی ضروری است. نام اشخاص، اصطلاحات محلی، کدها، شماره تلفن‌ها و ترکیب فارسی و انگلیسی معمولاً بخش‌هایی هستند که باید با نمونه صوت واقعی خودتان آزموده شوند. قابلیت واژه‌های کلیدی می‌تواند برای نام برندها، مدل کالاها و اصطلاحات تخصصی کمک‌کننده باشد.

قیمت و دسترسی چه وضعی دارد؟

xAI اعلام کرده قیمت نسخه ۲ نسبت به نسخه ۱ تغییر نکرده است: پردازش دسته‌ای ۰٫۱۰ دلار برای هر ساعت صوت و پردازش جریانی ۰٫۲۰ دلار برای هر ساعت صوت. تشخیص گوینده، زمان‌بندی کلمه‌به‌کلمه و واژه‌های کلیدی بنا بر اعلام شرکت در همین قیمت لحاظ شده‌اند.

این ارقام قیمت فهرست‌شده API هستند و نباید با هزینه نهایی برای کاربران ایرانی یکی دانسته شوند. نرخ ارز، مالیات، محدودیت‌های پرداخت بین‌المللی، شرایط منطقه‌ای حساب و تغییرات بعدی قیمت‌گذاری می‌توانند هزینه و حتی امکان دسترسی را تغییر دهند. پیش از طراحی محصول یا خرید اعتبار، صفحه قیمت و شرایط حساب xAI را بررسی کنید.

جمع‌بندی

Grok Voice Transcribe 2.0 یک خبر مهم در حوزه ابزارهای صوتی هوش مصنوعی است، چون قابلیت‌های رایج پروژه‌های حرفه‌ای مانند پیاده‌سازی زنده، تشخیص گوینده، پردازش چندکاناله و زمان‌بندی واژه‌ها را در یک API گرد هم می‌آورد. پشتیبانی مستند از کد فارسی نیز آن را برای آزمون در پروژه‌های فارسی‌زبان قابل توجه می‌کند. با این حال، ارزش واقعی آن برای مخاطب ایرانی پس از سنجش کیفیت روی فایل‌های فارسی واقعی و بررسی وضعیت دسترسی و پرداخت مشخص خواهد شد؛ نه صرفاً بر پایه ادعای بنچمارک شرکت.

بازگشت به بالا

© 2026 Beruzkala
بازخوردها
    ارسال بازخورد
    (بعد از تائید مدیر منتشر خواهد شد)
    • - نشانی ایمیل شما منتشر نخواهد شد.
    • - لطفا دیدگاهتان تا حد امکان مربوط به مطلب باشد.
    • - لطفا فارسی بنویسید.
    • - میخواهید عکس خودتان کنار نظرتان باشد؟ به gravatar.com بروید و عکستان را اضافه کنید.
    • - نظرات شما بعد از تایید مدیریت منتشر خواهد شد