فیلم بیشتر »»
کد خبر ۱۱۹۵۸۶۳
تاریخ انتشار: ۰۹:۳۶ - ۱۱-۰۷-۱۴۰۵
کد ۱۱۹۵۸۶۳
انتشار: ۰۹:۳۶ - ۱۱-۰۷-۱۴۰۵

مدل جدید مایکروسافت برای تبدیل لحظه‌ای صدا به متن با پشتیبانی از ۶۰ زبان معرفی شد

مایکروسافت
مدل‌های هوش مصنوعی جدید مایکروسافت برای رونویسی بلادرنگ از صحبت‌های گوینده طراحی شده‌اند.

مایکروسافت ماه گذشته MAI-Transcribe-2 را معرفی کرد که در آزمایش‌های این شرکت توانست عملکرد بهتری از مدل‌های رقیب OpenAI و گوگل در زمینه رونویسی ارائه دهد و هزینه استفاده از آن تنها ۰.۱۰ دلار به ازای هر ساعت بود. 

به گزارش دیجیاتو، این غول فناوری حالا مدل هوش مصنوعی صوتی MAI-Transcribe-2-Streaming را معرفی کرد؛ در کنار آن دو مدل جدید دیگر نیز معرفی شدند: MAI-Voice-2.1 و MAI-Voice-2.1-Flash. این مدل‌های جدید برای همکاری با یکدیگر و کارکرد به‌عنوان دستیارهای صوتی مکالمه‌ای با تأخیر بسیار کم طراحی شده‌اند.

مدل جدید صوتی مایکروسافت برای تبدیل صدا به متن

برخلاف MAI-Transcribe-2 که فقط فایل‌های صوتی ضبط‌شده را پردازش می‌کند، مدل MAI-Transcribe-2-Streaming برای کاربردهای بلادرنگ طراحی شده است. این مدل به‌جای اینکه تا پایان صحبت گوینده منتظر بماند و سپس متن را ارائه کند، کمی بیش از ۱۰۰ میلی‌ثانیه پس از دریافت صدا شروع به تولید بخش‌های اولیه متن می‌کند. مدل با دریافت اطلاعات بیشتر، این نتایج را به‌طور مداوم اصلاح می‌کند تا در نهایت متن نهایی را ثبت کند.

مدل جدید مایکروسافت برای تبدیل لحظه‌ای صدا به متن با پشتیبانی از ۶۰ زبان معرفی شد

MAI-Transcribe-2-Streaming از ۶۰ زبان و تشخیص خودکار و مداوم زبان پشتیبانی می‌کند. مایکروسافت می‌گوید این مدل از نظر دقت متن‌های اولیه و نهایی، در رتبه اول Artificial Analysis قرار گرفته است. در آزمایش‌های داخلی مایکروسافت برای دیکته و زیرنویس، کلمات با این مدل دو برابر سریع‌تر از نزدیک‌ترین رقیب در متن ظاهر شدند.

قیمت استفاده از این مدل تا پایان سال ۲۰۲۶، حدود ۰.۵۴ دلار به ازای هر ساعت فایل صوتی است. این رقم به‌مراتب بیشتر از قیمت ۰.۱۰ دلار به ازای هر ساعت برای نسخه غیر Streaming یعنی MAI-Transcribe-2 است.

مایکروسافت همچنین مدل MAI-Voice-2.1 را معرفی کرد که جدیدترین مدل چندزبانه تبدیل متن به گفتار این شرکت محسوب می‌شود. مایکروسافت اوایل امسال MAI-Voice-2 و نسخه سریع‌تر آن، یعنی MAI-Voice-2-Flash، را معرفی کرده بود که در Dynamics 365 Contact Center و Azure Voice Live استفاده می‌شوند.MAI-Voice-2.1 از ۲۳ زبان در ۲۶ منطقه زبانی پشتیبانی می‌کند و هزینه آن ۲۲ دلار به ازای هر یک میلیون کاراکتر است.

برای کاربردهایی که به تأخیر کم و حجم بالای پردازش نیاز دارند، مایکروسافت MAI-Voice-2.1-Flash را نیز معرفی کرده است. این مدل می‌تواند ۴۵ ثانیه فایل صوتی را با حدود ۱۵۰ میلی‌ثانیه تأخیر از ابتدا تا انتها تولید کند. مایکروسافت ادعا می‌کند این مدل ۵۵ درصد استنتاج سریع‌تری دارد و حدود ۶۰ درصد ارزان‌تر از مدل‌های مشابه است. همچنین هزینه استفاده از آن ۱۵ دلار به ازای هر یک میلیون کاراکتر خواهد بود. هر دو مدل جدید صوتی همچنین امکان کلون‌کردن صدا را در زبان‌های تحت پشتیبانی خود، تنها با استفاده از چند ثانیه صدای مرجع، دارند. 

پربیننده ترین پست همین یک ساعت اخیر
برچسب ها: مایکروسافت ، صدا ، زبان
ارسال به دوستان
captcha
والیبال ایران با شکست ژاپن طلای بازی‌های آسیایی ناگویا را گرفت کاروان ایران در بازی‌های پاراآسیایی ناگویا با ۱۶۶ ورزشکار پایان ماه‌ها انکار؛ اعتراف پدر خانواده به قتل همسر و دختر ۱۲ساله‌اش در چیتگر نامه خسروی‌وفا به رهبر معظم انقلاب درباره بازی‌های آسیایی 2026 دیدار قبل از خداحافظی مسی در هاله‌ای از ابهام خروج رونالدو از اردوی پرتغال؛ پای یک موضوع خانوادگی هم در میان بود جزئیات جدید آزمون سراسری؛ از سطح دشواری سوالات تا تغییر در پذیرش رشته‌های پزشکی اظهارات کنایه آمیز الهام علی اف علیه ترکیه: ما دایی بزرگ نداریم/ هیچکس از ما حمایت نکرد/ سلاح دادید" دولا پهنا"پول گرفتید! سرتان به کار خودتان باشد و در سبک زندگی ما دخالت نکنید اعتراضات فرانسه و خودکفایی رسانه ای کشف بیش از ۱۰ کیلوگرم ماریجوانا در این شهر دستگیری ۲ زورگیر در سه‌راه تهرانپارس وقتی برند بزرگ می‌شود بنیان‌گذار چه جایگاهی دارد؟ نگاهی به تکامل برند سعید محمدی در دیجی‌کالا هکر پرونده مالی منچسترسیتی پس از حکم محرومیت تهدید به مرگ شد علی نظری‌جویباری در آستانه خروج کامل از ساختار مدیریتی استقلال پایان طلایی کشتی ایران در ناگویا؛ آذرپیرا هم به مدال طلا رسید