شرکت کارن تکنولوژی - درحال بارگزاری...

نوآوری پرداز کارن

توسعه بر بستر وب و موبایل، خدمات هوش مصنوعی و یادگیری ماشین، توسعه بازی بر بستر موبایل، توسعه بر بستر بلاکچین

شبکه های اجتماعی

تماس آنی ما با شما

در کوتاهترین زمان مشاوره رایگان دریافت نمایید

زیرنویس و آرشیو جست‌وجوپذیر - وقتی خروجی قرار است منتشر شود

زیرنویس و آرشیو جست‌وجوپذیر - وقتی خروجی قرار است منتشر شود

تبدیل گفتار به متن در رسانه دو کاربرد دارد که معمولاً با هم اشتباه گرفته می‌شوند: زیرنویس و جست‌وجوپذیر کردن آرشیو. از نظر فنی یک فناوری‌اند و از نظر آستانه کیفیت، دو دنیای متفاوت - چون یکی منتشر می‌شود و دیگری نه.

در این مقاله می‌خوانید

  • دو کاربرد، دو آستانه کیفیت
  • آرشیو: نقص قابل تحمل است
  • زیرنویس: خروجی منتشر می‌شود
  • زمان‌بندی و تفکیک گوینده
  • گردش‌کار
  • مالکیت محتوا
  • سنجش و نقطه شروع
تبدیل گفتار فارسی به متن برای زیرنویس و جست‌وجوپذیر کردن آرشیو ویدیویی

دو کاربرد، دو آستانه کیفیت

در گفت‌وگوی پشتیبانی، خطای تشخیص گفتار حداکثر باعث یک پرسش دوباره می‌شود. در رسانه بستگی دارد به اینکه خروجی کجا می‌رود:

آرشیو - مصرف داخلی

هدف این است که تدوینگر بتواند صحنه یا نقل‌قولی را پیدا کند. اگر چند واژه اشتباه خوانده شوند، جست‌وجو همچنان کار می‌کند - چون کاربر معمولاً چند کلمه کلیدی می‌زند و بافت جمله کمکش می‌کند.

زیرنویس - انتشار عمومی

اینجا خروجی دیده می‌شود. یک واژه اشتباه در زیرنویس، خطای قابل مشاهده رسانه است - به‌خصوص در نام‌ها، اعداد و اصطلاحات تخصصی که دقیقاً همان‌هایی هستند که مدل بیشتر اشتباه می‌کند.

همین تفاوت یعنی برای آرشیو می‌شود بدون بازبینی انسانی جلو رفت، ولی برای زیرنویس نمی‌شود - و پروژه‌ای که این دو را یکی بگیرد، یا آرشیو را بیش از حد گران می‌کند یا زیرنویس را بی‌کیفیت منتشر می‌کند.

آرشیو: نقص قابل تحمل است

برای آرشیو، هدف پوشش است نه کمال. رویه عملی:

  • پردازش دسته‌ای کل آرشیو، بدون بازبینی
  • نمایه‌سازی متن با زمان‌بندی، تا جست‌وجو مستقیم به لحظه ببرد
  • جست‌وجوی معنایی علاوه بر کلیدواژه‌ای، تا واژه اشتباه‌خوانده‌شده کل نتیجه را از دست ندهد

و یک قابلیت که ارزشش دیر معلوم می‌شود: وقتی آرشیو متن دارد، می‌شود پرسید «کجا درباره فلان موضوع صحبت شده» - چیزی که قبلاً حتی قابل تصور نبود.

زیرنویس: خروجی منتشر می‌شود

برای زیرنویس، خروجی مدل پیش‌نویس است. آنچه واقعاً زمان ویراستار را کم می‌کند این‌هاست:

  • زمان‌بندی درست - اگر زمان‌بندی دقیق باشد، ویراستار فقط متن را اصلاح می‌کند نه جای آن را
  • علامت‌گذاری موارد کم‌اطمینان - تا ویراستار بداند کجا را با دقت بیشتری بررسی کند
  • واژگان دامنه - نام‌های تکرارشونده، اصطلاحات برنامه و نام مجریان، از قبل به مدل داده شوند

نکته آخر بیشترین اثر را دارد. در یک برنامه ثابت، بخش بزرگی از خطاها روی همان چند نام تکراری‌اند - و همان‌ها را می‌شود یک بار تعریف کرد.

نمونه‌ای از آرشیو خودتان را آزمایش کنیم؟

با فایل‌های واقعی خودتان آزمایش می‌کنیم - استودیویی و میدانی هر دو - تا تفاوت را ببینید.

زمان‌بندی و تفکیک گوینده

دو قابلیت که در رسانه بیش از هر جای دیگری اهمیت دارند:

زمان‌بندی در سطح واژه

زیرنویس باید با گفتار هم‌زمان باشد. زمان‌بندی در سطح جمله برای آرشیو کافی است، برای زیرنویس نه.

تفکیک گوینده

در گفت‌وگو و میزگرد، دانستن اینکه چه کسی چه گفت هم برای زیرنویس لازم است و هم برای جست‌وجوی آرشیو ارزشمند. و صادقانه: در صحبت هم‌زمان چند نفر، این کار سخت است و نتیجه‌اش نیاز به اصلاح دارد.

برای برنامه‌های با ساختار ثابت - مجری مشخص و مهمان - می‌شود دقت را با معرفی گوینده‌های شناخته‌شده بالا برد.

گردش‌کار

۱. تفکیک مسیر آرشیو از مسیر زیرنویس

دو صف با اولویت و آستانه متفاوت.

۲. پیش‌پردازش صدا

جداسازی گفتار از موسیقی و نویز پس‌زمینه، که در محتوای رسانه‌ای همیشه هست.

۳. تبدیل با واژگان دامنه

فهرست نام‌ها و اصطلاحات همان برنامه یا همان حوزه.

۴. مسیر آرشیو: نمایه‌سازی مستقیم

بدون بازبینی، با جست‌وجوی معنایی.

۵. مسیر زیرنویس: میز ویراستار

با علامت‌گذاری موارد کم‌اطمینان و زمان‌بندی آماده.

مالکیت محتوا

در رسانه، آرشیو دارایی اصلی است. سه تعهدی که باید در قرارداد باشد نه در گفت‌وگو:

  • پردازش روی زیرساخت خودتان؛ محتوا بیرون نمی‌رود
  • آرشیو برای آموزش هیچ مدل بیرونی استفاده نمی‌شود
  • اگر روی داده شما تنظیم دقیق انجام شود، مدل حاصل مال شماست و همان‌جا می‌ماند

این‌ها را در صفحه راهکارهای رسانه هم آورده‌ایم، چون رایج‌ترین پرسش این صنعت‌اند.

سنجش و نقطه شروع

برای آرشیو: نرخ جست‌وجوی موفق - چه سهمی از جست‌وجوها به نتیجه مفید رسید. دقت واژه‌به‌واژه اینجا معیار درستی نیست.

برای زیرنویس: زمان ویرایش هر دقیقه محتوا در برابر تولید دستی. این تنها معیاری است که مستقیم به صرفه‌جویی ترجمه می‌شود.

پیشنهاد ما شروع با آرشیو است نه زیرنویس: آستانه‌اش پایین‌تر، ریسکش کمتر و ارزشش سریع‌تر دیده می‌شود. زیرنویس فاز دوم است، پس از تنظیم واژگان دامنه.

جزئیات پلتفرم در صفحه دستیار صوتی است.

پرسش‌های متداول

توصیه نمی‌کنیم. زیرنویس دیده می‌شود و یک واژه اشتباه، خطای قابل مشاهده رسانه است - به‌خصوص در نام‌ها، اعداد و اصطلاحات تخصصی که دقیقاً همان‌هایی هستند که مدل بیشتر اشتباه می‌کند. خروجی پیش‌نویس است و به میز ویراستار می‌رود.

آرشیو مصرف داخلی دارد و هدفش پیدا شدن است. اگر چند واژه اشتباه خوانده شوند، جست‌وجو همچنان کار می‌کند چون کاربر چند کلیدواژه می‌زند و بافت کمک می‌کند. برای آرشیو می‌شود بدون بازبینی جلو رفت؛ برای زیرنویس نه.

واژگان دامنه - فهرست نام‌های تکرارشونده، اصطلاحات برنامه و نام مجریان که از قبل به مدل داده می‌شود. در یک برنامه ثابت، بخش بزرگی از خطاها روی همان چند نام تکراری‌اند و یک بار تعریف کردنشان کافی است.

در گفت‌وگوی مرتب خوب است و در صحبت هم‌زمان چند نفر سخت - و نتیجه‌اش نیاز به اصلاح دارد. برای برنامه‌های با ساختار ثابت می‌شود با معرفی گوینده‌های شناخته‌شده دقت را بالا برد.

خیر. پردازش روی زیرساخت خودتان انجام می‌شود، محتوا بیرون نمی‌رود و برای آموزش هیچ مدل بیرونی به کار نمی‌رود. اگر روی داده شما تنظیم دقیق انجام شود، مدل حاصل هم مال شماست.

دو معیار متفاوت برای دو کاربرد: برای آرشیو نرخ جست‌وجوی موفق - دقت واژه‌به‌واژه اینجا معیار درستی نیست. برای زیرنویس، زمان ویرایش هر دقیقه محتوا در برابر تولید دستی، که تنها معیار مستقیماً قابل ترجمه به صرفه‌جویی است.

از آرشیو نه زیرنویس. آستانه کیفیتش پایین‌تر است، ریسکش کمتر و ارزشش سریع‌تر دیده می‌شود. زیرنویس فاز دوم است، پس از اینکه واژگان دامنه تنظیم شد.

سایر قابلیت‌های پلتفرم مانوتل

صندوق چندکاناله

وب‌سایت، ایمیل، تلگرام، بله، ایتا، واتساپ و اینستاگرام در یک فهرست واحد؛ یک مشتری، یک پرونده.

معرفی کامل پلتفرم >

سیستم تیکتینگ با SLA

برای درخواست‌هایی که در یک نشست تمام نمی‌شوند: شناسه، مالک، وضعیت و مهلت - با محاسبه بر حسب ساعت کاری.

اطلاعات بیشتر >

چت آنلاین سایت

ابزارک زیر ۱۵ کیلوبایت با دستیار هوشمند ۲۴ ساعته، بدون اثر محسوس بر سرعت سایت.

اطلاعات بیشتر >

نصب روی سرور خودتان

نسخه On-Premise با هوش مصنوعی کامل و مدل زبانی محلی؛ داده از شبکه سازمان خارج نمی‌شود.

اطلاعات بیشتر >

جلسه شناخت رایگان، بدون تعهد

یک جلسه ۳۰ دقیقه‌ای رزرو کنید. اسناد خودتان را به دستیار می‌دهیم و همان جلسه نتیجه را می‌بینید.

شرکت سهامی
خاص
2016
تأسیس
+۵۰
متخصص هوش مصنوعی
+۱۲
محصول AI-Ready
+20
صنعت تخصصی
+10
سال تجربه
۰۲
مرکز توسعه
ISO 9001 & 27001
گواهینامه
AI-Native
معماری
Infosys
شریک تجاری
HCL Technologies
شریک تجاری
TCS
شریک تجاری