زیرنویس و آرشیو جستوجوپذیر - وقتی خروجی قرار است منتشر شود
تبدیل گفتار به متن در رسانه دو کاربرد دارد که معمولاً با هم اشتباه گرفته میشوند: زیرنویس و جستوجوپذیر کردن آرشیو. از نظر فنی یک فناوریاند و از نظر آستانه کیفیت، دو دنیای متفاوت - چون یکی منتشر میشود و دیگری نه.
در این صفحه
دو کاربرد، دو آستانه کیفیت
در گفتوگوی پشتیبانی، خطای تشخیص گفتار حداکثر باعث یک پرسش دوباره میشود. در رسانه بستگی دارد به اینکه خروجی کجا میرود:
آرشیو - مصرف داخلی
هدف این است که تدوینگر بتواند صحنه یا نقلقولی را پیدا کند. اگر چند واژه اشتباه خوانده شوند، جستوجو همچنان کار میکند - چون کاربر معمولاً چند کلمه کلیدی میزند و بافت جمله کمکش میکند.
زیرنویس - انتشار عمومی
اینجا خروجی دیده میشود. یک واژه اشتباه در زیرنویس، خطای قابل مشاهده رسانه است - بهخصوص در نامها، اعداد و اصطلاحات تخصصی که دقیقاً همانهایی هستند که مدل بیشتر اشتباه میکند.
آرشیو: نقص قابل تحمل است
برای آرشیو، هدف پوشش است نه کمال. رویه عملی:
- پردازش دستهای کل آرشیو، بدون بازبینی
- نمایهسازی متن با زمانبندی، تا جستوجو مستقیم به لحظه ببرد
- جستوجوی معنایی علاوه بر کلیدواژهای، تا واژه اشتباهخواندهشده کل نتیجه را از دست ندهد
و یک قابلیت که ارزشش دیر معلوم میشود: وقتی آرشیو متن دارد، میشود پرسید «کجا درباره فلان موضوع صحبت شده» - چیزی که قبلاً حتی قابل تصور نبود.
زیرنویس: خروجی منتشر میشود
برای زیرنویس، خروجی مدل پیشنویس است. آنچه واقعاً زمان ویراستار را کم میکند اینهاست:
- زمانبندی درست - اگر زمانبندی دقیق باشد، ویراستار فقط متن را اصلاح میکند نه جای آن را
- علامتگذاری موارد کماطمینان - تا ویراستار بداند کجا را با دقت بیشتری بررسی کند
- واژگان دامنه - نامهای تکرارشونده، اصطلاحات برنامه و نام مجریان، از قبل به مدل داده شوند
نکته آخر بیشترین اثر را دارد. در یک برنامه ثابت، بخش بزرگی از خطاها روی همان چند نام تکراریاند - و همانها را میشود یک بار تعریف کرد.
نمونهای از آرشیو خودتان را آزمایش کنیم؟
با فایلهای واقعی خودتان آزمایش میکنیم - استودیویی و میدانی هر دو - تا تفاوت را ببینید.
زمانبندی و تفکیک گوینده
دو قابلیت که در رسانه بیش از هر جای دیگری اهمیت دارند:
زمانبندی در سطح واژه
زیرنویس باید با گفتار همزمان باشد. زمانبندی در سطح جمله برای آرشیو کافی است، برای زیرنویس نه.
تفکیک گوینده
در گفتوگو و میزگرد، دانستن اینکه چه کسی چه گفت هم برای زیرنویس لازم است و هم برای جستوجوی آرشیو ارزشمند. و صادقانه: در صحبت همزمان چند نفر، این کار سخت است و نتیجهاش نیاز به اصلاح دارد.
برای برنامههای با ساختار ثابت - مجری مشخص و مهمان - میشود دقت را با معرفی گویندههای شناختهشده بالا برد.
گردشکار
۱. تفکیک مسیر آرشیو از مسیر زیرنویس
دو صف با اولویت و آستانه متفاوت.
۲. پیشپردازش صدا
جداسازی گفتار از موسیقی و نویز پسزمینه، که در محتوای رسانهای همیشه هست.
۳. تبدیل با واژگان دامنه
فهرست نامها و اصطلاحات همان برنامه یا همان حوزه.
۴. مسیر آرشیو: نمایهسازی مستقیم
بدون بازبینی، با جستوجوی معنایی.
۵. مسیر زیرنویس: میز ویراستار
با علامتگذاری موارد کماطمینان و زمانبندی آماده.
مالکیت محتوا
در رسانه، آرشیو دارایی اصلی است. سه تعهدی که باید در قرارداد باشد نه در گفتوگو:
- پردازش روی زیرساخت خودتان؛ محتوا بیرون نمیرود
- آرشیو برای آموزش هیچ مدل بیرونی استفاده نمیشود
- اگر روی داده شما تنظیم دقیق انجام شود، مدل حاصل مال شماست و همانجا میماند
اینها را در صفحه راهکارهای رسانه هم آوردهایم، چون رایجترین پرسش این صنعتاند.
سنجش و نقطه شروع
برای آرشیو: نرخ جستوجوی موفق - چه سهمی از جستوجوها به نتیجه مفید رسید. دقت واژهبهواژه اینجا معیار درستی نیست.
برای زیرنویس: زمان ویرایش هر دقیقه محتوا در برابر تولید دستی. این تنها معیاری است که مستقیم به صرفهجویی ترجمه میشود.
پیشنهاد ما شروع با آرشیو است نه زیرنویس: آستانهاش پایینتر، ریسکش کمتر و ارزشش سریعتر دیده میشود. زیرنویس فاز دوم است، پس از تنظیم واژگان دامنه.
جزئیات پلتفرم در صفحه دستیار صوتی است.
پرسشهای متداول
توصیه نمیکنیم. زیرنویس دیده میشود و یک واژه اشتباه، خطای قابل مشاهده رسانه است - بهخصوص در نامها، اعداد و اصطلاحات تخصصی که دقیقاً همانهایی هستند که مدل بیشتر اشتباه میکند. خروجی پیشنویس است و به میز ویراستار میرود.
آرشیو مصرف داخلی دارد و هدفش پیدا شدن است. اگر چند واژه اشتباه خوانده شوند، جستوجو همچنان کار میکند چون کاربر چند کلیدواژه میزند و بافت کمک میکند. برای آرشیو میشود بدون بازبینی جلو رفت؛ برای زیرنویس نه.
واژگان دامنه - فهرست نامهای تکرارشونده، اصطلاحات برنامه و نام مجریان که از قبل به مدل داده میشود. در یک برنامه ثابت، بخش بزرگی از خطاها روی همان چند نام تکراریاند و یک بار تعریف کردنشان کافی است.
در گفتوگوی مرتب خوب است و در صحبت همزمان چند نفر سخت - و نتیجهاش نیاز به اصلاح دارد. برای برنامههای با ساختار ثابت میشود با معرفی گویندههای شناختهشده دقت را بالا برد.
خیر. پردازش روی زیرساخت خودتان انجام میشود، محتوا بیرون نمیرود و برای آموزش هیچ مدل بیرونی به کار نمیرود. اگر روی داده شما تنظیم دقیق انجام شود، مدل حاصل هم مال شماست.
دو معیار متفاوت برای دو کاربرد: برای آرشیو نرخ جستوجوی موفق - دقت واژهبهواژه اینجا معیار درستی نیست. برای زیرنویس، زمان ویرایش هر دقیقه محتوا در برابر تولید دستی، که تنها معیار مستقیماً قابل ترجمه به صرفهجویی است.
از آرشیو نه زیرنویس. آستانه کیفیتش پایینتر است، ریسکش کمتر و ارزشش سریعتر دیده میشود. زیرنویس فاز دوم است، پس از اینکه واژگان دامنه تنظیم شد.





