پرش به محتوا
منو
داده‌نوشت
فناوری، زیرساخت و هوش مصنوعی
هوش مصنوعی

GPT Transcribe؛ دو مسیر برای رونویسی فایل و گفت‌وگوی زنده

یادداشت انتشار OpenAI در ۲۸ ژوئیه ۲۰۲۶ دو مدل صوتی را به API اضافه کرد: GPT Transcribe برای فایل و transcript نهایی، و GPT Live Transcribe برای رونویسی جریانی با تأخیر پایین. تفاوت آن‌ها در یک نام‌گذاری ساده خلاصه نمی‌شود. یکی برای پردازش یک ورودی کامل و قابل

انتشار: ۶ مرداد ۱۴۰۵به‌روزرسانی: ۲۶ مرداد ۱۴۰۵3 دقیقه
کاور جایگزین داده‌نوشت برای GPT Transcribe؛ دو مسیر برای رونویسی فایل و گفت‌وگوی زنده
کاور جایگزین تولیدشده داده‌نوشت؛ منبع رسمی بدون تصویر مناسب

GPT Transcribe؛ دو مسیر برای رونویسی فایل و گفت‌وگوی زنده

یادداشت انتشار OpenAI در ۲۸ ژوئیه ۲۰۲۶ دو مدل صوتی را به API اضافه کرد: GPT Transcribe برای فایل و transcript نهایی، و GPT Live Transcribe برای رونویسی جریانی با تأخیر پایین. تفاوت آن‌ها در یک نام‌گذاری ساده خلاصه نمی‌شود. یکی برای پردازش یک ورودی کامل و قابل بازبینی ساخته شده و دیگری باید در حین مکالمه، متن موقت و قابل به‌روزرسانی تولید کند.

#فایل در برابر جریان

در رونویسی فایل، برنامه می‌تواند تمام audio را دریافت کند، قطعه‌بندی انجام دهد و بعد transcript نهایی را ذخیره کند. این مسیر برای جلسه، پادکست، تماس ضبط‌شده و آرشیو مناسب است. امکان replay و اصلاح زمان‌بندی وجود دارد و تیم می‌تواند نسخه مدل، زبان و context را همراه فایل نگه دارد.

در streaming، کاربر منتظر پایان فایل نیست. متن باید هم‌زمان با صدا ظاهر شود و با رسیدن اطلاعات تازه اصلاح شود. این رفتار برای زیرنویس، دستیار جلسه و رابط صوتی مفید است؛ اما مصرف‌کننده باید بین partial transcript و متن commit‌شده تفاوت بگذارد. اگر برنامه همان متن موقت را به سیستم downstream بفرستد، اصلاح بعدی ممکن است state را خراب کند.

#context و واژه‌های تخصصی

هر دو مدل free-form transcription context، keyword hint و چند زبان ورودی مورد انتظار را پشتیبانی می‌کنند. context به سیستم کمک می‌کند نام محصول، اصطلاح پزشکی یا واژه تخصصی را بهتر تشخیص دهد. این قابلیت جای فرهنگ لغت سازمانی یا بازبینی انسان را نمی‌گیرد؛ context نادرست می‌تواند مدل را به سمت واژه‌ای مشابه اما غلط هل دهد.

برای تیمی که جلسه‌های فارسی و انگلیسی را ترکیب می‌کند، آزمون باید روی code-switching، نام افراد، اعداد و نشانی‌ها انجام شود. درصد خطای کلمه به تنهایی کافی نیست. حذف یک «نه»، اشتباه در مبلغ یا جابه‌جایی نام مشتری ممکن است از ده‌ها واژه غلط مهم‌تر باشد. ذخیره timestamp و confidence نیز برای اصلاح بعدی ارزش دارد.

#API و حریم خصوصی

توسعه‌دهنده باید وضعیت پردازش، retry، قطع جریان و نگهداری audio را مشخص کند. صوت جلسه ممکن است شامل داده شخصی یا محرمانه باشد؛ رضایت، محدودیت دسترسی و دوره حذف باید قبل از اتصال API تعیین شود. رونویسی دقیق‌تر نباید بهانه‌ای برای نگهداری بی‌پایان فایل اصلی باشد.

GPT Transcribe و GPT Live Transcribe لایه تبدیل صوت به متن را ساده‌تر می‌کنند. موفقیت محصول بعد از API اتفاق می‌افتد: تشخیص نوبت گوینده، اصلاح متن، اتصال به workflow و نمایش روشن اینکه کدام بخش قطعی و کدام بخش موقت است.

برای جلسه‌های حساس، transcript نباید تنها منبع تصمیم باشد. فایل صوتی اصلی، زمان هر بخش و هویت احتمالی گوینده باید طبق سیاست سازمان نگه‌داری یا حذف شود. یک خطای کوچک در تشخیص «قبول» و «قابل» می‌تواند نتیجه رأی‌گیری یا دستور اجرایی را عوض کند؛ به همین دلیل نمونه‌های پرریسک به بازبینی نیاز دارند.

مطالب مرتبط

برای ادامه مطالعه

این یادداشت‌ها بر اساس موضوع مشترک، هم‌پوشانی برچسب‌ها و تازگی انتشار انتخاب می‌شوند.

تصویر رسمی OpenAI برای GPT-۵.۶ ارزان‌تر شد؛ Fast Mode برای کدام بار کاری است؟
هوش مصنوعی

GPT-۵.۶ ارزان‌تر شد؛ Fast Mode برای کدام بار کاری است؟

اعلامیه ۳۰ ژوئیه ۲۰۲۶ OpenAI دو تغییر جداگانه را کنار هم گذاشت: قیمت Terra و Luna پایین آمد و Fast Mode در API جای Priority Processing را گرفت. این خبر درباره عرضه مدل تازه نیست؛ درباره اقتصادی‌تر شدن استفاده مستمر از خانواده GPT-۵.۶ و ایجاد مسیر سریع‌تر برای

۸ مرداد ۱۴۰۵3 دقیقه
تصویر رسمی OpenAI برای Health در ChatGPT؛ اتصال داده سلامت با مرز روشن میان کمک و درمان
هوش مصنوعی

Health در ChatGPT؛ اتصال داده سلامت با مرز روشن میان کمک و درمان

OpenAI در ۲۳ ژوئیه ۲۰۲۶ گسترش Health در ChatGPT را برای کاربران واجد شرایط آمریکا آغاز کرد. کاربران Free، Go، Plus و Pro که وارد حساب شده‌اند و ۱۸ سال یا بیشتر دارند، می‌توانند در وب و iOS داده‌های پشتیبانی‌شده health records و Apple Health را به‌صورت امن متصل

۱ مرداد ۱۴۰۵3 دقیقه
تصویر رسمی OpenAI برای سیستم‌کارت GPT‑۵.۶؛ رشد توان عاملی و آزمون‌های سخت‌تر ایمنی
هوش مصنوعی

سیستم‌کارت GPT‑۵.۶؛ رشد توان عاملی و آزمون‌های سخت‌تر ایمنی

سیستم‌کارت GPT‑۵.۶ که OpenAI در ۹ ژوئیه ۲۰۲۶ منتشر کرد، به‌جای تمرکز صرف بر امتیاز benchmark، مسیر ریسک مدل را تا محیط اجرا دنبال می‌کند. GPT‑۵.۶ خانواده‌ای از Sol، Terra و Luna است و در ارزیابی‌های OpenAI در امنیت سایبری و زیست‌شناسی در سطح High capability قر

۱۸ تیر ۱۴۰۵3 دقیقه