كل القدرات الصورة والصوت والفيديو

تفريغ تسجيل مع تمييز من قال ماذا

تحويل الكلام إلى نص هو النصف السهل، والنصف المفيد نصٌّ يُنسب كل سطر فيه إلى متحدّث.

التوثيقموثّق رسميًاالاختبارلم يختبره benchr سريع · واجهة برمجية فُحص التوثيق 1 سبتمبر 2026
واجهة OpenAI البرمجية

نظرة عامة

  • يفرّغ بنموذج gpt-transcribe بوصفه التوصية العامة، مع بقاء whisper-1 ونماذج gpt-4o الأقدم موثّقة.
  • يفصل المتحدّثين بنموذج gpt-4o-transcribe-diarize الذي يعيد صيغة استجابة مخصّصة لذلك.
  • يعيد طوابع زمنية على مستوى الكلمة والمقطع في whisper-1، وهذا ما يجعل النص قابلًا للتنقّل.

كيف تعمل

  1. 01قسّم التسجيل قبل الرفع؛ الحد الموثّق خمسة وعشرون ميغابايت للملف، ويتجاوزه اجتماع طويل بسهولة.
  2. 02اختر بوعي: الفصل بين المتحدّثين والطوابع الزمنية على مستوى الكلمة موثّقان على نموذجين مختلفين، فاختر بحسب المخرج الذي تحتاجه.
  3. 03أبقِ الصوت في حاوية مدعومة: mp3 أو mp4 أو mpeg أو mpga أو m4a أو wav أو webm.
  4. 04مرّر النص إلى تمريرة ثانية للتلخيص أو استخراج المهام؛ فالتفريغ والفهم عملان منفصلان.

القيود

  • خمسة وعشرون ميغابايت للملف سقف صارم، والتقسيم مسؤوليتك، وحدود المقاطع قد تشطر جملة أو دور متحدّث.
  • دقة الطوابع الزمنية والفصل بين المتحدّثين ليسا في نموذج واحد، فلا يعطيك طلب واحد كليهما دائمًا.
  • تسميات المتحدّثين معرّفات لا هويات؛ النموذج يفصل الأصوات ولا يعرف أصحابها.

التحقق

تشغيلات اختبار benchr

لم يشغّل benchr هذه القدرة. ولم يُنشر أي اختبار.

تشغيلات اختبار benchr →

الأدلة

لم يذكره المصدر

  • معدّل خطأ الكلمات على صوت بلكنة أو مع ضوضاء
  • أقصى مدة صوتية بعد احترام حد حجم الملف
سجل الفحوص
  • 1 سبتمبر 2026التوثيقموثّق رسميًاأول تسجيل. أسماء النماذج وسقف 25 ميغابايت وقائمة الصيغ والنموذج الحامل للفصل بين المتحدثين مقروءة من الدليل.