أوبن أيه آي تطلق أداة GPT Transcribe للتحويل الصوتي

أطلقت أوبن أيه آي نموذجين جديدين للتعرف على الكلام: GPT Transcribe للملفات الصوتية المسجلة وGPT Live Transcribe للبث المباشر منخفض التأخير. يعالج النموذج الأول الصوت أسرع بـ34 مرة من الزمن الحقيقي، ويخفض معدل الخطأ إلى 3.31% بتحسن 0.7 نقطة عن سلفه، مع تخفيض السعر 25% ليبلغ 0.0045 دولار للدقيقة. ورغم التحسن، تتقدم إليفن لابز وجوجل وميسترال في دقة التفريغ الصوتي، وتتفوق ميسترال بأسعار تبدأ من 0.003 دولار للدقيقة.
الحقائق الأساسية
أوبن أيه آي أطلقت نموذجين للتفريغ الصوتي، يعالج أحدهما الصوت أسرع بـ34 مرة من الزمن الحقيقي
«GPT Transcribe handles pre-recorded audio files, processing them about 34 times faster than real time.»
عرض المصدر ←معدل الخطأ 3.31% بتحسن 0.7 نقطة عن النسخة السابقة، مع خفض السعر 25% إلى 0.0045 دولار للدقيقة
«GPT Transcribe hits a word error rate of 3.31 percent. That's a 0.7 percentage point improvement over its year-old predecessor GPT-4o Transcribe. Pricing drops 25 percent at the same time, landing at $0.0045 per minute of audio.»
عرض المصدر ←إليفن لابز تتقدم الترتيب بمعدل خطأ 2.3%، تليها جوجل 2.9% ثم ميسترال 3%، بينما تتفوق ميسترال بالسعر الأقل 0.003 دولار للدقيقة
«ElevenLabs Scribe v2 leads with a 2.3 percent error rate, followed by Google's Gemini 3 Pro at 2.9 percent and Mistral's Voxtral Small at 3 percent. Mistral recently undercut the market with Voxtral Transcribe V2, starting at just $0.003 per minute.»
عرض المصدر ←
المصادر
شفت معلومة تحتاج تصحيح؟ بلّغنا ونتحقق ونصحّح — سياسة التصحيح
صحّح هذا الخبر