Makale
Transkripsiyon İçin Sesi Yavaşlatma
Hızlı konuşanlar, tanıdık olmayan aksanlar ve birbiriyle örtüşen birden fazla ses, transkripsiyonun durduğu üç ana nedendir. Kaydı yavaşlatmak, söyleneni yakalamak için zaman kazandırır. Sorun şu ki saf oynatma hızını düşürmek her sesin perdesini de düşürür; bu da konuşmayı daha kolay değil daha zor takip edilir hale getirir. Bu makale, basit hız düşürme ile perde koruyucu zaman esnetme arasındaki farkı açıklar ve gerçekten yardımcı olan pratik aralıkları ele alır.
Yavaşlatmak Neden Yardımcı Olur
İnsan konuşması kısa bir pencerede çok fazla bilgi taşır. Hızlı bir konuşmacı dakikada 200 veya daha fazla kelime söyleyebilir; bu hızda bir sonraki hece gelmeden önce kulağın bireysel fonemleri çözmek için çok az zamanı olur. Sesi yavaşlatmak beyine her hece başına daha fazla işleme süresi sağlar; bu durum üç durumda en çok önem taşır: beklentinizden farklı fonem eşlemesine sahip tanıdık olmayan aksanlı konuşmacı; her kelimenin anlam taşıdığı ve tek bir yanlış duyuşun yanlış terim ürettiği yoğun teknik bir pasaj; ve kulağın aynı anda birden fazla akışı izlemesi gereken iki veya daha fazla örtüşen sesli kayıt. Her üç durumda da amaç, kaydedilmemiş bir şey duymak değil, halihazırda kaydedilmiş olanı doğru şekilde duymak için kendinize yeterli zaman vermektir. Bir aksanı veya yoğun bir pasajı çözmek için 0.75x oynatma hızı genellikle yeterlidir. 0.5x hız, ilk birkaç geçişin sözcükleri çözmediği kısa bir bölüm için kullanışlıdır.

Hız ve Perde: Saf Yavaşlatma Neden İşe Yaramaz
Sesi yavaşlatmanın en basit yolu, örnekleri kaydedildiklerinden daha düşük bir hızda oynatmaktır. Eski teyp kaydediciler böyle yavaşlardı: bandı daha yavaş çevirin, hem süre hem de perde birlikte düşer. 0.75x'te sesler yaklaşık bir minör üçlü kadar düşer. 0.5x'te tam bir oktav düşerler. Sonuç, konuşmayı doğal olmayan kılan ve paradoks biçimde ünlüleri birbirinden ayıran formant frekanslarının tümü aşağı kaydığından anlamayı güçleştiren tanıdık yavaş, derin bozulmadır. Doğru yaklaşım zaman esnetmedir: frekansları değiştirmeden sesin süresini değiştirmek. Her sesin perdesi aynı kalır; yalnızca hecelerin gelme hızı değişir. Bu, audio-speed aracının ve çoğu özel transkripsiyon yazılımının kullandığı yaklaşımdır. Algısal sonuç, yavaşlatılmış bir kaydın daha yavaş konuşan aynı konuşmacı gibi duyulmasıdır; bu tam da amaç doğru transkripsiyon yapmak olduğunda ihtiyaç duyduğunuz şeydir.
Zaman Esnetme Nasıl Çalışır: atempo Yaklaşımı
Pratik ses araçlarında zaman esnetme için en yaygın kullanılan algoritma, faz vokoderini esas alır ve ffmpeg'deki yaygın uygulaması atempo filtresidir. Giriş sesi, tipik olarak her biri 20 ila 40 milisaniye olan kısa örtüşen çerçevelere bölünür. Algoritma, bitişik çerçeveler arasındaki faz ilişkilerini analiz eder, ardından art arda gelen çerçevelerin düzgün biçimde hizalanması için fazları ayarlarken değiştirilmiş bir hızda yeni çerçeveler sentezler. Sonuç, süresi değişmiş ama frekans içeriği değişmemiş sürekli bir çıktı sinyalidir. Çerçeveler bir insan sesinin tipik perde periyoduna göre kısa olduğundan, konuşmanın temel frekansı esnetme boyunca korunur. Algoritmanın bir yan etkisi, üst üste bindirme sentezi küçük bir ortalama miktarı getirdiğinden, esnetme büyük olduğunda bir ünsüzün tıklaması gibi hızlı geçişlerin hafifçe bulanıklaşabilmesidir. Bu, uygulamadaki bir kusur değildir; örtüşme-ekleme algoritmaları ailesinin doğasında var olan bir özelliktir.

Pratik Hız Aralıkları ve Kalite Sınırları
Transkripsiyon çalışması için iki hız değeri pratik ihtiyaçların çoğunu karşılar. 0.75x'te konuşma, orijinal süresinin yüzde 133'üne uzatılır. Ünsüz kümeleri ve hızlı ünlü geçişleri daha kolay ayrılır ve değişim, algoritmanın fark edilir artefakt getirmeyecek kadar küçüktür. Çoğu dinleyici, cümlenin doğal ritmini kaybetmeden bu hızda konuşmayı takip edebilir. 0.5x'te ses, orijinal uzunluğunun iki katına uzatılır. Bu, tek bir cümle veya kısa ve zor bir pasaj için kullanışlıdır; ancak birkaç dakika boyunca sürekli dinlemek için çok yavaştır; kelimeler çözülmeden önce konsantrasyon düşer. 0.5x'in altında, çıktının kalitesi belirgin biçimde bozulur. Örtüşme-ekleme sentezi, uzun ünlüler üzerinde titreme veya faz kayması getirmeye başlar ve prozidiyi taşıyan ünsüzler ile ünlüler arasındaki zamanlama ipuçları bozulur. ffmpeg'deki atempo filtresi, tek geçiş için 0.5x minimumu uygular; bu, kalite sınırını yansıtır. 0.5x'in altındaki değerler için iki geçişin zincirlenmesi gerekir ve artefakt düzeyi buna göre yükselir. Neredeyse tüm transkripsiyon kullanım durumları için 0.75x'te veya kısa bölümler için en fazla 0.5x'te kalmak temiz, kullanılabilir çıktı üretir.
audio-speed Aracıyla Yerel Olarak Yapma
Bu sitedeki audio-speed aracı, WebAssembly'ye derlenen ffmpeg'i kullanarak tamamen tarayıcıda çalışır. Ses dosyanızı sayfaya bırakırsınız, hız çarpanını ayarlarsınız ve işleme cihazınızda gerçekleşir. Kayıt hiçbir noktada makinenizi terk etmez: yükleme yok, sunucu yok, üçüncü taraf hizmet yok. Bu durum, ses içeriğinin hassas olduğu kayıtlı konuşmalar, röportajlar, tıbbi dikte, hukuki işlemler ve diğer bağlamlar için geçerlidir. Araç, MP3, WAV, M4A, OGG ve FLAC dahil ffmpeg tarafından desteklenen yaygın ses formatlarını kabul eder. Çıktı, seçtiğiniz hızda indirilebilir bir dosyadır. İşleme yerel olarak çalıştığından gereken süre dosyanın uzunluğuna ve cihazınızın hızına bağlıdır. Modern bir dizüstü bilgisayarda birkaç dakikalık ses genellikle bir dakikanın çok altında işlenir. Araç, bu makalede açıklanan atempo filtresinin aynısını kullanır; dolayısıyla yukarıda açıklanan kalite özellikleri, çıktıda duyacaklarınız için doğrudan geçerlidir.
Bu makaledeki araçlar
Sıkça sorulan sorular
Sesi yavaşlatmak perdeyi de değiştirir mi?
Bu, yönteme bağlıdır. Basit oynatma hızı düşürmesi perdeyi gerçekten değiştirir: 0.5x'te sesler tam bir oktav düşer. audio-speed aracı, perde değiştirmeden süreyi değiştiren zaman esnetme (atempo filtresi) kullanır; bu yüzden sesler orijinal frekanslarında kalır.
Temiz duyulan en yavaş hız nedir?
0.75x'te çıktı çoğu kayıt için temizdir. 0.5x'te kısa pasajlar için kabul edilebilirdir. 0.5x'in altında, örtüşme-ekleme algoritması uzun ünlüler ve ünsüz geçişleri üzerinde duyulabilir artefaktlar getirmeye başlar. Transkripsiyon çalışması için 0.5x'te veya üzerinde kalmak en iyi sonuçları verir.
audio-speed aracını kullandığımda dosya yükleniyor mu?
Hayır. audio-speed aracı tamamen tarayıcıda çalışır. Dosya, WebAssembly kullanılarak cihazınızda yerel olarak işlenir. Hiçbir sunucuya hiçbir şey gönderilmez; dolayısıyla kaydınızın içeriği gizli kalır.