गाइड

आपके Mac पर ट्रांसक्रिप्शन धीमा क्यों है

एक ही रिकॉर्डिंग एक ही ऐप चलाते हुए अलग-अलग Mac पर दो मिनट भी ले सकती है और चालीस भी। इस फ़र्क का लगभग पूरा हिसाब चार चीज़ें दे देती हैं।

लोकल ट्रांसक्रिप्शन की गति बहुत ज़्यादा बदलती है, और इसका आपके Mac के नएपन या उसकी क़ीमत से कोई सीधा अनुपात नहीं है। एक ही घंटे भर की रिकॉर्डिंग एक मशीन पर तीन मिनट ले सकती है और दूसरी पर आधा घंटा, वह भी एक ही ऐप से।

इसका लगभग पूरा हिसाब चार चीज़ों से बैठ जाता है।

1. Apple Silicon बनाम Intel #

यही सबसे बड़ी वजह है, और यह कोई छोटा फ़र्क नहीं है।

ट्रांसक्रिप्शन पर मैट्रिक्स गणित का दबदबा रहता है। Apple Silicon के पास दो चीज़ें हैं जो ख़ास तौर पर इसके मुताबिक़ हैं: ठीक उसी गणित के लिए बना एक Neural Engine, और यूनिफ़ाइड मेमोरी, जिसकी वजह से मॉडल के वेट को CPU और GPU की मेमोरी के बीच आगे-पीछे कॉपी नहीं करना पड़ता।

Intel Mac के पास इनमें से कुछ नहीं है। उसमें Neural Engine है ही नहीं, इसलिए एनकोडर — मॉडल का महँगा आधा हिस्सा — CPU पर या किसी बस के आर-पार बैठे अलग GPU पर आ जाता है। नतीजा अक्सर एक ही फ़ाइल पर कई गुना धीमा होता है।

अगर आप Intel Mac पर हैं, तो ट्रांसक्रिप्शन अब भी बिल्कुल काम लायक़ है; बस यह ऐसा काम है जिसे आप शुरू करके लौट आते हैं, बैठकर देखते नहीं। सॉफ़्टवेयर में कुछ भी उस खाई को नहीं पाटता, क्योंकि खाई सिलिकॉन की है।

2. ऐप Neural Engine इस्तेमाल करता भी है या नहीं #

एक ही M-सीरीज़ Mac पर दो ऐप में बड़ा अंतर हो सकता है, क्योंकि Neural Engine का इस्तेमाल अपने आप नहीं होता।

एनकोडर को वहाँ चलाने के लिए मॉडल को पहले से Core ML के फ़ॉर्मैट में कंपाइल करना पड़ता है। जो ऐप वेट के साथ Core ML एनकोडर भेजते हैं उन्हें तेज़ रास्ता मिलता है; जो नहीं भेजते वे सब कुछ GPU या CPU पर चलाते हैं और बहुत सारा प्रदर्शन अनछुआ छोड़ देते हैं।

बाहर से आप यह देख नहीं सकते, पर महसूस कर सकते हैं: अगर आपकी मशीन पर एक लोकल ट्रांसक्रिप्शन ऐप दूसरे से नाटकीय रूप से तेज़ है, तो आम तौर पर वजह यही है।

3. मॉडल का आकार #

Whisper के आकार हर पायदान पर पैरामीटर के लिहाज़ से मोटे तौर पर 3× बदलते हैं, और समय भी उसी हिसाब से बढ़ता है। Base से Large पर जाना क़रीब बीस गुना पैरामीटर है — लंबी फ़ाइल पर यह एक कॉफ़ी और पूरी दोपहर के बीच का फ़र्क है।

अगर कोई ऐप डिफ़ॉल्ट रूप से बड़ा मॉडल लेता है, या आपने कोई इसलिए चुना क्योंकि बड़ा सुनने में बेहतर लगा, तो अकेले यही इंतज़ार की वजह हो सकती है। सटीकता में फ़ायदा आकार के अंतर से कहीं कम है, और साफ़ बोली के लिए तो अक्सर पकड़ में ही नहीं आता।

4. आप कितनी ख़ामोशी ट्रांसक्राइब करने की क़ीमत चुका रहे हैं #

नब्बे मिनट की मीटिंग की दो घंटे की रिकॉर्डिंग में तीस मिनट कुछ भी नहीं होता। वॉइस एक्टिविटी डिटेक्शन के बिना मॉडल उस सबको प्रोसेस करता है — ख़ामोशी को डिकोड करना उतना ही महँगा पड़ता है जितना बोली को, और साथ में वह दोहराया हुआ कचरा टेक्स्ट भी बनाता जाता है।

जो ऐप पहले VAD चलाते हैं वे उन हिस्सों को पूरी तरह छोड़ देते हैं। जिन रिकॉर्डिंग में काफ़ी सन्नाटा हो, उनमें यह बचत मामूली नहीं होती।

असल में इसे तेज़ क्या करता है #

असर के क्रम में:

  1. छोटा मॉडल इस्तेमाल कीजिए। ज़्यादातर साफ़ बोली के लिए Base काफ़ी है, और यह Large से कई गुना तेज़ है।
  2. ऐसा ऐप इस्तेमाल कीजिए जिसमें Core ML एनकोडर हो, अगर आप Apple Silicon पर हैं।
  3. सन्नाटा काटिए, या ऐसा टूल इस्तेमाल कीजिए जो पहले बोली का पता लगाता हो।
  4. जो और कुछ मुक़ाबले में चल रहा हो उसे बंद कीजिए। ट्रांसक्रिप्शन जितने कोर मिल जाएँ सब इस्तेमाल करेगा। पृष्ठभूमि में चलता एक वीडियो एक्सपोर्ट आपकी रफ़्तार आधी कर देता है।
  5. लैपटॉप प्लग में लगाइए। बैटरी पर macOS लगातार चलने वाले काम को थ्रॉटल करता है; लो पावर मोड यह और भी सख़्ती से करता है।

इसे तेज़ क्या नहीं करता #

ज़्यादा RAM, जब तक कि आप स्वैप न कर रहे हों — वर्किंग सेट लोगों के अनुमान से छोटा है।

तेज़ इंटरनेट। लोकल ट्रांसक्रिप्शन में नेटवर्क वाला कोई चरण है ही नहीं। अगर आपकी गति आपके कनेक्शन पर निर्भर है, तो काम आपकी मशीन पर नहीं हो रहा।

उसे दोबारा शुरू करना। अगर कोई रन धीमा है, तो दोबारा शुरू करने पर वही काम शून्य से फिर से शुरू होता है।

एक मोटा अनुमान #

Base मॉडल और Core ML एनकोडर के साथ किसी Apple Silicon Mac पर ट्रांसक्रिप्शन वास्तविक समय से कई गुना तेज़ चलता है — घंटे भर की रिकॉर्डिंग चंद मिनटों में पूरी हो जाती है। दो घंटे की फ़ाइल पर हमारी अपनी माप शुरू से आख़िर तक तीन मिनट से कम रही।

Intel Mac पर उम्मीद रखिए कि यह रिकॉर्डिंग की लंबाई का एक ठीक-ठाक हिस्सा लेगा। फिर भी करने लायक़, फिर भी मुफ़्त, बस बैठकर देखने लायक़ नहीं।

अगर आप Apple Silicon पर इन दायरों से काफ़ी बाहर हैं, तो संभावित वजहें क्रम से ये हैं: बड़ा मॉडल, ऐसा ऐप जो Neural Engine इस्तेमाल नहीं करता, या मशीन के लिए मुक़ाबला करता बहुत सारा दूसरा काम।

संक्षेप में #

Apple Silicon बनाम Intel सबसे बड़ी वजह है और इसे आप सॉफ़्टवेयर में ठीक नहीं कर सकते। उसके बाद: छोटा मॉडल इस्तेमाल कीजिए, ऐसा ऐप इस्तेमाल कीजिए जो एनकोडर को Neural Engine के लिए कंपाइल करता हो, ख़ामोशी को ट्रांसक्राइब करने के बजाय छोड़ दीजिए, और इसे बैटरी पर वीडियो एक्सपोर्ट के साथ-साथ मत चलाइए।

Offline Transcription पाएं

ऑडियो और वीडियो को पूरी तरह अपने Mac पर ही ट्रांसक्राइब करें। कुछ भी अपलोड नहीं होता, कोई अकाउंट नहीं, और प्रति मिनट का कोई मीटर नहीं।

macOS 13.0 or higher · iOS 16.4 or higher