स्क्रिप्ट अंदर जाती है। एक तैयार एपिसोड बाहर आता है।
यह प्रत्येक सेगमेंट को आवाज़ देता है, उन्हें जोड़ता है, पूरी चीज़ को −16 LUFS पर लेवल करता है और एक टैग की गई MP3 को एनकोड करता है — फिर आपको बताता है कि उसने क्या मापा और ब्रीफ़ में ऐसा क्या माँगा गया था जो वह नहीं कर सका।
यह कैसे काम करता है
तीन चरण, और उनमें से कोई भी “कॉन्फ़िगर करना” नहीं है।
- 01
इसे एक स्क्रिप्ट, या अपनी रिकॉर्डिंग दें
एक स्क्रिप्ट जिसे यह बोल सकता है, या रॉ टेक जिन्हें आप बातचीत में डालते हैं। यह पहले प्रोडक्शन नोट्स पढ़ता है, क्योंकि लाउडनेस लक्ष्य और डिलीवरी फ़ॉर्मेट आमतौर पर वहीं होते हैं।
- 02
यह संपादन करने से पहले मापता है
लंबाई और लाउडनेस के लिए हर हिस्से की जाँच की जाती है, और सन्नाटे का अनुमान लगाने के बजाय उसे खोजा जाता है। वे संख्याएँ असेंबली को संचालित करती हैं — और वे यह भी जाँचती हैं कि संक्षिप्त विवरण अपने बारे में क्या दावे करता है।
- 03
आपको एपिसोड, नोट्स और आंकड़े मिलते हैं
वर्कस्पेस रूट पर एक टैग की गई MP3, उसके साथ शो नोट्स और चैप्टर टाइमस्टैम्प, और एक छोटी रिपोर्ट: यह क्या है, स्क्रिप्ट से क्या बदला है, और किस पर आपके ध्यान की आवश्यकता है।
यह क्या कर सकता है
यह लाउडनेस लक्ष्य को प्राप्त करता है और इसे साबित करता है
−16 LUFS पॉडकास्ट का मानक है और यह इसलिए मौजूद है क्योंकि रसोई में फोन के स्पीकर में अतिरिक्त डायनेमिक रेंज नहीं होती है। यह दो चरणों में नॉर्मलाइज़ करता है और प्रिंट करता है कि फ़ाइल ने पहले और बाद में क्या मापा, ताकि दावे की जाँच की जा सके।
यह बताता है कि यह क्या नहीं कर सका
नमूना संक्षिप्त विवरण संगीत की माँग करता है और कोई संगीत फ़ाइल नहीं है — इसलिए यह बिना किसी संगीत के एपिसोड तैयार करता है और नाम लेकर ऐसा बताता है। जो एजेंट चुपचाप किसी आवश्यकता को हटा देता है, उसने उसे छिपाया है, पूरा नहीं किया है।
यह ऑडियो के साथ संक्षिप्त विवरण की जाँच करता है
तीस सेकंड के रूप में बुक किया गया प्रायोजक स्लॉट जो बाईस सेकंड का निकलता है, वह एक वाक्य के लायक है। यही बात उस हिस्से पर भी लागू होती है जो किसी अन्य हिस्से को दोहराता है, या ऐसा आउट्रो जो किसी ऐसे अतिथि का वादा करता है जिसका नाम स्क्रिप्ट में कभी नहीं है।
इसे कैसे सेटअप किया गया है
यह कैसे काम करता है, ताकि साइन इन करने से पहले आपको पता हो कि आपको क्या मिल रहा है।
- एनवायरनमेंट
- ऑडियो कार्य ffmpeg वाले Mume सेवा पर चलता है, जिस तक MCP के ज़रिए पहुँचा जाता है। यह केवल एक सत्र की फ़ाइलें देखता है और कुछ नहीं — वह कौन सा वर्कस्पेस है, यह एक कम समय वाले टोकन से तय होता है, अनुरोध से कभी नहीं।
- टूल
- generateSpeech, transcribe, readFile, writeFile, editFile, glob, साथ ही आठ ऑडियो वर्ब: probe, detectSilence, trim, concat, mix, normalize, encode, importAudio। जानबूझकर कोई शेल नहीं दिया गया है — ऑडियो टूल नामित संचालन हैं, न कि ffmpeg कमांड लाइन।
- मॉडल
- कैटलॉग में मौजूद कोई भी चैट मॉडल। यहाँ निर्णय संपादकीय है — क्या काटना है, किसे फ़्लैग करना है, और ब्रीफ़ में वास्तव में क्या माँगा गया था।
- शुरुआती फ़ाइलें
- एक स्क्रिप्ट और आधे लिखे गए नोट्स के साथ शुरू किया गया, जिसमें पांच समस्याएँ शामिल हैं: गायब म्यूज़िक बैड, एक विज्ञापन पाठ जो उतनी अवधि का नहीं है जितना दावा किया गया है, एक दोहराया गया अनुभाग शीर्षक, एक अनाम अतिथि और प्राप्त करने के लिए एक लाउडनेस लक्ष्य।
- क्या सहेजा जाता है
- सेगमेंट, मध्यवर्ती फ़ाइलें और तैयार एपिसोड सत्र के साथ रहते हैं। वापस आएं और इसे फिर से कट करें, या एक नया प्रायोजक पाठ डालें और फिर से बनाएं।
लोग इससे जो पूछते हैं
- “स्क्रिप्ट से एपिसोड 1 तैयार करें, और मुझे बताएं कि आप क्या नहीं कर सके।”
- “क्या प्रायोजक का विवरण वास्तव में तीस सेकंड का है?”
- “सब कुछ −16 LUFS पर संतुलित करें और मुझे पहले और बाद का परिणाम दिखाएं।”
- “स्क्रिप्ट से नहीं, बल्कि तैयार फ़ाइल से अध्याय लिखें।”
यह क्या नहीं करेगा
इनमें से हर एक ऐसी वास्तविक बाधा है जिसका हमने सामना किया है, कोई योजना की सूची वाली चीज नहीं।
- यह संगीत नहीं बना सकता। यह बोलता है; यहाँ कोई वाद्य यंत्र नहीं है। बैकग्राउंड म्यूज़िक माँगने पर, यह कुछ बोलकर उसे संगीत बताने के बजाय यह कह देता है कि म्यूज़िक नहीं है।
- कोई शेल नहीं है। ऑडियो काम नाम वाले वर्ब के माध्यम से होता है, यही कारण है कि यह फ़िल्टर चेन नहीं बना सकता — और इसीलिए यह ऐसा कुछ नहीं कर सकता जो वर्ब में शामिल नहीं है।
- भाषण केवल भाषण है, प्रदर्शन नहीं। आवाज़ें साफ़ और एक समान रूप से पढ़ती हैं; वे किसी चरित्र का अभिनय नहीं करेंगी, और किसी एक के लिए लिखी गई स्क्रिप्ट ऐसी ही सुनाई देगी।
- यह उस संख्या का दावा नहीं करेगा जिसे उसने मापा नहीं है। यदि इसकी रिपोर्ट में कोई अवधि या लाउडनेस गायब है, तो ऐसा इसलिए है क्योंकि माप नहीं हुआ था, इसलिए नहीं कि वह ठीक था।
कौन सा मॉडल इसे सबसे बेहतर करता है
इस एजेंट के वास्तविक रन पर मापा गया, प्रति मॉडल। एक रन को तब समाप्त माना जाता है जब उसने अपने दम पर उत्तर दिया — कुछ भी विफल नहीं हुआ, किसी से कुछ भी स्वीकृत करने के लिए नहीं कहा गया, और इसके चरण समाप्त नहीं हुए। तीनों स्तंभों को एक साथ पढ़ें: एक मॉडल जो हार मानकर जल्दी समाप्त होता है, वह पहले पर खराब स्कोर करता है, और जो कड़ी मेहनत करके सब कुछ पूरा करता है, वह दूसरे पर खराब स्कोर करता है।
| मॉडल | पूरा होने की दर | मीडियन लागत | मीडियन समय | रन |
|---|---|---|---|---|
| claude-sonnet-5anthropic | 64% | $0.150 | 79से | 14 |
| claude-sonnet-4.6anthropic | 100% | $0.052 | 29से | 4 |
| kimi-k3moonshotai | 67% | $0.327 | 4मि 54से | 3 |
- पूरा होने की दर
- ऐसे रन जिन्होंने आपके बिना हस्तक्षेप किए काम पूरा कर दिया।
- मीडियन लागत
- एक सामान्य रन की लागत क्या है, क्रेडिट में।
- मीडियन समय
- कुल समय, पहले संदेश से लेकर उत्तर तक।
प्रत्येक पंक्ति के पीछे के रन का मध्यक। एक मॉडल तब दिखाई देता है जब उसके पास इस एजेंट पर 3 रन होते हैं, और रन की संख्या दिखाई जाती है ताकि आप आंक सकें कि कोई आंकड़ा किस पर आधारित है।
स्क्रिप्ट अंदर जाती है। एक तैयार एपिसोड बाहर आता है।
यह पहले से ही सेट है। इसे खोलें और इससे कुछ पूछें।
एक एपिसोड तैयार करें