एजेंट

स्क्रिप्ट अंदर जाती है। एक तैयार एपिसोड बाहर आता है।

यह प्रत्येक सेगमेंट को आवाज़ देता है, उन्हें जोड़ता है, पूरी चीज़ को −16 LUFS पर लेवल करता है और एक टैग की गई MP3 को एनकोड करता है — फिर आपको बताता है कि उसने क्या मापा और ब्रीफ़ में ऐसा क्या माँगा गया था जो वह नहीं कर सका।

एक एपिसोड तैयार करेंआज़माने के लिए मुफ़्त। कुछ भी इंस्टॉल करने की ज़रूरत नहीं।

यह कैसे काम करता है

तीन चरण, और उनमें से कोई भी “कॉन्फ़िगर करना” नहीं है।

  1. 01

    इसे एक स्क्रिप्ट, या अपनी रिकॉर्डिंग दें

    एक स्क्रिप्ट जिसे यह बोल सकता है, या रॉ टेक जिन्हें आप बातचीत में डालते हैं। यह पहले प्रोडक्शन नोट्स पढ़ता है, क्योंकि लाउडनेस लक्ष्य और डिलीवरी फ़ॉर्मेट आमतौर पर वहीं होते हैं।

  2. 02

    यह संपादन करने से पहले मापता है

    लंबाई और लाउडनेस के लिए हर हिस्से की जाँच की जाती है, और सन्नाटे का अनुमान लगाने के बजाय उसे खोजा जाता है। वे संख्याएँ असेंबली को संचालित करती हैं — और वे यह भी जाँचती हैं कि संक्षिप्त विवरण अपने बारे में क्या दावे करता है।

  3. 03

    आपको एपिसोड, नोट्स और आंकड़े मिलते हैं

    वर्कस्पेस रूट पर एक टैग की गई MP3, उसके साथ शो नोट्स और चैप्टर टाइमस्टैम्प, और एक छोटी रिपोर्ट: यह क्या है, स्क्रिप्ट से क्या बदला है, और किस पर आपके ध्यान की आवश्यकता है।

यह क्या कर सकता है

  • यह लाउडनेस लक्ष्य को प्राप्त करता है और इसे साबित करता है

    −16 LUFS पॉडकास्ट का मानक है और यह इसलिए मौजूद है क्योंकि रसोई में फोन के स्पीकर में अतिरिक्त डायनेमिक रेंज नहीं होती है। यह दो चरणों में नॉर्मलाइज़ करता है और प्रिंट करता है कि फ़ाइल ने पहले और बाद में क्या मापा, ताकि दावे की जाँच की जा सके।

  • यह बताता है कि यह क्या नहीं कर सका

    नमूना संक्षिप्त विवरण संगीत की माँग करता है और कोई संगीत फ़ाइल नहीं है — इसलिए यह बिना किसी संगीत के एपिसोड तैयार करता है और नाम लेकर ऐसा बताता है। जो एजेंट चुपचाप किसी आवश्यकता को हटा देता है, उसने उसे छिपाया है, पूरा नहीं किया है।

  • यह ऑडियो के साथ संक्षिप्त विवरण की जाँच करता है

    तीस सेकंड के रूप में बुक किया गया प्रायोजक स्लॉट जो बाईस सेकंड का निकलता है, वह एक वाक्य के लायक है। यही बात उस हिस्से पर भी लागू होती है जो किसी अन्य हिस्से को दोहराता है, या ऐसा आउट्रो जो किसी ऐसे अतिथि का वादा करता है जिसका नाम स्क्रिप्ट में कभी नहीं है।

इसे कैसे सेटअप किया गया है

यह कैसे काम करता है, ताकि साइन इन करने से पहले आपको पता हो कि आपको क्या मिल रहा है।

एनवायरनमेंट
ऑडियो कार्य ffmpeg वाले Mume सेवा पर चलता है, जिस तक MCP के ज़रिए पहुँचा जाता है। यह केवल एक सत्र की फ़ाइलें देखता है और कुछ नहीं — वह कौन सा वर्कस्पेस है, यह एक कम समय वाले टोकन से तय होता है, अनुरोध से कभी नहीं।
टूल
generateSpeech, transcribe, readFile, writeFile, editFile, glob, साथ ही आठ ऑडियो वर्ब: probe, detectSilence, trim, concat, mix, normalize, encode, importAudio। जानबूझकर कोई शेल नहीं दिया गया है — ऑडियो टूल नामित संचालन हैं, न कि ffmpeg कमांड लाइन।
मॉडल
कैटलॉग में मौजूद कोई भी चैट मॉडल। यहाँ निर्णय संपादकीय है — क्या काटना है, किसे फ़्लैग करना है, और ब्रीफ़ में वास्तव में क्या माँगा गया था।
शुरुआती फ़ाइलें
एक स्क्रिप्ट और आधे लिखे गए नोट्स के साथ शुरू किया गया, जिसमें पांच समस्याएँ शामिल हैं: गायब म्यूज़िक बैड, एक विज्ञापन पाठ जो उतनी अवधि का नहीं है जितना दावा किया गया है, एक दोहराया गया अनुभाग शीर्षक, एक अनाम अतिथि और प्राप्त करने के लिए एक लाउडनेस लक्ष्य।
क्या सहेजा जाता है
सेगमेंट, मध्यवर्ती फ़ाइलें और तैयार एपिसोड सत्र के साथ रहते हैं। वापस आएं और इसे फिर से कट करें, या एक नया प्रायोजक पाठ डालें और फिर से बनाएं।

लोग इससे जो पूछते हैं

  • स्क्रिप्ट से एपिसोड 1 तैयार करें, और मुझे बताएं कि आप क्या नहीं कर सके।
  • क्या प्रायोजक का विवरण वास्तव में तीस सेकंड का है?
  • सब कुछ −16 LUFS पर संतुलित करें और मुझे पहले और बाद का परिणाम दिखाएं।
  • स्क्रिप्ट से नहीं, बल्कि तैयार फ़ाइल से अध्याय लिखें।

यह क्या नहीं करेगा

इनमें से हर एक ऐसी वास्तविक बाधा है जिसका हमने सामना किया है, कोई योजना की सूची वाली चीज नहीं।

  • यह संगीत नहीं बना सकता। यह बोलता है; यहाँ कोई वाद्य यंत्र नहीं है। बैकग्राउंड म्यूज़िक माँगने पर, यह कुछ बोलकर उसे संगीत बताने के बजाय यह कह देता है कि म्यूज़िक नहीं है।
  • कोई शेल नहीं है। ऑडियो काम नाम वाले वर्ब के माध्यम से होता है, यही कारण है कि यह फ़िल्टर चेन नहीं बना सकता — और इसीलिए यह ऐसा कुछ नहीं कर सकता जो वर्ब में शामिल नहीं है।
  • भाषण केवल भाषण है, प्रदर्शन नहीं। आवाज़ें साफ़ और एक समान रूप से पढ़ती हैं; वे किसी चरित्र का अभिनय नहीं करेंगी, और किसी एक के लिए लिखी गई स्क्रिप्ट ऐसी ही सुनाई देगी।
  • यह उस संख्या का दावा नहीं करेगा जिसे उसने मापा नहीं है। यदि इसकी रिपोर्ट में कोई अवधि या लाउडनेस गायब है, तो ऐसा इसलिए है क्योंकि माप नहीं हुआ था, इसलिए नहीं कि वह ठीक था।

कौन सा मॉडल इसे सबसे बेहतर करता है

इस एजेंट के वास्तविक रन पर मापा गया, प्रति मॉडल। एक रन को तब समाप्त माना जाता है जब उसने अपने दम पर उत्तर दिया — कुछ भी विफल नहीं हुआ, किसी से कुछ भी स्वीकृत करने के लिए नहीं कहा गया, और इसके चरण समाप्त नहीं हुए। तीनों स्तंभों को एक साथ पढ़ें: एक मॉडल जो हार मानकर जल्दी समाप्त होता है, वह पहले पर खराब स्कोर करता है, और जो कड़ी मेहनत करके सब कुछ पूरा करता है, वह दूसरे पर खराब स्कोर करता है।

मॉडलपूरा होने की दरमीडियन लागतमीडियन समयरन
claude-sonnet-5anthropic64%$0.15079से14
claude-sonnet-4.6anthropic100%$0.05229से4
kimi-k3moonshotai67%$0.3274मि 54से3
पूरा होने की दर
ऐसे रन जिन्होंने आपके बिना हस्तक्षेप किए काम पूरा कर दिया।
मीडियन लागत
एक सामान्य रन की लागत क्या है, क्रेडिट में।
मीडियन समय
कुल समय, पहले संदेश से लेकर उत्तर तक।

प्रत्येक पंक्ति के पीछे के रन का मध्यक। एक मॉडल तब दिखाई देता है जब उसके पास इस एजेंट पर 3 रन होते हैं, और रन की संख्या दिखाई जाती है ताकि आप आंक सकें कि कोई आंकड़ा किस पर आधारित है।

स्क्रिप्ट अंदर जाती है। एक तैयार एपिसोड बाहर आता है।

यह पहले से ही सेट है। इसे खोलें और इससे कुछ पूछें।

एक एपिसोड तैयार करें

सभी एजेंट देखें