स्क्रिप्ट दिली जाते. तयार भाग बाहेर येतो.
हे प्रत्येक तुकड्याला आवाज देते, ते एकत्र करते, पूर्ण भागाची पातळी −16 LUFS पर्यंत सेट करते आणि टॅग केलेली MP3 एन्कोड करते — नंतर त्याने काय मोजले आणि काय करायला सांगितले होते जे ते करू शकले नाही ते तुम्हाला सांगते.
हे कसे काम करते
तीन पायऱ्या, आणि त्यातील एकही “कॉन्फिगर करा” नाही.
- 01
याला स्क्रिप्ट किंवा तुमची रेकॉर्डिंग्ज द्या
हे बोलू शकेल अशी स्क्रिप्ट किंवा संभाषणात जोडलेले तुमचे मूळ रेकॉर्डिंग्ज. हे आधी प्रोडक्शन नोट्स वाचते, कारण लाऊडनेसचे ध्येय आणि फॉरमॅट सहसा तिथेच असतात.
- 02
संपादन करण्यापूर्वी हे मोजमाप करते
प्रत्येक भागाची लांबी आणि लाऊडनेस तपासली जाते आणि शांतता अंदाज लावण्याऐवजी शोधली जाते. ते आकडे जोडणीचे काम करतात — आणि त्याद्वारेच हे ब्रीफच्या दाव्यांची पडताळणी करते.
- 03
तुम्हाला भाग, नोट्स आणि आकडे मिळतात
वर्कस्पेस रूटवर एक टॅग केलेली MP3, सोबत शो नोट्स आणि चॅप्टर टाइमस्टॅम्प्स, आणि एक संक्षिप्त रिपोर्ट: ते काय आहे, स्क्रिप्टमधून काय बदलले आहे आणि कशावर तुमचे लक्ष जाणे आवश्यक आहे.
हे काय करू शकते
हे लाऊडनेसचे ध्येय गाठते आणि ते सिद्ध करते
−16 LUFS हे पॉडकास्टचे मानक आहे आणि ते अस्तित्वात आहे कारण स्वयंपाकघरातील फोनच्या स्पीकरमध्ये अतिरिक्त डायनॅमिक रेंज नसते. हे दोन टप्प्यांत सामान्यीकरण करते आणि फाइलने आधी आणि नंतर काय मोजले ते प्रिंट करते, ज्यामुळे दाव्याची पडताळणी करता येते.
हे काय करू शकले नाही ते सांगते
नमूना ब्रीफमध्ये म्युझिक बेड मागितला आहे परंतु कोणतीही संगीत फाइल नाही — त्यामुळे हे त्याशिवाय भाग तयार करते आणि नावासह तसे सांगते. एखादी आवश्यकता शांतपणे वगळणारा एजंट ती लपवतो, पूर्ण करत नाही.
हे ऑडिओनुसार ब्रीफ तपासते
तीस सेकंद म्हणून बुक केलेला स्पॉन्सर स्लॉट जर बावीस सेकंदांचा भरत असेल, तर त्यावर एक वाक्य सांगणे गरजेचे आहे. तसेच दुसऱ्या भागाची पुनरावृत्ती करणारा विभाग किंवा स्क्रिप्टमध्ये नाव नसलेल्या पाहुण्याचे आश्वासन देणारा आऊट्रो यावरही हे सांगते.
हे कसे सेट केले आहे
कार्यपद्धती, जेणेकरून साइन इन करण्यापूर्वी तुम्हाला काय मिळत आहे हे तुम्हाला माहीत असेल.
- वातावरण
- ऑडिओचे काम ffmpeg असणाऱ्या Mume सर्व्हिसवर चालते, ज्याच्यापर्यंत MCP द्वारे पोहोचले जाते. ते फक्त एका सत्राच्या फाईल्स पाहते आणि दुसरे काहीही नाही — ते कोणते वर्कस्पेस आहे हे एका अल्पकालीन टोकनवरून ठरते, विनंतीवरून कधीही नाही.
- साधने
- generateSpeech, transcribe, readFile, writeFile, editFile, glob, सोबत आठ ऑडिओ व्हर्ब्स: probe, detectSilence, trim, concat, mix, normalize, encode, importAudio. मुद्दाम कोणताही शेल नाही — ऑडिओ टूल्स ही नामांकित ऑपरेशन्स आहेत, ffmpeg कमांड लाइन नाही.
- मॉडेल
- कॅटलॉग मधील कोणतेही चॅट मॉडेल. येथील निर्णय संपादकीय स्वरूपाचा आहे — काय कमी करायचे, कशावर फ्लॅग करायचे, संक्षिप्त माहितीमध्ये नेमके काय विचारले होते.
- सुरुवातीच्या फाइल्स
- एका स्क्रिप्ट आणि अर्धवट लिहिलेल्या नोट्ससह तयार केलेले, ज्यामध्ये पाच समस्या आहेत: गहाळ म्युझिक बेड, दाव्यानुसार लांबी नसलेले ॲड रीड, डुप्लिकेट सेक्शन टायटल, नाव नसलेला पाहुणा आणि गाठायचे लाउडनेस टार्गेट.
- काय राहते
- तुकडे, मध्यवर्ती फाईल्स आणि पूर्ण झालेला भाग सत्रासोबतच राहतात. परत या आणि ते पुन्हा कट करा, किंवा नवीन प्रायोजक रीड जोडा आणि पुन्हा तयार करा.
लोक ज्या गोष्टी विचारतात
- “स्क्रिप्टवरून भाग 1 तयार करा आणि तुम्ही काय करू शकले नाही ते मला सांगा.”
- “स्पॉन्सरचे वाचन खरोखर तीस सेकंदांचे आहे का?”
- “सर्वकाही −16 LUFS वर लेव्हल करा आणि मला आधीचा व नंतरचा फरक दाखवा.”
- “स्क्रिप्टवरून नाही, तर तयार फाइलवरून धडे लिहा.”
हे काय करणार नाही
यातील प्रत्येक मर्यादा आम्ही प्रत्यक्षात अनुभवली आहे, हा रोडमॅपचा भाग नाही.
- हे संगीत तयार करू शकत नाही. हे फक्त बोलू शकते; इथे कोणतेही वाद्य नाही. म्युझिक बेड मागितल्यास, काहीतरी बोललेले तयार करून त्याला संगीत म्हणण्याऐवजी, ते इथे उपलब्ध नाही असे सांगते.
- इथे कोणताही शेल नाही. ऑडिओचे काम नावांच्या क्रियापदांद्वारे होते, म्हणूनच ते फिल्टर चेन बनवू शकत नाही — आणि याच कारणामुळे ती क्रियापदे ज्या गोष्टी कव्हर करत नाहीत ते काम हे करू शकत नाही.
- भाषण हे भाषण असते, परफॉर्मन्स नाही. आवाज स्पष्ट आणि समान रीतीने वाचतात; ते एखाद्या पात्राचा अभिनय करणार नाहीत, आणि एकासाठी लिहिलेली स्क्रिप्ट एकासाठीच लिहिलेल्या स्क्रिप्टसारखी ऐकू येईल.
- ज्याची मोजणी केली नाही अशा कोणत्याही संख्येचा दावा हे करणार नाही. रिपोर्टमध्ये कालावधी किंवा लाउडनेस गहाळ असल्यास, मोजणी झाली नाही म्हणून ते गहाळ आहे, ते ठीक होते म्हणून नाही.
कोणते मॉडेल हे सर्वोत्तम करते
या एजंटच्या वास्तविक रन्सवर, प्रति मॉडेल मोजलेले. जेव्हा एखादा रन स्वतःहून उत्तर तयार करतो तेव्हा तो पूर्ण झालेला मानला जातो — काहीही अयशस्वी झाले नाही, कोणालाही कशास मान्यता देण्यास सांगितले गेले नाही, आणि त्याच्या पायऱ्या संपल्या नाहीत. तीनही स्तंभ एकत्र वाचा: हार मानून वेगाने संपवणारे मॉडेल पहिल्या स्तंभावर वाईट स्कोअर करते, आणि सर्वकाही कसून पूर्ण करणारे मॉडेल दुसऱ्या स्तंभावर वाईट स्कोअर करते.
| मॉडेल | पूर्णतेचा दर | मध्यक खर्च | मध्यक वेळ | रन्स |
|---|---|---|---|---|
| claude-sonnet-5anthropic | 64% | $0.150 | 79से | 14 |
| claude-sonnet-4.6anthropic | 100% | $0.052 | 29से | 4 |
| kimi-k3moonshotai | 67% | $0.327 | 4मि 54से | 3 |
- पूर्णतेचा दर
- तुम्हाला हस्तक्षेप न करता काम पूर्ण करणाऱ्या रन्स.
- मध्यक खर्च
- क्रेडिट्समध्ये, एका सामान्य रनचा खर्च किती येतो.
- मध्यक वेळ
- भिंतीवरील घड्याळ, पहिल्या संदेशापासून उत्तरापर्यंत.
प्रत्येक रांगेच्या मागील रन्सवरील मध्यक. या एजंटवर 3 रन्स झाल्यावर एक मॉडेल दिसते, आणि रन संख्या दर्शविली जाते जेणेकरून एखादा आकडा कशावर आधारित आहे याचा तुम्ही अंदाज लावू शकाल.
स्क्रिप्ट दिली जाते. तयार भाग बाहेर येतो.
हे आधीच सेट केले आहे. ते उघडा आणि काहीतरी विचारा.
भाग तयार करा