स्क्रिप्ट दिली जाते. तयार भाग बाहेर येतो.
हे प्रत्येक तुकड्याला आवाज देते, ते एकत्र करते, पूर्ण भागाची पातळी −16 LUFS पर्यंत सेट करते आणि टॅग केलेली MP3 एन्कोड करते — नंतर त्याने काय मोजले आणि काय करायला सांगितले होते जे ते करू शकले नाही ते तुम्हाला सांगते.
हे कसे काम करते
तीन पायऱ्या, आणि त्यातील एकही “कॉन्फिगर करा” नाही.
- 01
याला स्क्रिप्ट किंवा तुमची रेकॉर्डिंग्ज द्या
हे बोलू शकेल अशी स्क्रिप्ट किंवा संभाषणात जोडलेले तुमचे मूळ रेकॉर्डिंग्ज. हे आधी प्रोडक्शन नोट्स वाचते, कारण लाऊडनेसचे ध्येय आणि फॉरमॅट सहसा तिथेच असतात.
- 02
संपादन करण्यापूर्वी हे मोजमाप करते
प्रत्येक भागाची लांबी आणि लाऊडनेस तपासली जाते आणि शांतता अंदाज लावण्याऐवजी शोधली जाते. ते आकडे जोडणीचे काम करतात — आणि त्याद्वारेच हे ब्रीफच्या दाव्यांची पडताळणी करते.
- 03
तुम्हाला भाग, नोट्स आणि आकडे मिळतात
वर्कस्पेस रूटवर एक टॅग केलेली MP3, सोबत शो नोट्स आणि चॅप्टर टाइमस्टॅम्प्स, आणि एक संक्षिप्त रिपोर्ट: ते काय आहे, स्क्रिप्टमधून काय बदलले आहे आणि कशावर तुमचे लक्ष जाणे आवश्यक आहे.
हे काय करू शकते
हे लाऊडनेसचे ध्येय गाठते आणि ते सिद्ध करते
−16 LUFS हे पॉडकास्टचे मानक आहे आणि ते अस्तित्वात आहे कारण स्वयंपाकघरातील फोनच्या स्पीकरमध्ये अतिरिक्त डायनॅमिक रेंज नसते. हे दोन टप्प्यांत सामान्यीकरण करते आणि फाइलने आधी आणि नंतर काय मोजले ते प्रिंट करते, ज्यामुळे दाव्याची पडताळणी करता येते.
हे काय करू शकले नाही ते सांगते
नमूना ब्रीफमध्ये म्युझिक बेड मागितला आहे परंतु कोणतीही संगीत फाइल नाही — त्यामुळे हे त्याशिवाय भाग तयार करते आणि नावासह तसे सांगते. एखादी आवश्यकता शांतपणे वगळणारा एजंट ती लपवतो, पूर्ण करत नाही.
हे ऑडिओनुसार ब्रीफ तपासते
तीस सेकंद म्हणून बुक केलेला स्पॉन्सर स्लॉट जर बावीस सेकंदांचा भरत असेल, तर त्यावर एक वाक्य सांगणे गरजेचे आहे. तसेच दुसऱ्या भागाची पुनरावृत्ती करणारा विभाग किंवा स्क्रिप्टमध्ये नाव नसलेल्या पाहुण्याचे आश्वासन देणारा आऊट्रो यावरही हे सांगते.
हे कसे सेट केले आहे
कार्यपद्धती, जेणेकरून साइन इन करण्यापूर्वी तुम्हाला काय मिळत आहे हे तुम्हाला माहीत असेल.
- वातावरण
- ऑडिओचे काम ffmpeg असणाऱ्या Mume सर्व्हिसवर चालते, ज्याच्यापर्यंत MCP द्वारे पोहोचले जाते. ते फक्त एका सत्राच्या फाईल्स पाहते आणि दुसरे काहीही नाही — ते कोणते वर्कस्पेस आहे हे एका अल्पकालीन टोकनवरून ठरते, विनंतीवरून कधीही नाही.
- साधने
- generateSpeech, transcribe, readFile, writeFile, editFile, glob, सोबत आठ ऑडिओ व्हर्ब्स: probe, detectSilence, trim, concat, mix, normalize, encode, importAudio. मुद्दाम कोणताही शेल नाही — ऑडिओ टूल्स ही नामांकित ऑपरेशन्स आहेत, ffmpeg कमांड लाइन नाही.
- मॉडेल
- कॅटलॉग मधील कोणतेही चॅट मॉडेल. येथील निर्णय संपादकीय स्वरूपाचा आहे — काय कमी करायचे, कशावर फ्लॅग करायचे, संक्षिप्त माहितीमध्ये नेमके काय विचारले होते.
- सुरुवातीच्या फाइल्स
- एका स्क्रिप्ट आणि अर्धवट लिहिलेल्या नोट्ससह तयार केलेले, ज्यामध्ये पाच समस्या आहेत: गहाळ म्युझिक बेड, दाव्यानुसार लांबी नसलेले ॲड रीड, डुप्लिकेट सेक्शन टायटल, नाव नसलेला पाहुणा आणि गाठायचे लाउडनेस टार्गेट.
- काय राहते
- तुकडे, मध्यवर्ती फाईल्स आणि पूर्ण झालेला भाग सत्रासोबतच राहतात. परत या आणि ते पुन्हा कट करा, किंवा नवीन प्रायोजक रीड जोडा आणि पुन्हा तयार करा.
लोक ज्या गोष्टी विचारतात
- “स्क्रिप्टवरून भाग 1 तयार करा आणि तुम्ही काय करू शकले नाही ते मला सांगा.”
- “स्पॉन्सरचे वाचन खरोखर तीस सेकंदांचे आहे का?”
- “सर्वकाही −16 LUFS वर लेव्हल करा आणि मला आधीचा व नंतरचा फरक दाखवा.”
- “स्क्रिप्टवरून नाही, तर तयार फाइलवरून धडे लिहा.”
हे काय करणार नाही
यातील प्रत्येक मर्यादा आम्ही प्रत्यक्षात अनुभवली आहे, हा रोडमॅपचा भाग नाही.
- हे संगीत तयार करू शकत नाही. हे फक्त बोलू शकते; इथे कोणतेही वाद्य नाही. म्युझिक बेड मागितल्यास, काहीतरी बोललेले तयार करून त्याला संगीत म्हणण्याऐवजी, ते इथे उपलब्ध नाही असे सांगते.
- इथे कोणताही शेल नाही. ऑडिओचे काम नावांच्या क्रियापदांद्वारे होते, म्हणूनच ते फिल्टर चेन बनवू शकत नाही — आणि याच कारणामुळे ती क्रियापदे ज्या गोष्टी कव्हर करत नाहीत ते काम हे करू शकत नाही.
- भाषण हे भाषण असते, परफॉर्मन्स नाही. आवाज स्पष्ट आणि समान रीतीने वाचतात; ते एखाद्या पात्राचा अभिनय करणार नाहीत, आणि एकासाठी लिहिलेली स्क्रिप्ट एकासाठीच लिहिलेल्या स्क्रिप्टसारखी ऐकू येईल.
- ज्याची मोजणी केली नाही अशा कोणत्याही संख्येचा दावा हे करणार नाही. रिपोर्टमध्ये कालावधी किंवा लाउडनेस गहाळ असल्यास, मोजणी झाली नाही म्हणून ते गहाळ आहे, ते ठीक होते म्हणून नाही.
कोणते मॉडेल हे सर्वोत्तम करते
Measured over real runs of this agent, per model. A run counts as finished when it produced the answer on its own — nothing failed, nobody was asked to approve anything, and it did not run out of steps. Read all three columns together: a model that finishes fast by giving up scores badly on the first, and one that completes everything by grinding scores badly on the second.
| Model | पूर्णतेचा दर | मध्यक खर्च | मध्यक वेळ | Runs |
|---|---|---|---|---|
| claude-sonnet-5anthropic | 64% | $0.150 | 79s | 14 |
| claude-sonnet-4.6anthropic | 100% | $0.052 | 29s | 4 |
- पूर्णतेचा दर
- तुम्हाला हस्तक्षेप न करता काम पूर्ण करणाऱ्या रन्स.
- मध्यक खर्च
- क्रेडिट्समध्ये, एका सामान्य रनचा खर्च किती येतो.
- मध्यक वेळ
- भिंतीवरील घड्याळ, पहिल्या संदेशापासून उत्तरापर्यंत.
Medians over the runs behind each row. A model appears once it has 3 runs on this agent, and the run count is shown so you can judge how much a figure rests on.
स्क्रिप्ट दिली जाते. तयार भाग बाहेर येतो.
हे आधीच सेट केले आहे. ते उघडा आणि काहीतरी विचारा.
भाग तयार करा