तुमचे रेकॉर्डिंग दुसऱ्या भाषेत ऐका
ऑडिओ किंवा व्हिडिओ जोडा — किंवा एखाद्याची लिंक पेस्ट करा — आणि तुम्हाला कोणती भाषा हवी आहे ते सांगा. हे ट्रान्सक्राइब करते, वाचण्याऐवजी ऐकण्यासाठी भाषांतर करते आणि ते परत बोलून दाखवते.
हे कसे काम करते
तीन पायऱ्या, आणि त्यातील एकही “कॉन्फिगर करा” नाही.
- 01
याला रेकॉर्डिंग द्या
पानावर कुठेही फाईल टाका, किंवा त्याला URL द्या आणि ते तुम्हाला डाउनलोड आणि पुन्हा अपलोड करायला सांगण्याऐवजी स्वतः फाईल मिळवते.
- 02
तुम्हाला प्रथम ट्रान्सक्रिप्ट दिसते
त्यानंतरच्या सर्व गोष्टींमध्ये त्याच्या चुका येतात, आणि ते बरोबर आहे की नाही हे ऐकू शकणारे तुम्ही एकमेव आहात. म्हणून काहीही भाषांतर करण्यापूर्वी हे तुम्हाला ट्रान्सक्रिप्ट दाखवते.
- 03
हे भाषांतर परत बोलून दाखवते
लक्ष्य भाषेशी जुळणाऱ्या आवाजात, ट्रान्सक्रिप्ट आणि भाषांतर फाईल्स म्हणून जतन केले जाते ज्या तुम्ही दुरुस्त करू शकता आणि त्याला पुन्हा सांगायला सांगू शकता.
हे काय करू शकते
एकाच रनमध्ये तीन प्रकारचे मॉडेल
ट्रान्सक्रिप्शन, नंतर भाषांतर करणारे चॅट मॉडेल, आणि नंतर आवाज. तुम्ही चॅट मॉडेल निवडता; ते वाचत असलेल्या भाषेशी जुळणारा आवाज निवडला जातो.
ऐकण्यासाठी केलेले भाषांतर
संक्षिप्त रूपे, नैसर्गिक शब्दक्रम आणि बोलणाऱ्याने खरोखर वापरलेली भाषा शैली. वाचण्यासाठी योग्य वाटणारे परंतु अर्जासारखे वाटणारे भाषांतर या कामासाठी चुकीचे आऊटपुट आहे.
याने काय निर्णय घ्यावा लागला ते हे चिन्हांकित करते
नावे, विनोद आणि म्हणी या ठिकाणी भाषांतरात पर्याय निवडावे लागतात. ते लपवणारे गुळगुळीत निकाल देण्याऐवजी, ज्या गोष्टींबद्दल खात्री नव्हती त्या हे स्पष्ट सांगते.
हे कसे सेट केले आहे
कार्यपद्धती, जेणेकरून साइन इन करण्यापूर्वी तुम्हाला काय मिळत आहे हे तुम्हाला माहीत असेल.
- वातावरण
- curl आणि तुमचा वर्कस्पेस माउंट केलेला Linux कंटेनर, जेणेकरून डाउनलोड केलेले रेकॉर्डिंग अशा ठिकाणी पोहोचते जिथे ट्रान्सक्रिप्शन टूल ते वाचू शकते.
- साधने
- ट्रान्सक्राइब करा, स्पीच जनरेट करा, फाइल्स वाचा आणि लिहा, glob आणि एक शेल.
- मॉडेल
- भाषांतरासाठी कोणतेही चॅट मॉडेल. तुम्ही मागितलेल्या भाषेशी ते स्पीच मॉडेल मॅच करून पाहते, आणि सुरू करण्यापूर्वी वापरत असलेल्या आवाजाचे नाव सांगते.
- सुरुवातीच्या फाइल्स
- काहीही जोडलेले नाही: इनपुट तुमचे स्वतःचे रेकॉर्डिंग आहे आणि नमुना क्लिप कोणीही न विचारलेल्या प्रश्नाचे उत्तर देत पाईपलाईन दाखवेल.
- काय राहते
- संभाषण संपल्यानंतर ऑडिओ, ट्रान्सक्रिप्ट आणि भाषांतर तुमच्या वर्कस्पेसमध्येच राहतात.
लोक ज्या गोष्टी विचारतात
- “माझे रेकॉर्डिंग ट्रान्सक्राइब करा आणि मला स्पॅनिशमध्ये परत द्या.”
- “तुम्ही खरोखर कोणत्या भाषा बोलू शकता, आणि मी दुसऱ्या भाषेसाठी विचारल्यास काय होईल?”
- “मुलाखतीची लिंक येथे आहे — याचे जर्मनमध्ये भाषांतर करा आणि मला वाचून दाखवा.”
- “यावेळी फक्त ट्रान्सक्रिप्ट, बोलणाऱ्यांना वेगळे करून.”
हे काय करणार नाही
यातील प्रत्येक मर्यादा आम्ही प्रत्यक्षात अनुभवली आहे, हा रोडमॅपचा भाग नाही.
- हे चार भाषा बोलू शकते, चारशे नाही. दुसऱ्या भाषेची विनंती केल्यास ते आधीच स्पष्ट सांगते आणि रन पूर्ण करून शेवटी सांगण्याऐवजी लिखित भाषांतर देण्याचा पर्याय देते.
- २५ MB ही ट्रान्सक्रिप्शनची मर्यादा आहे. यावर कॉल खर्च करण्यापूर्वी हे फाईलचा आकार तपासते.
- सँडबॉक्समध्ये ffmpeg नाही, त्यामुळे ते ऑडिओ रूपांतरित किंवा री-एनकोड करू शकत नाही. सहसा याची गरज नसते — mp4 आणि webm थेट चालतात.
कोणते मॉडेल हे सर्वोत्तम करते
Measured over real runs of this agent, per model. A run counts as finished when it produced the answer on its own — nothing failed, nobody was asked to approve anything, and it did not run out of steps. Read all three columns together: a model that finishes fast by giving up scores badly on the first, and one that completes everything by grinding scores badly on the second.
| Model | पूर्णतेचा दर | मध्यक खर्च | मध्यक वेळ | Runs |
|---|---|---|---|---|
| claude-sonnet-5anthropic | 100% | $0.014 | 9s | 4 |
- पूर्णतेचा दर
- तुम्हाला हस्तक्षेप न करता काम पूर्ण करणाऱ्या रन्स.
- मध्यक खर्च
- क्रेडिट्समध्ये, एका सामान्य रनचा खर्च किती येतो.
- मध्यक वेळ
- भिंतीवरील घड्याळ, पहिल्या संदेशापासून उत्तरापर्यंत.
Medians over the runs behind each row. A model appears once it has 3 runs on this agent, and the run count is shown so you can judge how much a figure rests on.
तुमचे रेकॉर्डिंग दुसऱ्या भाषेत ऐका
हे आधीच सेट केले आहे. ते उघडा आणि काहीतरी विचारा.
रेकॉर्डिंगचे भाषांतर करा