तुमचे रेकॉर्डिंग दुसऱ्या भाषेत ऐका
ऑडिओ किंवा व्हिडिओ जोडा — किंवा एखाद्याची लिंक पेस्ट करा — आणि तुम्हाला कोणती भाषा हवी आहे ते सांगा. हे ट्रान्सक्राइब करते, वाचण्याऐवजी ऐकण्यासाठी भाषांतर करते आणि ते परत बोलून दाखवते.
हे कसे काम करते
तीन पायऱ्या, आणि त्यातील एकही “कॉन्फिगर करा” नाही.
- 01
याला रेकॉर्डिंग द्या
पानावर कुठेही फाईल टाका, किंवा त्याला URL द्या आणि ते तुम्हाला डाउनलोड आणि पुन्हा अपलोड करायला सांगण्याऐवजी स्वतः फाईल मिळवते.
- 02
तुम्हाला प्रथम ट्रान्सक्रिप्ट दिसते
त्यानंतरच्या सर्व गोष्टींमध्ये त्याच्या चुका येतात, आणि ते बरोबर आहे की नाही हे ऐकू शकणारे तुम्ही एकमेव आहात. म्हणून काहीही भाषांतर करण्यापूर्वी हे तुम्हाला ट्रान्सक्रिप्ट दाखवते.
- 03
हे भाषांतर परत बोलून दाखवते
लक्ष्य भाषेशी जुळणाऱ्या आवाजात, ट्रान्सक्रिप्ट आणि भाषांतर फाईल्स म्हणून जतन केले जाते ज्या तुम्ही दुरुस्त करू शकता आणि त्याला पुन्हा सांगायला सांगू शकता.
हे काय करू शकते
एकाच रनमध्ये तीन प्रकारचे मॉडेल
ट्रान्सक्रिप्शन, नंतर भाषांतर करणारे चॅट मॉडेल, आणि नंतर आवाज. तुम्ही चॅट मॉडेल निवडता; ते वाचत असलेल्या भाषेशी जुळणारा आवाज निवडला जातो.
ऐकण्यासाठी केलेले भाषांतर
संक्षिप्त रूपे, नैसर्गिक शब्दक्रम आणि बोलणाऱ्याने खरोखर वापरलेली भाषा शैली. वाचण्यासाठी योग्य वाटणारे परंतु अर्जासारखे वाटणारे भाषांतर या कामासाठी चुकीचे आऊटपुट आहे.
याने काय निर्णय घ्यावा लागला ते हे चिन्हांकित करते
नावे, विनोद आणि म्हणी या ठिकाणी भाषांतरात पर्याय निवडावे लागतात. ते लपवणारे गुळगुळीत निकाल देण्याऐवजी, ज्या गोष्टींबद्दल खात्री नव्हती त्या हे स्पष्ट सांगते.
हे कसे सेट केले आहे
कार्यपद्धती, जेणेकरून साइन इन करण्यापूर्वी तुम्हाला काय मिळत आहे हे तुम्हाला माहीत असेल.
- वातावरण
- curl आणि तुमचा वर्कस्पेस माउंट केलेला Linux कंटेनर, जेणेकरून डाउनलोड केलेले रेकॉर्डिंग अशा ठिकाणी पोहोचते जिथे ट्रान्सक्रिप्शन टूल ते वाचू शकते.
- साधने
- ट्रान्सक्राइब करा, स्पीच जनरेट करा, फाइल्स वाचा आणि लिहा, glob आणि एक शेल.
- मॉडेल
- भाषांतरासाठी कोणतेही चॅट मॉडेल. तुम्ही मागितलेल्या भाषेशी ते स्पीच मॉडेल मॅच करून पाहते, आणि सुरू करण्यापूर्वी वापरत असलेल्या आवाजाचे नाव सांगते.
- सुरुवातीच्या फाइल्स
- काहीही जोडलेले नाही: इनपुट तुमचे स्वतःचे रेकॉर्डिंग आहे आणि नमुना क्लिप कोणीही न विचारलेल्या प्रश्नाचे उत्तर देत पाईपलाईन दाखवेल.
- काय राहते
- संभाषण संपल्यानंतर ऑडिओ, ट्रान्सक्रिप्ट आणि भाषांतर तुमच्या वर्कस्पेसमध्येच राहतात.
लोक ज्या गोष्टी विचारतात
- “माझे रेकॉर्डिंग ट्रान्सक्राइब करा आणि मला स्पॅनिशमध्ये परत द्या.”
- “तुम्ही खरोखर कोणत्या भाषा बोलू शकता, आणि मी दुसऱ्या भाषेसाठी विचारल्यास काय होईल?”
- “मुलाखतीची लिंक येथे आहे — याचे जर्मनमध्ये भाषांतर करा आणि मला वाचून दाखवा.”
- “यावेळी फक्त ट्रान्सक्रिप्ट, बोलणाऱ्यांना वेगळे करून.”
हे काय करणार नाही
यातील प्रत्येक मर्यादा आम्ही प्रत्यक्षात अनुभवली आहे, हा रोडमॅपचा भाग नाही.
- हे चार भाषा बोलू शकते, चारशे नाही. दुसऱ्या भाषेची विनंती केल्यास ते आधीच स्पष्ट सांगते आणि रन पूर्ण करून शेवटी सांगण्याऐवजी लिखित भाषांतर देण्याचा पर्याय देते.
- २५ MB ही ट्रान्सक्रिप्शनची मर्यादा आहे. यावर कॉल खर्च करण्यापूर्वी हे फाईलचा आकार तपासते.
- सँडबॉक्समध्ये ffmpeg नाही, त्यामुळे ते ऑडिओ रूपांतरित किंवा री-एनकोड करू शकत नाही. सहसा याची गरज नसते — mp4 आणि webm थेट चालतात.
कोणते मॉडेल हे सर्वोत्तम करते
या एजंटच्या वास्तविक रन्सवर, प्रति मॉडेल मोजलेले. जेव्हा एखादा रन स्वतःहून उत्तर तयार करतो तेव्हा तो पूर्ण झालेला मानला जातो — काहीही अयशस्वी झाले नाही, कोणालाही कशास मान्यता देण्यास सांगितले गेले नाही, आणि त्याच्या पायऱ्या संपल्या नाहीत. तीनही स्तंभ एकत्र वाचा: हार मानून वेगाने संपवणारे मॉडेल पहिल्या स्तंभावर वाईट स्कोअर करते, आणि सर्वकाही कसून पूर्ण करणारे मॉडेल दुसऱ्या स्तंभावर वाईट स्कोअर करते.
| मॉडेल | पूर्णतेचा दर | मध्यक खर्च | मध्यक वेळ | रन्स |
|---|---|---|---|---|
| claude-sonnet-5anthropic | 100% | $0.014 | 9से | 4 |
- पूर्णतेचा दर
- तुम्हाला हस्तक्षेप न करता काम पूर्ण करणाऱ्या रन्स.
- मध्यक खर्च
- क्रेडिट्समध्ये, एका सामान्य रनचा खर्च किती येतो.
- मध्यक वेळ
- भिंतीवरील घड्याळ, पहिल्या संदेशापासून उत्तरापर्यंत.
प्रत्येक रांगेच्या मागील रन्सवरील मध्यक. या एजंटवर 3 रन्स झाल्यावर एक मॉडेल दिसते, आणि रन संख्या दर्शविली जाते जेणेकरून एखादा आकडा कशावर आधारित आहे याचा तुम्ही अंदाज लावू शकाल.
तुमचे रेकॉर्डिंग दुसऱ्या भाषेत ऐका
हे आधीच सेट केले आहे. ते उघडा आणि काहीतरी विचारा.
रेकॉर्डिंगचे भाषांतर करा