इसका विवरण दें, फिर इसे चलते हुए देखें
शैल, फ़ाइल ट्री और टर्मिनल वाला एक सैंडबॉक्स्ड Linux वर्कस्पेस। कोड फ़ाइलों में लिखा जाता है और निष्पादित किया जाता है, इसलिए आप जो देखते हैं वह आउटपुट का विवरण होने के बजाय आउटपुट होता है।
यह कैसे काम करता है
तीन चरण, और उनमें से कोई भी “कॉन्फ़िगर करना” नहीं है।
- 01
बताएं कि आप क्या बनवाना चाहते हैं
या अपनी खुद की फ़ाइलें लाएं — उन्हें पृष्ठ पर कहीं भी ड्रॉप करें और वे वर्कस्पेस में आ जाएंगी।
- 02
यह फ़ाइलें लिखता है और उन्हें चलाता है
चैट बबल में कोड नहीं। एक वास्तविक फ़ाइलसिस्टम में वास्तविक फ़ाइलें, और वे कमांड जिनका आउटपुट आप दोनों के पास वापस आता है।
- 03
वर्कस्पेस आपके पास रहता है
अगली बार जब आप सत्र खोलेंगे, तो फ़ाइलें, इंस्टॉल किए गए पैकेज और शैल स्थिति वहीं मिलेंगे।
यह क्या कर सकता है
एक वास्तविक टर्मिनल
pandas और matplotlib के साथ node, npm, git, curl, python3, और सामान्य coreutils। बाकी सब कुछ pip या npm से इंस्टॉल हो जाता है।
फ़ाइल खुद चलाएं
किसी भी Python, JavaScript, TypeScript या शैल फ़ाइल को एक Run बटन मिलता है। यह पहले सहेजता है, फिर चलाता है, और आउटपुट फ़ाइल के नीचे एक टर्मिनल पेन में दिखाई देता है जिसे आप छोटा या बंद कर सकते हैं।
कोई भी मॉडल, सत्र के बीच में बदला जा सकता है
मॉडल बदलने पर वातावरण नहीं बदलता है, इसलिए आप कठिन हिस्से के लिए किसी अधिक शक्तिशाली मॉडल पर स्विच कर सकते हैं और बाद में वापस आ सकते हैं।
इसे कैसे सेटअप किया गया है
यह कैसे काम करता है, ताकि साइन इन करने से पहले आपको पता हो कि आपको क्या मिल रहा है।
- एनवायरनमेंट
- प्रति सत्र एक Linux कंटेनर, आपकी बारी के बीच तैयार रखा जाता है। आपका वर्कस्पेस उस डायरेक्टरी में माउंट होता है जहाँ से शैल शुरू होता है।
- टूल
- एक शैल, साथ ही पढ़ना, लिखना, एडिट करना, glob और grep।
- मॉडल
- कैटलॉग में से कोई भी चैट मॉडल।
- शुरुआती फ़ाइलें
- कुछ भी पहले से मौजूद नहीं — यह खाली शुरू होता है, क्योंकि इसमें आप जो बनाते हैं वही मुख्य बात है।
- क्या सहेजा जाता है
- वर्कस्पेस प्रति सत्र संग्रहीत होता है और रीलोड करने, टैब बंद करने और किसी अलग डिवाइस पर भी सुरक्षित रहता है।
लोग इससे जो पूछते हैं
- “एक Python स्क्रिप्ट लिखें जो किसी फ़ोल्डर में डुप्लिकेट फ़ाइलों को ढूंढती है, फिर इसे आपके द्वारा बनाई गई कुछ परीक्षण फ़ाइलों पर चलाएं।”
- “Node में एक हेल्थ एंडपॉइंट के साथ एक छोटा HTTP सर्वर सेटअप करें, इसे चलाएं, और मुझे प्रतिक्रिया दिखाएं।”
- “इस CSV को लें और इसे एक JSON फ़ाइल में बदलें जिसमें प्रति पंक्ति एक ऑब्जेक्ट हो।”
- “इन दो फ़ंक्शनों का बेंचमार्क करें और मुझे बताएं कि कौन सा तेज़ है, और कितना तेज़ है।”
यह क्या नहीं करेगा
इनमें से हर एक ऐसी वास्तविक बाधा है जिसका हमने सामना किया है, कोई योजना की सूची वाली चीज नहीं।
- बाहर से पहुँच योग्य कोई लंबे समय तक चलने वाले सर्वर नहीं। लगातार चलने की आवश्यकता वाले कमांड को उसकी समय सीमा समाप्त होने पर रोक दिया जाता है।
- सत्र के शांत होते ही सैंडबॉक्स को पुनः प्राप्त कर लिया जाता है। आपकी फ़ाइलें बची रहती हैं; चलता हुआ प्रोसेस नहीं।
- यह एक वर्कस्पेस है, डिप्लॉय का लक्ष्य नहीं। आप यहाँ जो बनाते हैं उसे अपने साथ ले जाते हैं।
कौन सा मॉडल इसे सबसे बेहतर करता है
इस एजेंट के वास्तविक रन पर मापा गया, प्रति मॉडल। एक रन को तब समाप्त माना जाता है जब उसने अपने दम पर उत्तर दिया — कुछ भी विफल नहीं हुआ, किसी से कुछ भी स्वीकृत करने के लिए नहीं कहा गया, और इसके चरण समाप्त नहीं हुए। तीनों स्तंभों को एक साथ पढ़ें: एक मॉडल जो हार मानकर जल्दी समाप्त होता है, वह पहले पर खराब स्कोर करता है, और जो कड़ी मेहनत करके सब कुछ पूरा करता है, वह दूसरे पर खराब स्कोर करता है।
| मॉडल | पूरा होने की दर | मीडियन लागत | मीडियन समय | रन |
|---|---|---|---|---|
| kimi-latest~moonshotai | 92% | $0.028 | 37से | 12 |
| gemini-3.5-flash-litegoogle | 100% | $0.016 | 19से | 4 |
| gemini-3.6-flashgoogle | 100% | $0.063 | 76से | 4 |
| gpt-5.6-luna-proopenai | 100% | $0.010 | 38से | 4 |
| claude-sonnet-5anthropic | 100% | $0.238 | 88से | 3 |
| gemini-3.7-flashgoogle | 67% | $0.045 | 56से | 3 |
- पूरा होने की दर
- ऐसे रन जिन्होंने आपके बिना हस्तक्षेप किए काम पूरा कर दिया।
- मीडियन लागत
- एक सामान्य रन की लागत क्या है, क्रेडिट में।
- मीडियन समय
- कुल समय, पहले संदेश से लेकर उत्तर तक।
प्रत्येक पंक्ति के पीछे के रन का मध्यक। एक मॉडल तब दिखाई देता है जब उसके पास इस एजेंट पर 3 रन होते हैं, और रन की संख्या दिखाई जाती है ताकि आप आंक सकें कि कोई आंकड़ा किस पर आधारित है।