Contents — find the section you need
Change parameters and verify
Open the panel, then press Run to load Python. You can stop execution and reset parameters. Results are computed on this device. No Python installation is required.
Local execution steps below are optional for reproducing the source results; they are not required for the browser experiment.
The experiment controls are in English.
प्रति सेकंड टोकन की संख्या से अनुरोध भेजने के बाद लगने वाले प्रतीक्षा समय को पूरी तरह से नहीं समझाया जा सकता। पहले उत्तर की सामग्री, उत्पादन दर, पूर्णता समय और मेमोरी को अलग-अलग मापें। यह लेख एक मापन प्रक्रिया और क्लाइंट प्रदान करता है; किसी वास्तविक मॉडल का बेंचमार्क या हार्डवेयर रैंकिंग नहीं की गई है।
समय सीमाएँ निर्धारित करें
TTFT का सामान्य अर्थ पहले टोकन तक का समय होता है, लेकिन HTTP फ़्रैगमेंट का अर्थ हमेशा एक टोकन नहीं होता। यह स्क्रिप्ट TTFC रिपोर्ट करती है, जो पहले गैर-रिक्त response फ़्रैगमेंट तक का समय है। यह वापस आने पर पहले विचार की सामग्री को अलग से रिकॉर्ड करती है। इस क्लाइंट मेट्रिक में क्यूइंग, लोडिंग, प्रॉम्प्ट प्रोसेसिंग और ट्रांसपोर्ट शामिल हैं।
उत्पादन दर के लिए सर्वर द्वारा उत्पन्न टोकन की संख्या और उत्पादन अवधि का उपयोग किया जाता है। ओलामा अवधि नैनोसेकंड में होती है; Generate API परिभाषाओं की जाँच 2026-09-07 को की गई थी।
यह पूरे अनुरोध पर थ्रूपुट नहीं है। अलग-अलग टोकनाइज़र का मतलब यह भी है कि केवल टोकन के आधार पर जापानी उत्तरों की मात्रा या गुणवत्ता की तुलना करना उचित नहीं है।
शर्तें ठीक करें
मॉडल डाइजेस्ट, क्वांटाइजेशन, ओलामा संस्करण, CPU/GPU, RAM/VRAM, पावर सीमा, समवर्तीता और प्रॉम्प्ट रिकॉर्ड करें। लौटाए गए काउंट्स को सुरक्षित रखें क्योंकि समान टेक्स्ट अलग-अलग तरीके से टोकनाइज़ हो सकता है। अनलोड किए गए मॉडल वाले पहले अनुरोध को बाद के रेजिडेंट-मॉडल अनुरोधों से अलग करें।
बार-बार प्रॉम्प्ट आने पर कैश का उपयोग हो सकता है। रेजिडेंट/समान-प्रॉम्प्ट और रेजिडेंट/नए-इनपुट परीक्षणों को अलग-अलग मानें। निष्पादन क्रम रिकॉर्ड करें क्योंकि तापमान की स्थिति और पृष्ठभूमि में चल रहे कार्य तुलनाओं को प्रभावित कर सकते हैं।
स्ट्रीम पढ़ें
अपने तुलनात्मक टेक्स्ट वाले prompt.txt के बगल में llm_benchmark.py रखें। यह केवल Python की मानक लाइब्रेरी का उपयोग करता है। YOUR_MODEL को इंस्टॉल किए गए मॉडल से बदलें:
python3 llm_benchmark.py --model YOUR_MODEL --prompt-file prompt.txt --runs 5 > runs.jsonl
डिफ़ॉल्ट एंडपॉइंट 127.0.0.1:11434/api/generate है। अनुरोधों में temperature=0, seed=42, num_predict=128, num_ctx=4096 और keep_alive=5m का उपयोग किया जाता है। ये प्रायोगिक सेटिंग्स हैं, हर मॉडल के लिए निश्चितता या उपयुक्तता की गारंटी नहीं हैं। समय से पहले समाप्ति या अलग सोच व्यवहार के लिए आउटपुट गणना और done_reason की जाँच करें।
आउटपुट और विफलताओं का सत्यापन
प्रत्येक JSON पंक्ति में ttfc_s, first_thinking_s, client_total_s, generation_tokens_s और सर्वर गणना/अवधि शामिल हैं। कोई उत्तर खंड न होने पर TTFC शून्य होता है; शून्य जनरेशन अवधि होने पर थ्रूपुट शून्य होता है। बाधित स्ट्रीम और API त्रुटियाँ status=error होती हैं, शून्य-सेकंड सफलताएँ कभी नहीं।
पार्सिंग, टाइमिंग फ़ील्ड और विफलता प्रबंधन का परीक्षण सिंथेटिक स्ट्रीमिंग प्रतिक्रियाओं के साथ किया गया था, वास्तविक Ollama जनरेशन के साथ नहीं। प्रक्रिया को मान्य करने के लिए पाँच परीक्षणों से शुरुआत करें, फिर स्पष्ट वार्म-अप नियमों के साथ पुनरावृत्तियों को बढ़ाएँ। सफलता की संख्या, माध्यिका और सीमा रिपोर्ट करें; छोटे नमूने वाले p95 को सटीक मानकर प्रस्तुत न करें।
मेमोरी को अलग से मापें
स्क्रिप्ट मेमोरी को नहीं मापती है। रनिंग-मॉडल API रेजिडेंसी जानकारी प्रदान करता है, जिसमें size_vram शामिल है, लेकिन संपूर्ण सिस्टम उपयोग या क्षणिक पीक नहीं। निष्क्रिय और जनरेशन के दौरान OS/GPU मेट्रिक्स को लगातार सैंपल करें, अवलोकन अंतराल बताते हुए।
प्रोसेस RAM, पेज कैश और GPU आवंटन अलग-अलग मात्राएँ हैं; इन्हें जोड़ने से दोहरी गणना हो सकती है। विशेष रूप से एकीकृत-मेमोरी सिस्टम पर सीमाओं की जाँच करें। आंशिक CPU प्रोसेसिंग जैसे प्लेसमेंट परिवर्तन को केवल मॉडल क्षमता में अंतर के रूप में वर्णित नहीं किया जाना चाहिए।
एक उपयोगी तुलना तालिका बनाएँ
इसमें मॉडल/क्वांटाइजेशन, इनपुट/आउटपुट टोकन, रेजिडेंसी/कैश स्थितियाँ, सफलताएँ, माध्यिका TTFC, माध्यिका जनरेशन दर, कुल समय और मेमोरी मेट्रिक/नमूना अंतराल शामिल करें। उत्तर की शुद्धता का मूल्यांकन अलग से करें। ऊर्जा के लिए, सर्वर पावर मापन का उपयोग करके उसी कार्यभार को Wh से कनेक्ट करें।
टिप्पणियाँ
पहले लॉग इन करें।
अभी कोई डेटा नहीं है।