Contents — find the section you need

Change parameters and verify

Open the panel, then press Run to load Python. You can stop execution and reset parameters. Results are computed on this device. No Python installation is required.

Local execution steps below are optional for reproducing the source results; they are not required for the browser experiment.

The experiment controls are in English.

Open experiment panel in a new tab

Download reproduction source

प्रति सेकंड टोकन की संख्या से अनुरोध भेजने के बाद लगने वाले प्रतीक्षा समय को पूरी तरह से नहीं समझाया जा सकता। पहले उत्तर की सामग्री, उत्पादन दर, पूर्णता समय और मेमोरी को अलग-अलग मापें। यह लेख एक मापन प्रक्रिया और क्लाइंट प्रदान करता है; किसी वास्तविक मॉडल का बेंचमार्क या हार्डवेयर रैंकिंग नहीं की गई है।

समय सीमाएँ निर्धारित करें

Diagram 1 · Use the button to switch views
अनुरोध, विचार, पहला उत्तर और पूर्णता समय सीमाएँ।

TTFT का सामान्य अर्थ पहले टोकन तक का समय होता है, लेकिन HTTP फ़्रैगमेंट का अर्थ हमेशा एक टोकन नहीं होता। यह स्क्रिप्ट TTFC रिपोर्ट करती है, जो पहले गैर-रिक्त response फ़्रैगमेंट तक का समय है। यह वापस आने पर पहले विचार की सामग्री को अलग से रिकॉर्ड करती है। इस क्लाइंट मेट्रिक में क्यूइंग, लोडिंग, प्रॉम्प्ट प्रोसेसिंग और ट्रांसपोर्ट शामिल हैं।

उत्पादन दर के लिए सर्वर द्वारा उत्पन्न टोकन की संख्या और उत्पादन अवधि का उपयोग किया जाता है। ओलामा अवधि नैनोसेकंड में होती है; Generate API परिभाषाओं की जाँच 2026-09-07 को की गई थी।

\text{generation rate [token/s]}=\frac{\text{eval\_count}}{\text{eval\_duration [ns]}}\times10^9

यह पूरे अनुरोध पर थ्रूपुट नहीं है। अलग-अलग टोकनाइज़र का मतलब यह भी है कि केवल टोकन के आधार पर जापानी उत्तरों की मात्रा या गुणवत्ता की तुलना करना उचित नहीं है।

शर्तें ठीक करें

मॉडल डाइजेस्ट, क्वांटाइजेशन, ओलामा संस्करण, CPU/GPU, RAM/VRAM, पावर सीमा, समवर्तीता और प्रॉम्प्ट रिकॉर्ड करें। लौटाए गए काउंट्स को सुरक्षित रखें क्योंकि समान टेक्स्ट अलग-अलग तरीके से टोकनाइज़ हो सकता है। अनलोड किए गए मॉडल वाले पहले अनुरोध को बाद के रेजिडेंट-मॉडल अनुरोधों से अलग करें।

बार-बार प्रॉम्प्ट आने पर कैश का उपयोग हो सकता है। रेजिडेंट/समान-प्रॉम्प्ट और रेजिडेंट/नए-इनपुट परीक्षणों को अलग-अलग मानें। निष्पादन क्रम रिकॉर्ड करें क्योंकि तापमान की स्थिति और पृष्ठभूमि में चल रहे कार्य तुलनाओं को प्रभावित कर सकते हैं।

स्ट्रीम पढ़ें

अपने तुलनात्मक टेक्स्ट वाले prompt.txt के बगल में llm_benchmark.py रखें। यह केवल Python की मानक लाइब्रेरी का उपयोग करता है। YOUR_MODEL को इंस्टॉल किए गए मॉडल से बदलें:

python3 llm_benchmark.py --model YOUR_MODEL --prompt-file prompt.txt --runs 5 > runs.jsonl

डिफ़ॉल्ट एंडपॉइंट 127.0.0.1:11434/api/generate है। अनुरोधों में temperature=0, seed=42, num_predict=128, num_ctx=4096 और keep_alive=5m का उपयोग किया जाता है। ये प्रायोगिक सेटिंग्स हैं, हर मॉडल के लिए निश्चितता या उपयुक्तता की गारंटी नहीं हैं। समय से पहले समाप्ति या अलग सोच व्यवहार के लिए आउटपुट गणना और done_reason की जाँच करें।

आउटपुट और विफलताओं का सत्यापन

प्रत्येक JSON पंक्ति में ttfc_s, first_thinking_s, client_total_s, generation_tokens_s और सर्वर गणना/अवधि शामिल हैं। कोई उत्तर खंड न होने पर TTFC शून्य होता है; शून्य जनरेशन अवधि होने पर थ्रूपुट शून्य होता है। बाधित स्ट्रीम और API त्रुटियाँ status=error होती हैं, शून्य-सेकंड सफलताएँ कभी नहीं।

पार्सिंग, टाइमिंग फ़ील्ड और विफलता प्रबंधन का परीक्षण सिंथेटिक स्ट्रीमिंग प्रतिक्रियाओं के साथ किया गया था, वास्तविक Ollama जनरेशन के साथ नहीं। प्रक्रिया को मान्य करने के लिए पाँच परीक्षणों से शुरुआत करें, फिर स्पष्ट वार्म-अप नियमों के साथ पुनरावृत्तियों को बढ़ाएँ। सफलता की संख्या, माध्यिका और सीमा रिपोर्ट करें; छोटे नमूने वाले p95 को सटीक मानकर प्रस्तुत न करें।

मेमोरी को अलग से मापें

स्क्रिप्ट मेमोरी को नहीं मापती है। रनिंग-मॉडल API रेजिडेंसी जानकारी प्रदान करता है, जिसमें size_vram शामिल है, लेकिन संपूर्ण सिस्टम उपयोग या क्षणिक पीक नहीं। निष्क्रिय और जनरेशन के दौरान OS/GPU मेट्रिक्स को लगातार सैंपल करें, अवलोकन अंतराल बताते हुए।

प्रोसेस RAM, पेज कैश और GPU आवंटन अलग-अलग मात्राएँ हैं; इन्हें जोड़ने से दोहरी गणना हो सकती है। विशेष रूप से एकीकृत-मेमोरी सिस्टम पर सीमाओं की जाँच करें। आंशिक CPU प्रोसेसिंग जैसे प्लेसमेंट परिवर्तन को केवल मॉडल क्षमता में अंतर के रूप में वर्णित नहीं किया जाना चाहिए।

एक उपयोगी तुलना तालिका बनाएँ

इसमें मॉडल/क्वांटाइजेशन, इनपुट/आउटपुट टोकन, रेजिडेंसी/कैश स्थितियाँ, सफलताएँ, माध्यिका TTFC, माध्यिका जनरेशन दर, कुल समय और मेमोरी मेट्रिक/नमूना अंतराल शामिल करें। उत्तर की शुद्धता का मूल्यांकन अलग से करें। ऊर्जा के लिए, सर्वर पावर मापन का उपयोग करके उसी कार्यभार को Wh से कनेक्ट करें।

What to read next

Compare generation speed with energy per completed workload.होम-सर्वर की पावर खपत को मापें: निष्क्रिय, अनुमान और स्टोरेजReview the backgroundमशीन लर्निंग का परिचय: जनरेटिव मॉडलExplore another aspect of this fieldऑब्जेक्ट डिटेक्शन और सिमेंटिक सेगमेंटेशन का प्रारंभिक परिचय — किसी छवि से "कौन सी वस्तु कहाँ है" यह समझना