Contents — find the section you need
Change parameters and verify
Open the panel, then press Run to load Python. You can stop execution and reset parameters. Results are computed on this device. No Python installation is required.
Local execution steps below are optional for reproducing the source results; they are not required for the browser experiment.
The experiment controls are in English.
Saniye başına token sayısı tek başına bir istek gönderildikten sonraki bekleme süresini açıklayamaz. İlk yanıt içeriğini, üretim hızını, tamamlanma süresini ve belleği ayrı ayrı ölçün. Bu makale bir ölçüm prosedürü ve istemci sunmaktadır; gerçek model kıyaslaması veya donanım sıralaması yapılmamıştır.
Zamanlama sınırlarını tanımlayın
TTFT normalde ilk token'a kadar geçen süreyi ifade eder, ancak bir HTTP parçası mutlaka bir token değildir. Bu komut dosyası, ilk boş olmayan response parçasına kadar geçen süreyi (TTFC) rapor eder. Döndürüldüğünde ilk düşünme içeriğini ayrı olarak kaydeder. Bu istemci metriği, kuyruğa alma, yükleme, istem işleme ve taşıma işlemlerini içerir.
Üretim hızı ise sunucunun ürettiği token sayısını ve üretim süresini kullanır. Ollama süreleri nanosaniyedir; Üretim API'si tanımları 2026-09-07 tarihinde kontrol edilmiştir.
Bu, tüm istek üzerindeki verim değildir. Farklı belirteçleyiciler ayrıca, belirteçlerin tek başına Japonca yanıt hacmi veya kalitesinin adil bir karşılaştırması olmadığı anlamına gelir.
Koşulları düzeltin
Model özetini, nicelemeyi, Ollama sürümünü, CPU/GPU'yu, RAM/VRAM'i, güç sınırlarını, eşzamanlılığı ve istemi kaydedin. Aynı metin farklı şekilde belirteçlenebileceğinden, döndürülen sayıları koruyun. Yüklenmemiş bir modelle yapılan ilk isteği, sonraki yerleşik model isteklerinden ayırın.
Tekrarlanan istemler önbellek kullanabilir. Yerleşik/aynı istem ve yerleşik/yeni giriş testlerini ayrı ayrı ele alın. Termal koşullar ve arka plan çalışmaları karşılaştırmaları etkileyebileceğinden, yürütme sırasını kaydedin.
Akışı okuyun
Karşılaştırma metninizi içeren prompt.txt'in yanına llm_benchmark.py dosyasını yerleştirin. Yalnızca Python'ın standart kütüphanesini kullanır. YOUR_MODEL'i kurulu bir modelle değiştirin:
python3 llm_benchmark.py --model YOUR_MODEL --prompt-file prompt.txt --runs 5 > runs.jsonl
Varsayılan uç nokta 127.0.0.1:11434/api/generate'dir. İstekler temperature=0, seed=42, num_predict=128, num_ctx=4096 ve keep_alive=5m değerlerini kullanır. Bunlar deneysel ayarlardır, her model için kesinlik veya uygunluk garantisi değildir. Erken sonlanma veya farklı düşünme davranışı için çıktı sayısını ve done_reason'ı kontrol edin.
Çıktıları ve hataları doğrulayın
Her JSON satırı ttfc_s, first_thinking_s, client_total_s, generation_tokens_s ve sunucu sayımlarını/sürelerini içerir. Cevap parçası yoksa null TTFC; sıfır üretim süresi ise null verim üretir. Kesintiye uğramış akışlar ve API hataları status=error'dur, asla sıfır saniyelik başarılar değildir.
Ayrıştırma, zamanlama alanları ve hata işleme, gerçek Ollama üretimiyle değil, sentetik akış yanıtlarıyla test edilmiştir. İşlemi doğrulamak için beş deneme ile başlayın, ardından açık ısınma kurallarıyla tekrarları artırın. Başarı sayısını, medyanı ve aralığı raporlayın; küçük örneklem p95'i kesin olarak sunmayın.
Belleği ayrı olarak ölçün
Komut dosyası belleği ölçmez. Çalışan model API'si size_vram dahil olmak üzere yerleşim bilgilerini ortaya çıkarır, ancak tüm sistem kullanımını veya geçici zirveleri göstermez. Boşta kalma ve üretim sırasında OS/GPU metriklerini tutarlı bir şekilde örnekleyin ve gözlem aralığını belirtin.
İşlem RAM'i, sayfa önbelleği ve GPU tahsisleri farklı miktarlardır; bunları eklemek çift sayıma neden olabilir. Özellikle birleşik bellek sistemlerinde sınırları kontrol edin. Kısmi CPU işleme gibi bir yerleşim değişikliği, yalnızca model yeteneğindeki bir fark olarak tanımlanmamalıdır.
Kullanışlı bir karşılaştırma tablosu oluşturun
Model/nicelleştirme, giriş/çıkış belirteçleri, yerleşim/önbellek koşulları, başarılar, medyan TTFC, medyan üretim hızı, toplam süre ve bellek metriği/örnekleme aralığını ekleyin. Yanıt doğruluğunu ayrı ayrı değerlendirin. Enerji için, sunucu güç ölçümü kullanarak aynı iş yükünü Wh'ye bağlayın.
Yorumlar
Lütfen önce giriş yapın.
Henüz veri yok.