Contents — find the section you need
Change parameters and verify
Open the panel, then press Run to load Python. You can stop execution and reset parameters. Results are computed on this device. No Python installation is required.
Local execution steps below are optional for reproducing the source results; they are not required for the browser experiment.
The experiment controls are in English.
Token per detik saja tidak dapat menjelaskan waktu tunggu setelah mengirim permintaan. Ukur konten jawaban pertama, tingkat pembuatan, waktu penyelesaian, dan memori secara terpisah. Artikel ini menyediakan prosedur pengukuran dan klien; tidak ada tolok ukur model nyata atau peringkat perangkat keras yang dilakukan.
Mendefinisikan batas waktu
TTFT biasanya berarti waktu hingga token pertama, tetapi fragmen HTTP tidak selalu berupa satu token. Skrip ini melaporkan TTFC, waktu hingga fragmen response pertama yang tidak kosong. Skrip ini secara terpisah mencatat konten pemikiran pertama saat dikembalikan. Metrik klien ini mencakup antrian, pemuatan, pemrosesan prompt, dan transportasi.
Tingkat pembuatan malah menggunakan jumlah token yang dihasilkan server dan durasi pembuatan. Durasi Ollama adalah nanodetik; definisi API Pembuatan diperiksa pada 2026-09-07.
Ini bukan throughput atas seluruh permintaan. Tokenisasi yang berbeda juga berarti token saja bukanlah perbandingan yang adil untuk volume atau kualitas jawaban bahasa Jepang.
Perbaiki kondisinya
Catat ringkasan model, kuantisasi, versi Ollama, CPU/GPU, RAM/VRAM, batas daya, konkurensi, dan prompt. Pertahankan jumlah yang dikembalikan karena teks yang identik dapat di-tokenisasi secara berbeda. Pisahkan permintaan pertama dengan model yang belum dimuat dari permintaan model residen berikutnya.
Prompt yang berulang dapat menggunakan cache. Perlakukan pengujian residen/prompt yang sama dan residen/input baru secara terpisah. Catat urutan eksekusi karena kondisi termal dan pekerjaan latar belakang dapat membiaskan perbandingan.
Baca alirannya
Tempatkan llm_benchmark.py di samping prompt.txt yang berisi teks perbandingan Anda. Ini hanya menggunakan pustaka standar Python. Ganti YOUR_MODEL dengan model yang terpasang:
python3 llm_benchmark.py --model YOUR_MODEL --prompt-file prompt.txt --runs 5 > runs.jsonl
Endpoint default adalah 127.0.0.1:11434/api/generate. Permintaan menggunakan temperature=0, seed=42, num_predict=128, num_ctx=4096 dan keep_alive=5m. Ini adalah pengaturan eksperimen, bukan jaminan determinisme atau kesesuaian untuk setiap model. Periksa jumlah output dan done_reason untuk penghentian dini atau perilaku berpikir yang berbeda.
Validasi output dan kegagalan
Setiap baris JSON mencakup ttfc_s, first_thinking_s, client_total_s, generation_tokens_s dan jumlah/durasi server. Tidak adanya fragmen jawaban menghasilkan TTFC null; durasi generasi nol menghasilkan throughput null. Aliran yang terputus dan kesalahan API berstatus=error, tidak pernah sukses nol detik.
Penguraian, bidang waktu, dan penanganan kegagalan diuji dengan respons streaming sintetis, bukan generasi Ollama yang sebenarnya. Mulailah dengan lima percobaan untuk memvalidasi prosedur, kemudian tingkatkan pengulangan dengan aturan pemanasan yang eksplisit. Laporkan jumlah keberhasilan, median, dan rentang; jangan menyajikan p95 sampel kecil sebagai nilai yang tepat.
Ukur memori secara terpisah
Skrip ini tidak mengukur memori. API model berjalan mengekspos informasi residensi termasuk size_vram, tetapi bukan penggunaan seluruh sistem atau puncak transien. Ambil sampel metrik OS/GPU secara konsisten selama idle dan generasi, dengan menyatakan interval pengamatan.
RAM proses, cache halaman, dan alokasi GPU adalah kuantitas yang berbeda; menambahkannya dapat menyebabkan penghitungan ganda. Periksa batasannya, terutama pada sistem memori terpadu. Perubahan penempatan seperti pemrosesan CPU parsial tidak boleh dijelaskan semata-mata sebagai perbedaan kemampuan model.
Buat tabel perbandingan yang bermanfaat
Sertakan model/kuantisasi, token input/output, kondisi residensi/cache, keberhasilan, median TTFC, median tingkat generasi, total waktu, dan metrik memori/interval sampel. Evaluasi kebenaran jawaban secara terpisah. Untuk energi, hubungkan beban kerja yang sama ke Wh menggunakan pengukuran daya server.
Komentar
Silakan masuk terlebih dahulu.
Belum ada data.