UC Berkeleys FreeToken führt 753B GLM-5.2 mit 14,9 tok/s auf einer RTX PRO 6000 aus und Qwen3.6-35B mit 39,3 tok/s auf einem 8GB-RTX-4060-Laptop.
Yuchen Jin zufolge liefert FreeToken 2–4x mehr Durchsatz als Ollama auf Consumer-GPUs.
Ein 16× RTX 5060 Ti 16GB-Rig führt DeepSeek V4 Flash-0731 mit 130–150 tok/s über zwei PLX88096-Switches aus.
UC Berkeley's FreeToken runs 753B GLM-5.2 at 14.9 tok/s on one RTX PRO 6000 and Qwen3.6-35B at 39.3 tok/s on an 8GB RTX 4060 laptop.
Yuchen Jin claims FreeToken delivers 2–4x Ollama throughput on consumer GPUs.
A 16× RTX 5060 Ti 16GB rig runs DeepSeek V4 Flash-0731 at 130–150 tok/s over two PLX88096 switches.