Torna alle repository
z-labDFlash

DFlash: open source da tenere d’occhio

Modello leggero di block diffusion per speculative decoding, progettato per generare draft paralleli in modo efficiente.

Perché ne parliamo

Accelerare l’inferenza lavorando sul draft.

DFlash affronta un problema tecnico molto concreto: produrre proposte parallele utili per ridurre il costo della generazione. README, backend e benchmark rendono il progetto interessante anche per chi studia l’infrastruttura dei modelli.

Cosa trovi dentro

  • Supporta modelli Qwen, Gemma, Llama, Kimi e MiniMax.
  • Backend Transformers, SGLang, vLLM e MLX.
  • Modelli draft pubblicati su Hugging Face.
  • Benchmark per GSM8K, Math500, HumanEval, MBPP e MT-Bench.
DFlash | Trending Repo | DevOP