بچهها، سلام!
در ۲۰۲۶ با یک تغییر بزرگ در Inference روبرو هستیم. DSpark (DeepSeek Spark) با تمرکز روی کاهش bottleneckها و بهبود معماری تولید توکن، سرعت را بالا میبرد.
مشکل اصلی: Memory Wall
در تولید متن، گلوگاه فقط GPU compute نیست؛ پهنای باند حافظه و جابهجایی دادهها بین VRAM و محاسبات مهمترین عامل کندی است.
راهکار قدیمی: Speculative Decoding
مدل Draft سریع چند توکن را حدس میزند و Target آنها را تایید میکند. اما خطا در Draft میتواند باعث reject شدن توکنهای بعدی شود (Suffix Decay).
راهکار DSpark
DSpark تلاش میکند با معماری نیمهاتورگرسیو و ماژولهای سبک، انسجام توکنها را بیشتر کند و افت دُم را کاهش دهد.
بنچمارک
در متن مقاله، سرعتهای نزدیک به چند صد توکن بر ثانیه ادعا شده است.
— منابع:
- وایتپیپر رسمی DSpark
- مستندات بهینهسازی VRAM در استنتاج موازی