प्रमुख ख़बरें
3 समाचार संस्थान·3 रिपोर्टें

Google releases Multi-Token Prediction drafters for its Gemma 4 models, which use a form of speculative decoding to guess future tokens for faster inference (Ryan Whitwam/Ars Technica)

Google has released Multi-Token Prediction drafters for its Gemma 4 AI models. The drafters use speculative decoding to guess future tokens, allowing the models to infer faster. Reported improvements include a three-fold speed boost for inference.

यह सारांश नीचे दी गई सभी रिपोर्टों से बना है, किसी एक से नहीं।

किसने क्या बताया

  1. Hacker News·
    Accelerating Gemma 4: faster inference with multi-token prediction drafters
  2. Ars Technica·
    Google's Gemma 4 AI models get 3x speed boost by predicting future tokens
  3. TechMeme·
    Google releases Multi-Token Prediction drafters for its Gemma 4 models, which use a form of speculative decoding to guess future tokens for faster inference (Ryan Whitwam/Ars Technica)