Анализ данных (Data analysis)
50.4K subscribers
3.47K photos
428 videos
1 file
2.84K links
Data science, наука о данных.

@haarrp - админ

РКН: clck.ru/3FmyAp
Download Telegram
🔥 Qwen выложила на Hugging Face веса своего монстра на 2,4 ТРИЛЛИОНА параметров. На каждый токен работают 95 млрд

Qwen3.8-2.4T-A95B стала крупнейшей моделью нового поколения Qwen в открытом релизе. Внутри MoE на 2,4 трлн параметров, 512 экспертов, из которых одновременно задействуются 10 routed + 1 shared. Архитектура гибридная: Gated DeltaNet чередуется с обычным attention, а модель обучена с Multi-Token Prediction.

Контекст нативно составляет 262K токенов и расширяется примерно до 1,01 млн. При этом опубликованная версия text-only и всегда работает с reasoning: thinking отключить нельзя, но его глубину можно регулировать через reasoning_effort от low до xhigh.

Qwen сильно приблизилась к закрытым frontier-моделям. По собственным eval команды, Qwen3.8-Max получает 86,6 на TerminalBench 2.1 против 88,8 у GPT-5.6 Sol, 92,6 на GPQA Diamond, 82,8 на IFBench и 93,0 на PaperBench. На WideSearch модель набрала 81,9. Эти сравнения стоит воспринимать именно как результаты из model card Qwen, поскольку harness и условия тестирования между моделями местами различаются.

Qwen3.8-Max построен на этой же базе, но дополнительно получает vision, non-thinking mode, миллионный контекст по умолчанию и встроенные инструменты. Сами веса Qwen3.8-2.4T-A95B уже доступны для Transformers, vLLM и SGLang.

2,4T total / 95B active выглядит как хороший показатель того, куда движутся большие MoE: размер модели продолжает улетать в триллионы, но вычислять весь этот объём на каждом токене уже никто не хочет.

https://huggingface.co/Qwen/Qwen3.8-2.4T-A95B

#AI #Qwen #LLM #MoE #OpenModels
👍158🔥8