
Почему модель 70B не помещается в видеокарту на 24 ГБ: как считать память для локального ИИ
Название 70B означает около 70 млрд параметров, а не размер файла в гигабайтах. В FP16 одни веса такой модели требуют примерно 140 ГБ памяти, при 8-битном хранении около 70 ГБ, а идеальные 4 бита дают около 35 ГБ еще до KV-кеша и служебных буферов. Поэтому объем VRAM для локальной LLM нельзя выбирать только по размеру GGUF: длинный контекст способен занять еще десятки гигабайт.
