Сокращение памяти ИИ повышает точность, показало исследование
На каждом этапе вывода (слева) для последующего исключения может быть выбрана входящая пара ключ–значение (k, v) на основе предсказанных бинарных решений α ∈ {0, 1} (для ясности мы показываем только последовательность ключей). Выселение происходит, как только пара выпадает из раздвижного окна. Во время тренировки (справа) это поведение индуцируется с помощью дополнительной маски внимания. Решения о выселении расслабляются от бинарного к непрерывному α ∈ [0, 1].

Исследователи разработали новый способ сжатия памяти, используемой ИИ-моделями, чтобы повысить их точность в сложных задачах или помочь сэкономить значительные объёмы энергии.
Эксперты из Эдинбургского университета и NVIDIA обнаружили, что большие языковые модели (LLM), использующие память в восемь раз меньше, чем несжатая LLM, показывали лучшие результаты на тестах по математике, науке и программированию, при этом тратя столько же времени на рассуждение.
Этот метод может использоваться альтернативным способом, чтобы LLM одновременно отвечали на большее количество пользовательских запросов, уменьшая потребление энергии на задачу.
Помимо экономии энергии, эксперты отмечают, что улучшения могут принести пользу системам искусственного интеллекта, используемым для решения сложных задач или устройств с медленной или ограниченной памятью, таких как умные домашние устройства и носимые технологии.
Как сжатие памяти улучшает развитие искусственного интеллекта
«Размышляя» о более сложных гипотезах или одновременно исследуя больше гипотез, модели ИИ улучшают свои способности к решению задач. На практике это достигается за счёт генерации большего количества рассуждений — пошагового логического процесса, используемого для решения задач — в текстовой форме.Память модели — называемая кэшом KV — которая хранит части генерируемых потоков, может служить узким местом, так как её размер замедляет генерацию выходов логических потоков во время вывода — процесса, при котором модели ИИ отвечают на вводный запрос, например, на пользовательский запрос.
Чем больше потоков и чем длиннее они, тем больше памяти требуется. Чем больше используемая память, тем дольше LLM уходит на извлечение кэша KV из части устройства ИИ, где он хранится.
Введение динамической разреженности памяти
Чтобы преодолеть эту проблему, команда разработала метод сжатия памяти моделей — названный динамической разреженностью памяти (DMS). Вместо того чтобы сохранять каждый токен — единицы данных, которые обрабатывает модель ИИ — DMS решает, какие из них достаточно важны для сохранения, а какие можно удалить.Существует небольшая задержка между принятием решений об удалении токенов с помощью спарсификации и их удалением. Это даёт модели возможность передать ценную информацию из выселенных токенов сохранившимся.
Управляя тем, какие токены оставить, а какие сбросить, DMS позволяет модели ИИ «думать» глубже или исследовать больше возможных решений без дополнительной работы компьютера.
Тестирование и результаты нового метода
Исследователи протестировали DMS на различных версиях моделей искусственного интеллекта Llama и Qwen и сравнили их производительность с моделями без сжатия.Производительность моделей оценивалась с помощью стандартизированных тестов. Было установлено, что даже при сжатии памяти до одной восьмой от исходного размера, LLM полностью сохраняют свою исходную точность в сложных задачах, ускоряя рассуждение по сравнению с несжатыми моделями.
В стандартизированном математическом тесте AIME 24, который служил квалификацией для Математической олимпиады США, сжатые модели показали в среднем на двенадцать баллов лучше, используя то же количество считываний кэша KV для получения ответа.
Для GPQA Diamond — серии сложных вопросов в биологии, химии и физике, подготовленных экспертами уровня Ph.D. — модели показали более чем восемь баллов лучше.
Модели также были протестированы с помощью LiveCode Bench, который измеряет, насколько хорошо модели ИИ могут писать код. Сжатые модели в среднем набирали на десять баллов лучше, чем несжатые модели.
Будущие направления
Результаты этой работы были представлены на конференции NeurIPS.Доктор Эдоардо Понти, стипендиат GAIL и преподаватель обработки естественного языка в Школе информатики университета, сказал: «В двух словах, наши модели могут рассуждать быстрее, но с одинаковым качеством. Таким образом, при соответствующем временном бюджете на рассуждение они могут исследовать больше и длинные темы. Это улучшает их способность решать сложные задачи в математике, науке и программировании.»
Доктор Понти и его команда продолжат исследовать способы, которыми крупные системы ИИ представляют и запоминают информацию, делая их гораздо более эффективными и устойчивыми.