Недавно вышли две работы.
Google TurboQuant
Это новый алгоритм сжатия. Каждый раз, когда модель отвечает на вопрос, она хранит огромный объём промежуточных данных. Чем длиннее разговор - тем дороже.
Результат: сжимает эти данные в 6+ раз без потери качества, давая восьмикратный прирост скорости на H100. Алгоритм не требует переобучения - просто подключается к существующей модели
Moonshot AI (Kimi) Attention Residuals
Ранее все было так: каждый слой берёт результат своей работы и просто прибавляет к нему то, что пришло со слоя ниже. Теперь так: вместо того чтобы механически брать только соседний слой ИИ сам решает какой слой сейчас важен и сколько оттуда взять. Это тот же механизм внимания (attention), который уже используется для обработки слов в тексте, только теперь он применяется не по горизонтали (между словами), а по вертикали (между слоями)
Результат: +25% к эффективности обучения при задержке менее 2%, потому что модель перестаёт таскать лишний груз. Она точнее направляет нужную информацию в нужное место и тратит меньше итераций обучения, чтобы прийти к хорошему результату
Работу публично похвалил Андрей Карпатый (один из ведущих эйайщиков на планете) Один из авторов статьи - 17-летний школьник, придумавший идею прямо на экзамене
Что же это значит для бизнеса?
TurboQuant означает меньше железа на те же задачи и длинный контекст по доступной цене Attention Residuals означает дешевле обучать модели


Комментарии (41)