четверг, 3 сентября 2026 г.

Еще тесты нейронок

Недавно стукнула в голову моча и решил сделать букмарклет для подсчета скорости инференса (генерации) для LLM в llama.cpp. В процессе проверки, удивился что мой тест прошли почти с первого раза модели от бартовски - этому не придал особое значение, но потом когда читал статью про ЛЛМ встретил тоже такое что модели то в принципе разные - разные кванты и все прочее. Поэтому захотелось потестировать и это предположение. Беру разные модели с одинаковым квантом и тестирую на одном промпте.

 Это не окончательная статья, просто хотелось бы зафиксировать промежуточный результат и то что получилось, потому что есть некоторые наблюдения

Пока что 2 модели и в них в таблице видно разницу в архитектуре. Модель Бартовски это еще и встроенная драфт модель. Вот поэтому и хочу написать промежуточные результаты, что проверил заодно и скорость с драфтом потому что с 3 и больше вылетает, а с 1 и 2 разные скорости (добавлю в таблицу)

--spec-type draft-mtp --spec-draft-n-max 2

Что еще хотел сказать. Тот раз я проверял с увеличенным контекстом и мне подумалось что так лучше, что раз он дает с первого раза работающую игру. Но все оказалось не так просто - прогоны с увеличенным конетекстом и сейчас как будто лучше визуально и даже сделали одну +- играбельную игру, но что-то все это на уровне погрешности как будто.

В общем пока такая таблица, буду проверять модели Unsloth завтра


 

 

Комментариев нет:

Отправить комментарий