Ну это больше про аутсайдеров. Кстати нейронки сбера и алисы наконец-то научились проходить мой тест - алиса раньше тупо недописывала код, сбер делал малоиграбельную игру. Но вот пару недель назад тесты были пройдены, но это ожидаемо - когда-то это должно было произойти, просто потому что локальные моделди квен и гемма на 35 и 26 млрд параметров запускаются у меня на ПК с приличной скоростью (больше 20-30 т/с) и выдают очень и очень приличный результат.
В этот раз я тестирую что-то что отличается от них. Возможно занимаюсь фигней и бесполезностями но почему бы и нет с другой стороны. Есть множество моделей основанных на Qwen - дистиллированые, а еще дообученные, еретики, и прочее - чаще всего частные непонятные поделки, с которыми тоже надо аккуратно - в модели вкладывают виручы и это уже существует. Есть такие же модели основанные на этом же квен, но от студий - это уже поделиями сложнее назвать, к ним больше уважения, хотя и они бывают манипулируют результатами бенчмарков (завышают свои, занижают чужие, вплоть до родительской квен 3.6 - видел такое что бенчмарк с другими результатми у нее, хотя чаще в карточках результаты 3.6 совпадают)
Собственно интересно что-то другое, как будто не похожее, и такое есть. LLama mistral уже тоже не интересно - эти на слуху и не плохие вроде (хуже квена как по мне) но уже мною протестированы ранее и не справлялись, впрочем новые версии жду и буду тестировать - это интересно. И вот есть например вот такое: https://huggingface.co/vectionlabs/Maestro1-9B (9b не думающая)
Итак результат ММ теста (мастермайнд - я для него уже сделал даже букмарклет чтобы не копировать и не вставлять каждый раз в окно llamacpp https://boolkin.blogspot.com/2017/03/pizza.html - после калькулятора букмарклеты чтобы и html получить и чтобы промпт вставить) - тест провален, зациклен, не рисуются кружочки. Тетрис тест (напиши игру тетрис на html, css, js одной страницей) тоже провален. Мои тесты по программированию специфичны, и скорее всего не совсем правильные потому что чисто по вебу, но тем не менее - легко тестировать. впрочем можно сделать то же самое для других языков. Короче эта модель провалилась (скорость 62 и 71 т/с на этих чатах)
От того же разработчика https://huggingface.co/vectionlabs/Salience-1.5-Nano (тоже 9b но думающая)
Тоже провалены оба теста, но ММ - выглядит интереснее и тетрис заготовка выглядит интереснее - но ничего не работает. тест с танками (Write a game similar to Battle City in a single HTML file without dependencies, running on desktop and mobile.) тоже не запустился - заставка красивая но пропадает курсор, второй раз кнопка нажималась но ничего не работало. 60т/с Эти 9б модели похуже чем квен 9б - тоже не годятся вподметки - тот делал что-то хоть немного работающее, думаю завтра проверю еще раз чтобы убедиться
Второй раз переписываю.... Короче квен 3.5 9б не умнее, тоже не проходит тесты, просто один раз 9б модель сделал а мне играбельную игру ММ, но это было буквально один раз, после этого игры были не играбельные. То же касается и другой модели, Бонзай, о чем будет ниже
другой есть: https://huggingface.co/JetBrains/Mellum2-12B-A2.5B-Thinking-SFT (12б МОЕ думающий). 13 токенов в секунду (квен 35б быстрее работает)... ММ провален, тетрис тоже. тетрис 7+ тыс токенов, в конце такое: // --- СОБНСТРАИВКА СОБЗАКОВ ---
ну и выбрал не ту модель, буду завтра доделывать. Смысл в том что я выбрал SFT - дообученная но промежуточно (на самой карточке модели сами разрабы пишут Supervised thinking checkpoint) конечноый продук это Thinking. Я ее скачал, тоже запустил но лучше не стало те же 16 т/с но ничего рабочего да еще и разметку на тетрисе криво сделала. В общем удалять и не вспоминать.
Теперь про Бонзай. Проверял модель 27б Ternary-Bonsai-27B-Q2_g64.gguf
Нужна именно с g64, остальные не запустились (у меня видеопамяти всего 8гб, а модель весит 7.6 Гб причем чтобы запустить ее пришлось перенести часть слоев в ОЗУ -ngl 55 при этом скорость 6 т/с) Эта модель смогла сделать играбельную игру, с уникальным дизайном, правда подсчет быков и коров был не правильный. Сделала тетрис, но там видимо было зацикливание - игра не зупастилась при том что начинает гудеть процессор. Еще у этих моделей есть драфт модели которые имеют меньший размер.
Есть еще просто https://huggingface.co/prism-ml/Bonsai-27B-gguf
Тоже 27б но 1 битное квантование (тернари 3 бита) запустилось без проблем 37 т/с, но задачу почти не выполнила. Было всего один раз на рабочем ноуте сделала в принципе работающий тестрис в котором не работал поворот фигур. Вторым промптом попросил указать как сделать поворот (при чем переписывая весь код все напрочь ломалось) заменив нужные блоки - поворот заработал но не шибко хорошо. В общем однозначно глупее, но тем не менее возможно поумнее квена 9б... хотя как сказать у того тоже один раз стрельнуло, о чем писал выше. ЗЫ (на моем ПК снова тетрис были фигуры и двигались но криво косо, не вращались, и в процессе падения квадратные точки... короче такое себе)
Ну и понравилась скорость 8б модели - да игры не делает (делает не рабочие) но зато скорость 122-116 т/с. На этом пока все. Дальше будут еще
И все-таки дополню. Откровение. модель Nanbeige_Nanbeige4.2-3B-Q8_0.gguf - сделала вполне играбельную игру. Думала на 8 тыс токенов, но в итоге уложилась в 16 тыс. Скорость 43 т/с. Тетрис фигуры падают, вращаются, но не ложатся на пол. Удивительно, но кажется можно доделать. (доделала, я выложу потом результат. Написал ей "хорошая работа! но фигура не ложится на пол, как будто бесконечно падает. поэтому не появляется следующая, а если ронять по харду, то сразу окно что проиграл" и она прислала исправленную играбельную игру в которую нельзя проиграть))) 3млрд параметров, подумать только. Надо тестировать Q4
PS Не смог пойти спать и проверил Q4 - 60-70 т/с и ММ играбельная снова... по крайней мере можно довести комбинацию до угадывания. Тетрис аналогично. Лишняя скобка, которую удалил и фигуры стали падать, и поворачиваться (правда хуже чем Q8 версии) В общем это реально повторяемый эксперимент - это реально очень умная модель... Удивлен.



