среда, 29 июля 2026 г.

Еще соревнования нейросетей

 Ну это больше про аутсайдеров. Кстати нейронки сбера и алисы наконец-то научились проходить мой тест - алиса раньше тупо недописывала код, сбер делал малоиграбельную игру. Но вот пару недель назад тесты были пройдены, но это ожидаемо - когда-то это должно было произойти, просто потому что локальные моделди квен и гемма на 35 и 26 млрд параметров запускаются у меня на ПК с приличной скоростью (больше 20-30 т/с) и выдают очень и очень приличный результат. 

В этот раз я тестирую что-то что отличается от них. Возможно занимаюсь фигней и бесполезностями но почему бы и нет с другой стороны. Есть множество моделей основанных на Qwen - дистиллированые, а еще дообученные, еретики, и прочее - чаще всего частные непонятные поделки, с которыми тоже надо аккуратно - в модели вкладывают виручы и это уже существует. Есть такие же модели основанные на этом же квен, но от студий - это уже поделиями сложнее назвать, к ним больше уважения, хотя и они бывают манипулируют результатами бенчмарков (завышают свои, занижают чужие, вплоть до родительской квен 3.6 - видел такое что бенчмарк с другими результатми у нее, хотя чаще в карточках результаты 3.6 совпадают)

Собственно интересно что-то другое, как будто не похожее, и такое есть. LLama mistral уже тоже не интересно - эти на слуху и не плохие вроде (хуже квена как по мне) но уже мною протестированы ранее и не справлялись, впрочем новые версии жду и буду тестировать - это интересно. И вот есть например вот такое: https://huggingface.co/vectionlabs/Maestro1-9B (9b не думающая)

Итак результат ММ теста (мастермайнд - я для него уже сделал даже букмарклет чтобы не копировать и не вставлять каждый раз в окно llamacpp https://boolkin.blogspot.com/2017/03/pizza.html - после калькулятора букмарклеты чтобы и html получить и чтобы промпт вставить) - тест провален, зациклен, не рисуются кружочки. Тетрис тест (напиши игру тетрис на html, css, js одной страницей) тоже провален. Мои тесты по программированию специфичны, и скорее всего не совсем правильные потому что чисто по вебу, но тем не менее - легко тестировать. впрочем можно сделать то же самое для других языков. Короче эта модель провалилась (скорость 62 и 71 т/с на этих чатах)

От того же разработчика https://huggingface.co/vectionlabs/Salience-1.5-Nano (тоже 9b но думающая)

Тоже провалены оба теста, но ММ - выглядит интереснее и тетрис заготовка выглядит интереснее - но ничего не работает. тест с танками (Write a game similar to Battle City in a single HTML file without dependencies, running on desktop and mobile.) тоже не запустился - заставка красивая но пропадает курсор, второй раз кнопка нажималась но ничего не работало. 60т/с Эти 9б модели похуже чем квен 9б - тоже не годятся  вподметки - тот делал что-то хоть немного работающее, думаю завтра проверю еще раз чтобы убедиться

другой есть: https://huggingface.co/JetBrains/Mellum2-12B-A2.5B-Thinking-SFT (12б МОЕ думающий). 13 токенов в секунду (квен 35б быстрее работает)... ММ провален, тетрис тоже. тетрис 7+ тыс токенов, в конце такое:  // --- СОБНСТРАИВКА СОБЗАКОВ ---

ну и выбрал не ту модель, буду завтра доделывать

Комментариев нет:

Отправить комментарий