пятница, 25 сентября 2026 г.

Как заставить ИИ играть в игры

Один товарищ на работе делает разные интересные штуки с ИИ, и от него узнал давно еще что можно подключить ИИ к своему браузеру и он сможет взаимодействовать с сайтами и приложениями в браузере. Он назвал это расширение chrome dev tools. Так как у меня firefox, то я понял что мне для этого требуется firefox dev tools. Я не уверен что они работают одинаково хорошо, есть подозрение что хром работает получше, просто потому что им пользуются больше и там быстрее чинятся баги и добавляются фишки, но у меня мозилла. Возможно есть смысл перейти снова на винду и там работать с ИИ, я же последнее время в убунту сижу. 

Почему раньше не делал такое? Потому что мне казалось это сложным, оно и до сих пор сложно, но благодаря тому что есть нейронки, это делается сильно легче. Началось все с того что попросил в Opencode у BigPickle как настроить это расширение, причем вышел на это расширение через несколько итераций других. Кажется я скинул ему строку запуска и адрес где нашел такую конструкцию 
    "mcp": {
        "firefox": {
            "type": "local",
            "command": ["npx", "-y", "@mozilla/firefox-devtools-mcp", "--connect-existing", "--marionette-port", "2828"],
            "enabled": true
        }
    }

он прописал этот конфиг у себя в конфиге, перезапустил приложение, и после этого оно должно подтянуться, но я не уверен, возможно пришлось делать npx install (чего я только не делал)


Чтобы ИИ мог играть в игру нужн озапустить браузер в этом режиме (марионетка и на скрине видно что адресная строка стала красной - в режиме). Вот команда для запуска: ВАЖНО! Запускать из папки с игрой, иначе будет ругаться что нет доступа. В общем лучше из той же папки

firefox --marionette --remote-debugging-port

После этого открываю заново Opencode (чтобы он запустил mcp сервер, можно вручную npx -y @mozilla/firefox-devtools-mcp --connect-existing --marionette-port 2828) пишу ему сыграй в игру, объясняю правила - и он играет и выигрывает. И я снова вижу что 35b и 26b МОЕ модели снова хорошо справляются с задачей а маленькие модели нет. 

Проблема OPencode в том, что после запуска 12000 токенов съедаются сразу на внутренние инструкции - и поэтому я захотел запустить этот MCP сервер для обычной llamacpp. И это можно сделать, для этого создается mcp.json

{
  "mcpServers": {
    "firefox": {
      "command": "npx",
      "args": ["-y", "@mozilla/firefox-devtools-mcp", "--connect-existing", "--marionette-port", "2828"]
    }
  }
}

 Запустить браузер в режиме марионетки и птом запустить llamacpp с таким флагом: 

  --mcp-servers-config mcp.json

 и еще включить встроенный тулзы --tools all чтобы указать папку с игрой и он мог ее запустить.


 

вторник, 22 сентября 2026 г.

UDP передача на Siemens PLC унифицированный блок

Я писал когда-то инструкцию (сделанную по видео из интернета, которое в свою очередь было сделано на основе инструкций от Сименса) по настройке связи по TCP для ПЛК Сименс. Там использовался язык laddar diagram и стандартные блоки. Но проблема в том что при добавлении в новый проект такого функционала эти блоки снова надо накидывать по одному, а хочется просто в пару кликов добавить готовый FB блок и уже с ним работать. Благо такое уже придумали, нужно просто получить такой блок. Но проблема оказалась в том что с сайта сименса заполучить его та еще проблема, у меня были такие блоки давным давно скачены, поэтому я поделюсь ими и здесь. Но и это еще не все. Сименсовские блоки показались мне перегружены лишними входями и не очевидными настройками для IP адресов (но если читать инструкции то все очевидно), поэтому я решил сделать что-то свое что мне кажется интереснее. Мало того для генерации пульсов я добавил таймер, а не как это обычно принято в сименсе программистами специальный тактовый бит - мне кажется это правильнее. Весь блок пишется в SCL и тогда его можно легко экспортировать как Source файл (исходник). Дело в том что если накитывать все это в LADDER то он не дает экспортировать в исходник потому что используются блоки для коммуникации которые защищены ноухау защитой - а в scl формате такого сообщения нет. 

Чем удобно scl еще в совремнных реалиях - его очень хорошо понимают нейронки и могут по коду дать кучу замечаний и даже исправить их. Я так делал - просил придумать более правильные названия для переменных (результат не сильно понравился ну да ладно), просил добавить комменты, перевести их на русский. Свой последний вариант скормил Квену - и он нашел еще 23 замечания. Некоторые не существенные, некоторые интересные, если делать по уму, то пожалуй надо сделать и их, но мне уже стало лень, хочется просто поделиться наработками. 

Ну и да. Чтобы мой блок или сименс блок встроить в проект, нужно экспортировать исходный текст и сгенерировать блок, а чтобы использовать, перенести этот блок в свою программу и заполнить входа (даже выхода не обязательно):


четверг, 3 сентября 2026 г.

Еще тесты нейронок

Недавно стукнула в голову моча и решил сделать букмарклет для подсчета скорости инференса (генерации) для LLM в llama.cpp. В процессе проверки, удивился что мой тест прошли почти с первого раза модели от бартовски - этому не придал особое значение, но потом когда читал статью про ЛЛМ встретил тоже такое что модели то в принципе разные - разные кванты и все прочее. Поэтому захотелось потестировать и это предположение. Беру разные модели с одинаковым квантом и тестирую на одном промпте.

 Это не окончательная статья, просто хотелось бы зафиксировать промежуточный результат и то что получилось, потому что есть некоторые наблюдения

Пока что 2 модели и в них в таблице видно разницу в архитектуре. Модель Бартовски это еще и встроенная драфт модель. Вот поэтому и хочу написать промежуточные результаты, что проверил заодно и скорость с драфтом потому что с 3 и больше вылетает, а с 1 и 2 разные скорости (добавлю в таблицу)

--spec-type draft-mtp --spec-draft-n-max 2

Что еще хотел сказать. Тот раз я проверял с увеличенным контекстом и мне подумалось что так лучше, что раз он дает с первого раза работающую игру. Но все оказалось не так просто - прогоны с увеличенным конетекстом и сейчас как будто лучше визуально и даже сделали одну +- играбельную игру, но что-то все это на уровне погрешности как будто.

В общем пока такая таблица, буду проверять модели Unsloth завтра


 

 

среда, 5 августа 2026 г.

Проверяем клоны Квена и сам Квен

Снова тест нейронок. Как я уже и говорил на моем ПК на сносной скорости я научился запускать МОЕ модели на 35-26мрдр параметров. Можно и больше наверное, но в основном в проде именно такие. Конкретно это Qwen/Qwen3.6-35B-A3B и google/gemma-4-26B-A4B-it из последних, есть еще zai-org/GLM-4.7-Flash (30B-A3B). Среди основы для новых моделей на HF чаще используют именно квен, и сегодня я решил протестировать их. База та же 35B-A3B - правда бывают версии на базе версий 3.5 и 3.6 и не всегда это очевидно где какая. Все модедели прогоняю на одинаковых промтах, мастермайнд - моя заготовка, тетрис: "напиши игру тетрис на html, css, js одной страницей" и есть промпт для игри танки: "Write a game similar to Battle City in a single HTML file without dependencies, running on desktop and mobile". Все модели запускаю с такими параметрами /mnt/xxx/llama/llama-server -m "/mnt/zzz/_models/Salience-1.5-Pro.Q4_K_M.gguf" -c 65536 -cmoe -fa on --temp 0.6 --top-p 0.95 --top-k 20 --min-p 0.00

Таблица с тестами https://boolkin.gitverse.site/html/Vibe/LLM_test/LLM_test.html 

Сайт с играми https://boolkin.gitverse.site/html/Vibe/LLM_test/ 

Статья на Хабре https://habr.com/ru/articles/1068416/ 

https://huggingface.co/FrontisAI/Frontis-MA1-35B-GGUF

На базе 3.6 с хорошими бенчами. Бенчи бывает тоже вызвают вопросы, возможно потом напишу об этом больше. Тесты: 

Мастермайнд по моему запросу: 2 запроса, первый запрос игра играется, но есть огрехи с нажатием кнопки и "прилипанием" истории, вторым исправил это. (6357 + 12888 токенов, средняя скорость 26т/с, время 3:56 + 8:10 минут). Тетрис неплохого вида за 1 запрос (на самом деле 2 потому что самый первый остановил - я увидел что он начал тупо писать код в раздумиях). (7157 26 т/с 4:41 минут). Танки получились неплохого вида, проезжают сквозь препятствия. (7417 26 т/с 4:47 минут)

https://huggingface.co/InternScience/Agents-A1-Q4_K_M-GGUF

на базе какой версии сделан не понятно, бэнчи показывают что 3.6 обгоняет. 

Мастермайнд тоже 2 запроса - первый с косяками, играть можно. Вторым исправил размер шаров в панели управления и "прилипание", не исправил серый цвет в попытке. (6001 + 8844, 3:45 + 5:52, 25-26т/с). Тетрис выглядит сильно проще, и по сути со второго запроса (заново), так как первый не рисовал падающие фигуры. (3837, 2:24, 27т/с). Танки выглядят тоже похуже, огромные квадраты, но вполне играбельно, штаба нет (7191, 4:29, 26,6т/с)


https://huggingface.co/mradermacher/Salience-1.5-Pro-GGUF

Тоже умалчивают на базе какой версии сделали, бэнчей нет. Мастермайнд с первого раза - отличный дизайн, все без нареканий по ТЗ (5539, 3:27, 26,7 т/с). Тетрис первым запросом не играбельный, кнопку играть жмешь на заставке и ничего не происходит (6232, 3:54) Второй новый запрос - играбельная игра c  совремнным визуалом (правда сброс на пробеле перезапускает игру) (5436, 3:22, 26,8т/с). Танки получились не играбельными хотя очень навороченные поидее - там анимации, трава, вода, броня, танк проезжает сквозь все препятствия а ощющение будто бы поле недорисовано - есть бонусы, бомбы и прочее, врагов не увидел. Играть не возможно, хотя по размеру и задумке навероченное что-то. (13577, 8:39, 26т/с). Попробовал второй новый запрос и он сделал все тоже глобально и мощно, но не играется (не реагирует на кнопки, ничто не двигается, в тот раз хоть что-то двигалось), огромный танк с маленькими кирпичами и прочим... 8 минут 12600 токенов.

https://huggingface.co/unsloth/Ornith-1.0-35B-GGUF

На базе 3.5 вроде. Мастер майнд симпатичный с первого раза, но кнопка новая игра как-то странно смещена и растянута, не стал просить исправлять (6039, 3:43, 27т/с). тетрис с первого раза, но как-то глючно, не стал просить исправлять. Опускаешь но не фиксируется пока пробел не нажмешь. После убирания слоя следующая фигура не появляется или появляется с глюком и тоже пока не нажмешь пробел. Играть можно но результат такой себе, учитывая что бывали и лучше, правда тоже не спервого раза, но с одного запроса. Визуал неплохой. (5733, 3:39, 26,3т/с). А вот Танки прям поразили, я думал все пиши пропало - пишет и пишет код, но он сделал супер навороченную и играбельную игрую - все движется, работает, есть звуки, бонусы - все это работает великолепно. Я поражен. (21324, 13:55, 25-26 т/с)

 UPD. раз в год и палка стреляет и это именно тот случай (вообще все эти случаи на данный момент, наверное более правильно прогонять каждый промпт по 2 раза) В общем я усомнился в способности делать такую работу каждый раз, запустил модель еще раз и ввел тот же промп. Как и ожидалось модель не справилась - все разы кода много 12к+ токенов, но толку мало. первый запрос пустое поле без карты и врагов, второй - черный экран потом что-то мигает евелится непонятно. третий - можно поиграть - гонять танк, стрелять по кирпичам (пули вылетают сбоку танка), но враги не двигаются, не стреляют, не убиваются, зато есть звук... :


 https://huggingface.co/unsloth/Qwen3.6-35B-A3B-MTP-GGUF

MTP версия ускоренная при помощи втроенной драфт модели, выдает больше скорость. Мастермайнд - Все работает, все по тз с первого раза, вид классный (6 789 tokens, 3 минуты, 37,5т/с). Тетрис в этот раз с косяком - только появляется палка и сразу гейм овер. (7 016 tokens, 3 минуты, 39,6т/с), попросил исправить, надумал 9 904 tokens, 4min 36s, 35.77 t/s - иправил но фигуры стали цветные теперь... и стали летать с бешенной скоростью(. Не играбельно. Даю последний шанс абсолютно новый запрос. Сработало. без звука в этот раз но играть можно (6 236 tokens,2min 35s, 40.05 t/s). Танки после предыдущего не прям вау, но все же играбельно (слабо, потому что штаб не защищен и всего одна жизнь) но что нравится что уровень генерируется разные каждый запуск - это особенность квена - одна из других предыдущих попыток тоже было также - генерация рандомных уровней, мне тогда понравилось. (10 973 tokens, 4min 51s, 37.71 t/s)


https://huggingface.co/bartowski/Kwaipilot_KAT-Coder-V2.5-Dev-GGUF

По бенчам уделывает Квен на раз два. Проверим. Причем по бэнчам он Квену приписал свои странные цифры которые не бьются с оригинальными, и в бенчах есть еще и Ornith по которым которого он тоже разносить с пухом. ММ 1 попытка, хороший визуал, анимации. (5 766 tokens, 3min 33s, 27.05 t/s) тетрис с первого раза, визуально совремнно, цвентно и работает (4 907 tokens, 3min 6s, 26.25 t/s) Танки - выглядит тоже неплохо, но проблема в том что как только пуля в кирпич попадает игра зависает при этом мой танк рендерится внутри кирпича. Попросил исправить, сломал все, при том что генерировал отдельно только js код. Сделал третью попытку. Ну тоже мало играбельная - одну пулю выпустил и все, больше нет. 9 851 tokens, 6min 20s, 25.92 t/s. В общем на первое место не тянет. (Все-таки решил дать шанс и он исправил игру. Починил все сам - пули стреляют, оверлей с началом игры пропадает но не полностью кнопка загараживает вид) играть сложно - все разносят. Но это и интересно. Короче пока на этом все. 

https://huggingface.co/unsloth/GLM-4.7-Flash-GGUF

Странно что он 30B-A3B - то есть активных параметрров столько же и даже меньше общих, но работает медленнее. тест MM не идельно, вид интересный, но есть нарекания к сортировке истории и нумерации попыток при том что один из предыдущих разов с первого раза по тз почти (было нарекание по прилипанию) (5 625 tokens, 5min 4s, 18.48 t/s) решил доделать, появились номера, но сортировка страдает(6 574 tokens, 5min 58s, 18.32 t/s). Тетрис - вид попроще чем у некоторых. В этот раз сгенерировал с первого раза ( почему говорю в этот раз, потому что пару дней назад это было со второго раза, но в той игре был классный звук зато, хотя и вид такой же простецкий немного, там заставка не исчезала после начала игры, вторым запросом испраился). В этот раз все норм, вид такой же по-проще как и говорил, играет. По токенам и времени +- одно и тоже, в этот раз меньше токенов (видимо из-за отсутствия звуковых эффектов) (6 411 tokens, 5min 56s, 18.00 t/s) Танки - прям видно что китайская нейросеть - думала и писала по-китайски, в игре все подсказки и слова на китайском. Игра работает, есть звук, можно играть. Танки простые но танки, кирпичи ломаются, скозь них никто не ездит. Норм, прям неплохо, лучше кадрата однозначно, на уровне фронтис, но вид чуть хуже, зато есть звук и сквозь кирпичи не ездит. (8 826 tokens, 7min 59s, 18.39 t/s)  

https://huggingface.co/unsloth/gemma-4-26B-A4B-it-GGUF

Тоже MTP с драфт моделью. Мастермайнд с первого раза, хороший визуал (6 369 tokens, 3min 50s, 27.65 t/s). Тетрис, с первого раза - визуал простецкий, но все работает (4 291 tokens, 2min 33s, 28.01 t/s). Танки простецкий вид, но интересно что пушка в виде точки - простые квадраты но стильно. Первый раз сгенерировал неиграбельную игру, танки не ездили, мой танк при выстреле сразу геймовер потому что спавнился на базе и пуля уничтожала базу. Вторым запросом починил косяки. перестраховался и своей пулей не могу уничтожить штаб. В остальном мило играбельно. (5959+10079, 3:22+5:58, 29-28т/с)

https://huggingface.co/unsloth/gpt-oss-20b-GGUF

gpt-oss-20b — for lower latency, and local or specialized use cases (21B parameters with 3.6B active parameters). MM первый не рабочий, второй норм, в базу сойдет. 2 966 tokens, 2min 55s, 16.94 t/s. тетрис с первого раза, но с глючками. не уверен что стоит заморачиваться исправлять. 2 664 tokens 2min 41s 16.46 t/s. танки на выходе второй, первый менее интересный поэтому перегенерировал, но конечно таки с большой натяжкой, но как-то играть и очки нарабатывать можно. 3 066 tokens, 3min 6s, 16.47 t/s

среда, 29 июля 2026 г.

Еще соревнования нейросетей

 Ну это больше про аутсайдеров. Кстати нейронки сбера и алисы наконец-то научились проходить мой тест - алиса раньше тупо недописывала код, сбер делал малоиграбельную игру. Но вот пару недель назад тесты были пройдены, но это ожидаемо - когда-то это должно было произойти, просто потому что локальные моделди квен и гемма на 35 и 26 млрд параметров запускаются у меня на ПК с приличной скоростью (больше 20-30 т/с) и выдают очень и очень приличный результат. 

В этот раз я тестирую что-то что отличается от них. Возможно занимаюсь фигней и бесполезностями но почему бы и нет с другой стороны. Есть множество моделей основанных на Qwen - дистиллированые, а еще дообученные, еретики, и прочее - чаще всего частные непонятные поделки, с которыми тоже надо аккуратно - в модели вкладывают виручы и это уже существует. Есть такие же модели основанные на этом же квен, но от студий - это уже поделиями сложнее назвать, к ним больше уважения, хотя и они бывают манипулируют результатами бенчмарков (завышают свои, занижают чужие, вплоть до родительской квен 3.6 - видел такое что бенчмарк с другими результатми у нее, хотя чаще в карточках результаты 3.6 совпадают)

Собственно интересно что-то другое, как будто не похожее, и такое есть. LLama mistral уже тоже не интересно - эти на слуху и не плохие вроде (хуже квена как по мне) но уже мною протестированы ранее и не справлялись, впрочем новые версии жду и буду тестировать - это интересно. И вот есть например вот такое: https://huggingface.co/vectionlabs/Maestro1-9B (9b не думающая)

Итак результат ММ теста (мастермайнд - я для него уже сделал даже букмарклет чтобы не копировать и не вставлять каждый раз в окно llamacpp https://boolkin.blogspot.com/2017/03/pizza.html - после калькулятора букмарклеты чтобы и html получить и чтобы промпт вставить) - тест провален, зациклен, не рисуются кружочки. Тетрис тест (напиши игру тетрис на html, css, js одной страницей) тоже провален. Мои тесты по программированию специфичны, и скорее всего не совсем правильные потому что чисто по вебу, но тем не менее - легко тестировать. впрочем можно сделать то же самое для других языков. Короче эта модель провалилась (скорость 62 и 71 т/с на этих чатах)

От того же разработчика https://huggingface.co/vectionlabs/Salience-1.5-Nano (тоже 9b но думающая)

Тоже провалены оба теста, но ММ - выглядит интереснее и тетрис заготовка выглядит интереснее - но ничего не работает. тест с танками (Write a game similar to Battle City in a single HTML file without dependencies, running on desktop and mobile.) тоже не запустился - заставка красивая но пропадает курсор, второй раз кнопка нажималась но ничего не работало. 60т/с Эти 9б модели похуже чем квен 9б - тоже не годятся  вподметки - тот делал что-то хоть немного работающее, думаю завтра проверю еще раз чтобы убедиться

Второй раз переписываю.... Короче квен 3.5 9б не умнее, тоже не проходит тесты, просто один раз 9б модель сделал а мне играбельную игру ММ, но это было буквально один раз, после этого игры были не играбельные. То же касается и другой модели, Бонзай, о чем будет ниже

другой есть: https://huggingface.co/JetBrains/Mellum2-12B-A2.5B-Thinking-SFT (12б МОЕ думающий). 13 токенов в секунду (квен 35б быстрее работает)... ММ провален, тетрис тоже. тетрис 7+ тыс токенов, в конце такое:  // --- СОБНСТРАИВКА СОБЗАКОВ ---

ну и выбрал не ту модель, буду завтра доделывать. Смысл в том что я выбрал SFT - дообученная но промежуточно (на самой карточке модели сами разрабы пишут Supervised thinking checkpoint) конечноый продук это Thinking. Я ее скачал, тоже запустил но лучше не стало те же 16 т/с но ничего рабочего да еще и разметку на тетрисе криво сделала. В общем удалять и не вспоминать. 

Теперь про Бонзай. Проверял модель 27б Ternary-Bonsai-27B-Q2_g64.gguf

Нужна именно с g64, остальные не запустились (у меня видеопамяти всего 8гб, а модель весит 7.6 Гб причем чтобы запустить ее пришлось перенести часть слоев в ОЗУ -ngl 55 при этом скорость 6 т/с) Эта модель смогла сделать играбельную игру, с уникальным дизайном, правда подсчет быков и коров был не правильный. Сделала тетрис, но там видимо было зацикливание - игра не зупастилась при том что начинает гудеть процессор. Еще у этих моделей есть драфт модели которые имеют меньший размер. 


  Есть еще просто https://huggingface.co/prism-ml/Bonsai-27B-gguf

Тоже 27б но 1 битное квантование (тернари 3 бита) запустилось без проблем  37 т/с, но задачу почти не выполнила. Было всего один раз на рабочем ноуте сделала в принципе работающий тестрис в котором не работал поворот фигур. Вторым промптом попросил указать как сделать поворот (при чем переписывая весь код все напрочь ломалось) заменив нужные блоки - поворот заработал но не шибко хорошо. В общем однозначно глупее, но тем не менее возможно поумнее квена 9б... хотя как сказать у того тоже один раз стрельнуло, о чем писал выше. ЗЫ (на моем ПК снова тетрис были фигуры и двигались но криво косо, не вращались, и в процессе падения квадратные точки... короче такое себе)

Ну и понравилась скорость 8б модели - да игры не делает (делает не рабочие) но зато скорость 122-116 т/с. На этом пока все. Дальше будут еще 

И все-таки дополню. Откровение. модель Nanbeige_Nanbeige4.2-3B-Q8_0.gguf - сделала вполне играбельную игру. Думала на 8 тыс токенов, но в итоге уложилась в 16 тыс. Скорость 43 т/с. Тетрис фигуры падают, вращаются, но не ложатся на пол. Удивительно, но кажется можно доделать. (доделала, я выложу потом результат. Написал ей "хорошая работа! но фигура не ложится на пол, как будто бесконечно падает. поэтому не появляется следующая, а если ронять по харду, то сразу окно что проиграл" и она прислала исправленную играбельную игру в которую нельзя проиграть))) 3млрд параметров, подумать только. Надо тестировать Q4 
PS Не смог пойти спать и проверил Q4 - 60-70 т/с и ММ играбельная снова... по крайней мере можно довести комбинацию до угадывания. Тетрис аналогично. Лишняя скобка, которую удалил и фигуры стали падать, и поворачиваться (правда хуже чем Q8 версии) В общем это реально повторяемый эксперимент - это реально очень умная модель... Удивлен.

среда, 6 мая 2026 г.

Соревнования нейросетей. Снова

 Я просто все еще в шоке с того что на локальном ПК можно запустить локальные нейрости и они будут работать вполне неплохо. Как минимум тот тест что я придумал для них они уже проходят довольно легко. Допустим я проводил не так давно тест больших нейронок на своем запросе про mastermind https://pikabu.ru/story/sdelal_igru_mastermind_pri_pomoshchi_besplatnyikh_neyrosetey_13733435

Там я писал как все начиналось и первую игру делал сам, потом вторую игру делал в qwen в прошлом году в августе 3 дня, потом я придумал неплохой промпт для того чтобы получить что-то похожее, и когда скормил его на ai arena то получил сходу готовую к употреблению игру при помоще клод 4.6. В тот момент я понял что нейросети продвинулись очень вперед и могут делать это за один запрос. Тогда я сделал тест бесплатных нейронок, и результат этого теста описал в той статье. Все это время я не терял надежды получить похожий результат на локальных LLM и вот сейчас это пишу потому что смог этого добиться - когда вышел квен 3.5 один раз (из нескольких) он мне сделал играбельную игру и почти без доработок (вообще доработать в локальной llm будет наверное та еще боль, в ней я запускаю с контекстом 8000-18000 то есть сильно не развернуться - допустим в первый раз где доделывал 3 дня я наверняка потратил с полмиллиона контекста, хотя и хз, уже и не узнать)

четверг, 19 марта 2026 г.

Тест нейросетей 2

 Ну или 3 или 5, я их постоянно тестирую. Но в этот раз локальные модели Qwen. В связи с тем что собрал новый комп с более-менее мощной картой 3070, получается сейчас можно запускать квантованые модели на 9 млрд параметров а это уже совсем другой уровень. Возможно. Это и предстоит выяснить. На давнный момент вышла версия квен 3,5 - это хорошая модель, думающая. У меня на карте выдает 60т/с llama cpp cuda. Почему-то вулкан не запустился ну да лаждно. Это модель 9b. 

Собственно о чем я хотел сказать, новая модель действительно лучше - она видит и понимает картинки лучше, я скидываю ей задачу и у нее пол
учается ее верно решить (но со второго раза когда уточнил что на картинке есть квадрат). А вот квен3 эту картинку никак не может распознать и думает что квадрат это треугольник разделенный точкой по гипотенузе. Кстати на скрине она тоже увидела что это диагональ, хотя это наверное и есть диагональ в некотором роде, но все же точнее это гипотенуза. Тем не менее правильный ответ 3 она дала, и поняла когда уточнил что треугольник египетский.

В общем покуда получается запускать с лучим результатом 9b модель, то пожалуй на ней и остановлюсь пока что. А сегодня проверял такое еще, но они как и говорил хуже видят. (я хотел проверить 4b оказалось проверил и в этой задаче квадрат увидел как треугольник, то есть он подумал 4 м2 это площадь треугольника):