Французький розробник прагне вирішити проблему сліпоти ботів, щоб вони могли зрозуміти графічний інтерфейс

Французький розробник прагне вирішити проблему сліпоти ботів, щоб вони могли зрозуміти графічний інтерфейс



Французький розробник прагне вирішити проблему сліпоти ботів, щоб вони могли зрозуміти графічний інтерфейс

ai і ml

Тому що інколи, щоб втекти зі свого ящика, потрібно натиснути кнопку

Більшість LLM добре відповідають на запити, але не вистачають, коли справа доходить до навігації по робочому столу в Windows або Linux. Французька AI dev H модель у понеділок представила пару моделей використання комп’ютера, зосереджених на обробці графічних інтерфейсів користувача (GUI).

За всю історію комп’ютерної техніки використання комп’ютера в основному поділялося на три категорії: інтерфейси командного рядка (CLI), інтерфейси прикладного програмування (API) та GUI. Агенти штучного інтелекту можуть легко підключатися до перших двох, але навігація серед настільних комп’ютерів і додатків, які часто віддають перевагу формі над функціями, залишається постійною проблемою.

Сімейство моделей H Holo 4 має на меті вирішити цю проблему, дозволяючи відносно невеликим, але потужним моделям обробляти всі три сценарії використання комп’ютера, включаючи вказівку, клацання, прокручування та введення через графічні інтерфейси, які спочатку були призначені для нас, м’ясних мішків.

Holo 4 побудовано на моделях Alibaba Qwen 3.8 27B і Qwen 3.6 35B-A3B, налаштованих за допомогою навчання під наглядом і навчання з підкріпленням. Завдяки оптимізації CLI, API та GUI компанія H стверджує, що її моделі отримують більше можливостей, ніж звичайні настільні моделі. Разом із Holo 4 H також оновив свою модель Holotron, яка базується на Nemotron 3 від Nvidia, з подібними можливостями.

В одному прикладі компанія продемонструвала Holo 4 27B, який використовує функції макросів FreeCAD для програмного проектування 3D-моделі Ейфелевої вежі, а не вручну за допомогою примітивів, таких як куб. В іншому шоу H сфотографував її, використовуючи екструдовані форми, щоб відтворити логотип компанії, демонструючи гнучкість моделі.

Як і у випадку з будь-якими тестами моделювання, сприймайте ці твердження з недовірою, але якщо вірити H, Holo 4 перевершує передові моделі, як-от OpenAI, за використання незначної кількості параметрів.

Цікаво, що це не означає, що вони дешевші. Фактично, хоча компанія отримує вищі бали, у багатьох випадках моделі коштують дорожче за завдання. Враховуючи те, що ми знаємо про Qwen 3.8 27B, це, ймовірно, пов’язано з тим, що Holo 4 використовує більше токенів «мислителя» для кінцевого результату, ніж щось на кшталт GPT 6 Luna, який не так добре працює в OSWorld 2.0, але коштує набагато дешевше.

Зважаючи на це, невеликий розмір вагових моделей з відкритим вихідним кодом означає, що дослідники, ентузіасти ШІ та підприємства повинні запускати їх на відносно скромному обладнанні. Nvidia RTX 3090 на 24 ГБ має бути більш ніж здатна працювати з цими моделями з 4-бітною точністю.

H явно очікує, що користувачі зроблять це, оскільки поряд з вагами BF16, FP8 і NVFP4 він також зробив версію GGUF Llama.cpp (а також розширення LM Studio та Ollama), доступною для завантаження на Hugging Face.

Модель розробника каже, що вона також планує випустити ваги з проекту DSpark, щоб пришвидшити висновок за допомогою техніки, яка називається наближеним декодуванням. Раніше ми досліджували цю техніку для покращення продуктивності логічного висновку, але коротко кажучи, вона використовує невелику модель для наближення результатів більшої моделі. Коли він працює, користувачі відчувають прискорену обробку та генерацію символів, а якщо це не так, він повертається до базової моделі, що гарантує відсутність втрати якості результату.

Однак моделі без рукавичок багато чого не варті. H розробив кілька агентських інструментів, включаючи HAI-Agents з відкритим кодом, який доступний для завантаження на GitHub. Однак теоретично моделі повинні працювати зі сторонніми обчислювальними інструментами.

H — не єдина модель розробки, орієнтована на комп’ютерні програми. Минулого року на конференції AWS Re:Invent компанія анонсувала набір моделей використання комп’ютерів. Тим часом три великих американських модельних лабораторії OpenAI, Google і Anthropic, також інвестують у цю можливість, можливо, тому, що іноді потрібно натиснути кнопку, щоб вийти з їхньої коробки. ®



Source link

Leave a Reply

Your email address will not be published. Required fields are marked *