Skip to content
ai agents

Новое решение Microsoft для проблемного ИИ

ИИ-агенты блестяще справляются с кодом, но ужасно работают с визуализацией, что приводит к некорректным графикам и пустой трате токенов. Новый проект Microsoft показывает, что проблема не в интеллекте модели, а в языке, на котором мы заставляем её общаться.

Sol Aguirre
Новое решение Microsoft для проблемного ИИ

Геометрическая задача, которую не может решить ИИ

Большие языковые модели (LLM) часто спотыкаются там, где важна точность. Агенты могут управлять сложными серверными системами, но при этом с трудом справляются с, казалось бы, простой задачей: созданием визуализации данных. Типичный сбой заключается в том, что LLM генерирует сотни строк кода Vega-Lite для каскадной диаграммы, а в результате выдает пустую страницу или сломанный, непригодный для использования график.

Этот распространенный сбой подчеркивает фундаментальную дихотомию: смысл против геометрии. LLM превосходно справляются с семантическим пониманием, распознавая, что «этот столбец — месяц», а «тот — выручка». Они понимают суть данных. Однако они постоянно терпят неудачу при принятии точных геометрических решений, необходимых для функционального графика, таких как установка шага axis, определение доменов шкалы или настройка интервалов меток и цветовых градиентов.

Для пользовательских продуктов это не мелкий сбой, а критический недостаток. Например, собственный аналитический агент Microsoft достигал лишь 80% успеха при отрисовке графиков. Хотя 80% могут звучать приемлемо в некоторых контекстах, для конечных пользователей частота отказов один к пяти подрывает доверие и требует постоянного ручного вмешательства. Такой неприемлемый уровень успеха делает эту проблему критически важной для внедрения ИИ в бизнес.

Как Flint разделяет задачу

Flint перестраивает процесс генерации графиков, разделяя задачу на две отдельные части. Сначала LLM создает компактную, примерно 10-строчную semantic spec, фокусируясь исключительно на смысле. Она использует библиотеку Flint, содержащую более 70 semantic types — таких как «квартал», «цена» или «percentageChange» — для описания атрибутов данных, а не визуальной компоновки.

Во-вторых, детерминированный компилятор берет эту семантическую спецификацию и берет на себя полную ответственность за все геометрические решения. Этот слой точно определяет такие элементы, как размер шага оси, домены шкалы и интервалы меток, выдавая полную и корректную спецификацию для Vega-Lite, ECharts или Chart.js. LLM отвечает за смысл, компилятор — за математику.

Наблюдение за работой системы в действии раскрывает её элегантность. Изменение одного слова в семантической спецификации — например, замена тега столбца с 'quantity' на 'percentageChange' — мгновенно запускает каскад интеллектуальных дизайнерских решений. Компилятор автоматически выбирает расходящуюся цветовую палитру, переформатирует числовые значения и масштабирует ось, обеспечивая визуально подходящий и точный график без дальнейшего вмешательства LLM.

Настоящий план для будущих агентов

Flint выходит за рамки простого нового языка построения графиков. Он служит глубоким примером мощного, развивающегося паттерна, критически важного для создания надежных agentic systems. Эта архитектура отдает приоритет проверке и предсказуемости, выходя за рамки присущей монолитной генерации ИИ хрупкости. Это план того, как ИИ может стабильно выдавать результат, а не просто предлагать варианты.

По своей сути паттерн элегантно прост, но глубоко эффективен: LLM генерирует небольшое, поддающееся проверке Intermediate Representation (IR). Это краткое IR, часто состоящее всего из 10 строк JSON, описывающих семантический смысл, затем поступает в Deterministic Execution Layer. Этот слой, полностью отделенный от LLM, обрабатывает все геометрические решения и точную отрисовку, эффективно изолируя конечный результат от галлюцинаций модели.

Такое разделение ответственности дает критическое преимущество в надежности. Можно легко проверить 10 строк JSON IR от Flint, убедившись в их соответствии конкретным семантическим типам (например, 'quarter', 'price'). Такая быстрая программная проверка гарантирует, что намерение LLM правильно зафиксировано до начала отрисовки. Это резко контрастирует с практически невыполнимой задачей надежной проверки более 100 строк необработанного сгенерированного кода D3 или Vega-Lite, где одна пропущенная скобка может сломать всю визуализацию.

Эта архитектура — LLM для определения намерений, детерминированная система для исполнения — представляет собой значительную эволюцию в инструментарии ИИ. Это прагматичный путь к агентам, которым мы можем доверять, а не просто восхищаться. Для более глубокого понимания этой философии проектирования ознакомьтесь с Flint: A visualization language for the AI era - Microsoft Research Blog. Этот подход обещает открыть путь к созданию гораздо более надежных и проверяемых ИИ-приложений в различных областях.

Нравится статья? Получайте такие каждое утро на почту.

одно письмо в день · отписка в два клика · без сторонних трекеров

Проверка реальностью: обещания против продакшена

Flint остается ранним исследовательским проектом, в настоящее время находящимся на стадии v0.2, с известными ошибками, из-за которых спецификации отображаются по-разному в разных бэкендах. В нем отсутствует пакет Python для нетерпеливых разработчиков и не хватает критически важных функций:

  • карты
  • 3D
  • сетевые графы
  • многослойность

Доступность, фундаментальный вопрос, остается пустым тикетом на GitHub.

Опытные пользователи, использующие передовые модели, часто могут создавать простые графики с первой попытки, из-за чего Flint кажется избыточным для их нужд. Его истинная ценность проявляется при работе с более мелкими и дешевыми моделями или при создании сложных графиков, таких как водопадные диаграммы (waterfalls) и диаграммы «солнечные лучи» (sunbursts). Для продуктов, требующих надежности 99%+, где 80% успеха недостаточно для конечных пользователей, детерминированный подход Flint незаменим.

Несмотря на свою начальную стадию, Flint демонстрирует значительный потенциал. Более 5000 еженедельных загрузок из NPM подчеркивают интерес разработчиков. Важно отметить, что он уже используется во внутреннем инструменте Microsoft Data Formulator, что свидетельствует о сильной внутренней поддержке и валидации. Этот проект является примером новой модели в работе агентов: LLM генерируют небольшое, проверяемое промежуточное представление, а затем детерминированный слой берет на себя сложное и точное исполнение.

Часто задаваемые вопросы

Что такое Microsoft Flint?

Flint — это новый язык построения графиков, в котором ИИ-агент определяет «смысл» данных в простой спецификации, а детерминированный компилятор берет на себя сложную «геометрию» для надежной генерации графиков для таких бэкендов, как Vega-Lite или ECharts.

Чем Flint отличается от Vega-Lite?

Flint не является заменой Vega-Lite; он компилируется в него. Он выступает в качестве абстракции более высокого уровня, которая позволяет LLM описывать, «что» представляют собой данные, в то время как компилятор Flint берет на себя громоздкий геометрический код, в котором LLM часто ошибаются.

В чем главное преимущество подхода Flint?

Его главное преимущество — надежность. Разделяя смысл и геометрию и используя небольшую, проверяемую спецификацию, он значительно повышает уровень успеха графиков, созданных ИИ, стремясь решить проблему, при которой каждый пятый график, созданный непосредственно LLM, оказывается нерабочим.

Готов ли Flint к использованию в продакшене?

Flint — это исследовательский проект на ранней стадии (v0.2). Хотя он используется в инструменте Microsoft Data Formulator, в настоящее время у него нет пакета Python и расширенных функций, таких как карты или 3D-графики, поэтому он лучше всего подходит для конкретных случаев использования, где надежность графиков имеет решающее значение.

Found this useful? Share it.

For builders

Want Stork to write one of these about your product?

Send us a URL. We use the product, form a view, and publish what we actually think — in 8 languages, labeled Sponsored, with no copy approval on your side. That last part is what makes it worth quoting.

See how it works$500 · AI tools & software only