Skip to content
research

ИИ без секретов: 16 идей, которые объясняют всё

За шумихой вокруг ИИ скрывается практическая система — и несколько дорогостоящих заблуждений. Как только вы поймете, как связаны все элементы, хайп станет легче подвергать сомнению, а инструменты — проще в использовании.

Aki Tanaka
ИИ без секретов: 16 идей, которые объясняют всё

«Диалог» — это просто повторяющиеся токены

Large Language Models (LLMs) генерируют текст, предсказывая по одному токену за раз, снова и снова, пока не завершат ответ. Этот механизм фундаментально отличается от человеческого понимания, но позволяет создавать удивительно сложные результаты. «Диалог» — это не истинное понимание, а вероятностный танец статистических ассоциаций.

Перед обработкой входной текст проходит токенизацию, при которой он разбивается на общеупотребительные слова и части слов. Например, слово "unbelievable" может быть разбито на "un", "believe" и "able". Один токен в среднем составляет около трех четвертей слова. Количество токенов напрямую влияет на стоимость API, лимиты контекстного окна и иногда на задержку. Изучите этот процесс с помощью OpenAI’s Tokenizer или обзора токенизаторов от Hugging Face.

LLMs по своей природе stateless (не сохраняют состояние); они не обладают встроенной памятью между запросами. Когда кажется, что чат-интерфейс «помнит» прошлые взаимодействия, он достигает этого путем повторной отправки всей истории переписки (или соответствующих сохраненных фактов) с каждым новым запросом. Это потребляет ценное пространство контекста и напрямую увеличивает расход токенов.

Внутри Transformer: веса, внимание и обучение

Под поверхностью предсказания токенов скрывается сложная архитектура. Представьте это как расчет стоимости дома: введите размер (1000 кв. футов), умножьте на вес (скажем, 300) и получите результат ($300 000). LLMs масштабируют этот процесс, выстраивая сотни слоев с тысячами «нейронов» для обработки гораздо более сложных паттернов. Эти миллиарды весов, называемые в совокупности параметрами, фиксируются во время вывода, но корректируются во время обучения.

Буква «T» в GPT означает Transformer, и его ключевым нововведением является attention (механизм внимания). Представьте слово "bank": его значение кардинально меняется в зависимости от контекста — "берег реки" (river bank) или "финансовый банк" (financial bank). Механизм внимания позволяет каждому токену динамически оценивать важность других токенов во входной последовательности, проясняя смысл путем связывания "bank" с "river" или "money". Этот механизм, представленный в фундаментальной статье "Attention Is All You Need", предотвращает обработку токенов в изоляции.

Конвейер обучения включает в себя несколько этапов. Pre-training (предварительное обучение) начинается со случайных весов, где модель предсказывает пропущенные токены и корректирует свои веса с помощью backpropagation (обратного распространения ошибки) на основе полученных отклонений. Этот итеративный процесс, повторяющийся триллионы раз, уточняет предсказания. Затем fine-tuning (тонкая настройка) адаптирует предварительно обученную модель к конкретным задачам с использованием меньших, курируемых наборов данных. Наконец, reinforcement learning (обучение с подкреплением) может дополнительно оптимизировать поведение, оценивая результаты модели и корректируя веса в пользу ответов с высокими баллами, часто с использованием обратной связи от человека (RLHF) или автоматизированных проверок.

Делаем модели компактнее — и снабжаем их актуальными фактами

Адаптация больших моделей для конкретных задач может быть ресурсоемкой, но такие методы, как LoRA (Low-Rank Adaptation), предлагают экономически эффективное решение. LoRA замораживает подавляющее большинство исходных весов модели, обучая лишь небольшой дополнительный набор параметров поверх них — зачастую менее 1% от размера базовой модели. Это значительно снижает вычислительные затраты, позволяя выполнять тонкую настройку на одном GPU.

Quantization (квантование) решает проблему объема памяти для этих колоссальных моделей. Каждый вес в LLM обычно хранится как 16-битное число. Например, модель с 8 миллиардами параметров потребляет около 16 гигабайт. Quantization уменьшает этот объем за счет хранения весов с меньшим количеством бит (например, 8 или 4 бита), округляя их до менее точных значений. Хотя это уменьшает модель — 4-битная квантованная версия той же модели может занимать около 5 гигабайт и работать на ноутбуке, — это создает компромисс, потенциально жертвуя некоторой точностью.

Чтобы расширить знания модели за пределы данных, на которых она обучалась, Retrieval-Augmented Generation (RAG) использует внешнюю информацию. Этот процесс начинается с преобразования текста в embeddings (эмбеддинги) — длинные списки чисел, которые численно отражают семантический смысл, позволяя сравнивать их по сходству. Эти эмбеддинги вместе с исходным текстом затем сохраняются в векторной базе данных.

Когда пользователь задает вопрос, приложение сначала преобразует этот запрос в эмбеддинг. Затем оно ищет в векторной базе данных семантически похожие фрагменты. Эти найденные фрагменты добавляются к исходному промпту, позволяя LLM генерировать ответ, основанный на актуальных или проприетарных данных, на которых она явно не обучалась. Узнайте, как текст преобразуется в токены и эмбеддинги с помощью OpenAI Tokenizer Tool.

Нравится статья? Получайте такие каждое утро на почту.

одно письмо в день · отписка в два клика · без сторонних трекеров

От одного ответа к агентам, которые действуют

Модели, по своей сути, являются генераторами текста. Они не могут самостоятельно искать информацию в интернете или выполнять команды. Здесь на помощь приходит tool calling (вызов инструментов): модель определяет необходимость во внешней функции, а затем запрашивает конкретное разрешенное действие в структурированном формате. Код приложения, а не сама модель, получает этот запрос, выполняет инструмент и возвращает результат модели в виде обычного текста.

Многие сервисы предоставляют эти инструменты через Model-Client Protocol (MCP) — общий шаблон подключения, который позволяет совместимым AI-приложениям обнаруживать внешние возможности и взаимодействовать с ними. MCP определяет, как приложение может взаимодействовать с инструментом, но не диктует внутренние рассуждения или возможности модели. Модель использует MCP, чтобы запрашивать действия; она их не выполняет.

Эти концепции сходятся в agent loop (цикле агента). AI-агент получает задачу, определяет необходимые инструменты и вызывает их через MCP. Затем он проверяет вывод инструмента, обновляет свое внутреннее состояние и повторяет процесс до тех пор, пока задача не будет выполнена. Этот итеративный цикл позволяет реализовывать сложные рабочие процессы: от бронирования авиабилетов до анализа данных.

Несмотря на свою мощность, эти автономные рабочие процессы требуют тщательного управления. Всегда проверяйте результаты работы инструментов, настраивайте соответствующие разрешения для предотвращения несанкционированного доступа и внимательно следите за раскрытием данных. Агенты отлично справляются со структурированными задачами, но их автономность имеет пределы; человеческий контроль остается критически важным для надежной и безопасной работы.

Часто задаваемые вопросы

Что такое LLM простыми словами?

Large language model (большая языковая модель) предсказывает наиболее вероятные следующие токены на основе входных данных, повторяя этот процесс для генерации ответа.

Помнят ли AI-чат-боты прошлые разговоры?

Сама модель, как правило, не имеет состояния (stateless). Чат-приложение может обеспечить непрерывность, отправляя историю разговора или сохраненную информацию вместе с новым запросом.

В чем разница между RAG и fine-tuning?

RAG извлекает релевантную информацию во время ответа и добавляет ее в промпт. Fine-tuning (тонкая настройка) корректирует веса модели с использованием дополнительных примеров обучения.

Чем AI-агент отличается от чат-бота?

Агент может выполнять цикл рассуждений и действий, используя инструменты, проверяя результаты и продолжая работу над задачей, вместо того чтобы просто отвечать один раз.

Found this useful? Share it.

For builders

Want Stork to write one of these about your product?

Send us a URL. We use the product, form a view, and publish what we actually think — in 8 languages, labeled Sponsored, with no copy approval on your side. That last part is what makes it worth quoting.

See how it works$199 · AI tools & software only

Для билдеров

Эта страница работает на чужой инструмент.

Её читают AI-агенты. На неё приходят покупатели. Она отвечает на восьми языках и через MCP. У вашего инструмента может быть такая же — в эфире за 24 часа.