OceanBase Lakebase: Унифицированная платформа данных для AI-приложений
Введение: данные есть, AI нужен контекст
Корпоративные системы данных долгое время строились вокруг четких границ: базы данных отвечали за транзакции, хранилища — за аналитику, озера данных — за хранение больших массивов сырой информации, поисковые движки индексировали документы, а векторные базы данных обеспечивали семантический поиск.
Оригинал тут: OceanBase Lakebase: A Unified Data Foundation for AI-Native Applications
Такое разделение работало, пока приложения были детерминированными, а данные — в основном структурированными. AI-приложения ведут себя иначе.
Им может понадобиться профиль клиента вместе с изображениями, аудио- и видеозаписями, PDF-файлами, веб-снимками, векторными эмбеддингами и JSON-документами — и все это для одной бизнес-сущности. В многих компаниях эти данные уже существуют, но они разбросаны по разным системам с разной метаинформацией, политиками доступа и конвейерами обработки. Результат — фрагментированный стек данных, который делает AI-приложения сложными в разработке, управлении и эксплуатации.
OceanBase Lakebase создан именно для решения этой проблемы.
Что такое Lakebase?
Lakebase — это ядро OceanBase AI Database. Оно объединяет управление мультимодальными данными, оперативную выдачу (online serving), аналитику в реальном времени, гибридный поиск и открытые вычисления в единой архитектуре.
Это не отдельное озеро данных и не традиционная база данных с надстройками AI. Это попытка переосмыслить то, как корпоративные данные должны храниться, управляться, обрабатываться и предоставляться, когда AI-приложения становятся частью производственных систем.
Ключевая идея проста: структурированные бизнес-данные и мультимодальные данные должны управляться в рамках единой платформы с согласованной метаинформацией, правами доступа, управлением жизненным циклом и единым языком запросов.
Мультимодальные данные в одной таблице
Ключевое нововведение Lakebase — мультимодальная таблица. В традиционной СУБД таблица описывает структурированные поля: идентификаторы, временные метки, суммы, статусы. В Lakebase таблица может описывать более сложные бизнес-сущности, включающие документы, изображения, аудио, видео, JSON, большие объекты, векторы и результаты работы моделей.
Разные типы данных могут использовать разные форматы хранения в зависимости от размера, паттернов доступа и стоимости. Но с точки зрения пользователя, все они управляются через единую табличную модель, единую метасистему и единую систему управления.
Это дает AI-приложениям более естественную модель данных. Например, обращение в службу поддержки может включать структурированные поля тикета, историю чата, записи звонков, загруженные изображения, диагностические логи и эмбеддинги. Логистическая запись — метаданные заказа, события маршрута, заметки водителя, изображения подтверждения доставки и семантические признаки. С бизнес-точки зрения это не отдельные фрагменты, а разные представления одной сущности.
Lakebase упрощает хранение, поиск, управление и обработку таких сущностей как единого целого.
AI-колонки: модели в конвейере данных
Lakebase вводит понятие AI-колонок — столбцов, в которых хранятся результаты работы моделей: эмбеддинги, саммари, метки, категории или извлеченные признаки.
Вместо того чтобы выгружать данные во внешний конвейер, генерировать семантические результаты и вручную записывать их обратно, команды могут приблизить обработку моделями к данным. Это дает несколько преимуществ:
- Сокращение цепочки обработки — меньше систем, меньше мест, где могут нарушиться согласованность данных и обработка ошибок.
- Улучшение управляемости — эмбеддинги и метки становятся частью управляемых данных, а не скрытыми артефактами.
- Надежные механизмы повторных попыток — в production-средах генерация эмбеддингов, саммари и извлечение признаков могут требовать пересчета при изменении исходных данных.
Гибридный поиск в единой платформе
AI-приложениям нужен поиск, но не один-единственный вид:
- Поиск по ключевым словам — когда пользователи знают, что ищут.
- Векторный поиск — когда важна семантическая близость.
- Структурная фильтрация — когда нужно учитывать бизнес-правила, права доступа, временные диапазоны, категории продуктов или сегменты клиентов.
В большинстве AI-стеков эти возможности разнесены по разным системам: транзакционная БД, поисковик, векторная БД и конвейер синхронизации. Для прототипов это работает, но в production возникают проблемы со свежестью данных, согласованностью прав доступа и надежностью.
Lakebase объединяет структурную фильтрацию, полнотекстовый поиск и векторный поиск в едином пути запроса. Это позволяет AI-приложениям получать AI-готовый контекст из свежих операционных и мультимодальных данных без множества внешних индексов, которые могут рассинхронизироваться с источником.
Поддержка агентных нагрузок
Агенты меняют способ использования баз данных. Они могут читать, писать, искать, планировать, тестировать, изменять состояние, генерировать промежуточные результаты и многократно вызывать инструменты. При этом множество агентов могут работать параллельно, каждый со своей памятью, контекстом, правами и историей выполнения.
Lakebase предоставляет основу для хранения и поиска памяти агентов, контекста сессий, бизнес-состояния и записей выполнения. Он также поддерживает изолированные среды через ветвление (branching) и песочницы (sandboxing), чтобы агенты могли тестировать изменения без прямого воздействия на production-данные.
Цель — не просто помочь агентам получать данные, а помочь им работать безопасно, воспроизводимо и в масштабе.
Открытое хранение и открытые вычисления
AI-нагрузки не будут выполняться в рамках одного движка. SQL остается основой для транзакционных и аналитических нагрузок. Spark широко используется для обработки больших данных. Ray и смежные фреймворки — для AI-обработки и распределенных модельных нагрузок.
Lakebase поддерживает S3-совместимое объектное хранение и открытые табличные форматы, такие как Apache Iceberg, позволяя вычислительным движкам (SQL, Spark, Ray) работать с общими данными и метаинформацией. Это сокращает необходимость копирования данных между системами.
Открытые форматы важны, так как снижают зависимость от вендора и улучшают совместимость. Но сами по себе они не дают всех возможностей, необходимых для production-систем: оперативной выдачи, согласованности, поиска, управления и агент-ориентированных функций. Lakebase сочетает открытость с управлением на уровне базы данных и доступом в реальном времени.
Место Lakebase в OceanBase AI Database
OceanBase AI Database включает три основных слоя:
| Продукт | Роль |
| Lakebase | Ядро — управление мультимодальными данными, гибридный поиск, открытое хранение и вычисления, оперативная выдача, агент-ориентированные среды |
| DataStudio | Рабочая среда для производства, управления и сервиса данных — помогает подготавливать, обрабатывать, моделировать и предоставлять данные для приложений, агентов и бизнес-пользователей |
| DataPilot | Бизнес-ориентированный агент для работы с данными через естественный язык: запросы, анализ, генерация отчетов и инсайтов |
Российские инициативы на базе OceanBase
В России экосистема OceanBase активно развивается в рамках импортозамещения. Ключевые проекты:
1. СУБД О.К.Е.А.Н. (СберТех)
В мае 2026 года на конференции ЦИПР-2026 Сбер представил СУБД О.К.Е.А.Н. — корпоративную систему управления базами данных, построенную на открытом коде OceanBase.
Ключевые характеристики:
- Гибридная нагрузка (HTAP) — поддержка транзакций и аналитики в одной системе.
- Горизонтальное масштабирование — до сотен серверов без ограничений производительности.
- Надежность — нулевая потеря данных (RPO=0), восстановление менее чем за 8 секунд.
- Экономия хранения — сжатие до 70–90%.
- Ретроспективные запросы (Flashback) — доступ к данным на любой момент в прошлом без резервных копий.
- Поддержка SQL и совместимость с MySQL-протоколом.
- Мультитенантность — изолированные логические базы в одном кластере.
Название О.К.Е.А.Н. расшифровывается как:
- Оптимизация объёмов хранения и совокупной стоимости владения
- Кластеризация и георезервирование
- Единый язык запросов SQL
- Аналитика и транзакции в одной СУБД
- Надежность и неограниченная масштабируемость
Решение включено в Единый реестр российского ПО (№ 33689). Как отметил Кирилл Меньшов, старший вице-президент Сбербанка: *«Импортозамещение СУБД — один из приоритетных вопросов для крупного бизнеса сегодня»*.
2. Platform V Ocean DB
Продукт Platform V Ocean DB от СберТех — это российская дистрибуция OceanBase с полной поддержкой, сертификацией и гарантией безопасности.
Итоги и тренды
Ключевые выводы
| Проблема | Решение Lakebase |
| Данные разрознены по разным системам | Единая платформа для структурированных и мультимодальных данных |
| Сложность интеграции AI в data-пайплайны | AI-колонки и встроенная генерация эмбеддингов |
| Поиск требует нескольких систем | Гибридный поиск (ключевые слова + векторы + фильтры) в одном запросе |
| Агенты работают небезопасно | Ветвление, песочницы, изоляция данных |
| Привязка к вендорам и закрытым форматам | Поддержка S3, Iceberg, SQL, Spark, Ray |
Тренды
- Конвергенция озер и хранилищ данных (Lakehouse) — стирание границ между data lakes и data warehouses.
- Мультимодальные данные как норма — базы данных перестают быть только табличными.
- Векторный поиск становится стандартом — неотъемлемая часть любой платформы данных.
- Агент-ориентированные архитектуры — базы данных адаптируются под нужды ИИ-агентов.
- Импортозамещение СУБД в России — переход на отечественные решения на базе Open Source, включая OceanBase.
Заключение
OceanBase Lakebase — это попытка переосмыслить корпоративную платформу данных для эпохи AI. Она объединяет мультимодальные данные, гибридный поиск, открытые вычисления и управление на уровне базы данных в единой архитектуре, чтобы предприятия могли строить AI-приложения на надежной, согласованной и масштабируемой основе.
В России эта технология получает вторую жизнь в рамках инициативы О.К.Е.А.Н. от СберТех, предоставляя крупному бизнесу возможность мигрировать с иностранных СУБД на российскую платформу без потери производительности и с полной поддержкой.