Склад данных Plata с обновлением раз в час и отказ от Tableau
Любой руководитель платформы, запускавший аналитику в розничном банке, знает ежедневный ритм: ночное обновление склада данных, всплески мошенничества, которые замечают в 10 утра, а операционная команда весь день разгребает последствия инцидентов, случившихся в 3 ночи. Plata, самый быстрорастущий финтех-банк Мексики, решила, что такая задержка неприемлема. Хранилище данных теперь обновляется в течение одного часа и лежит в основе от 80 до 90 процентов всех процессов работы с данными в компании.
Это единственное архитектурное решение, принятое три с половиной года назад, когда команда состояла из восьми человек, и объясняет, почему в подразделении теперь более пятидесяти сотрудников. Именно поэтому Plata рассчитывает полностью отказаться от Tableau.
Цифры
Начнём с кривой роста. Команда хранилища данных выросла с 8 до более чем 50 человек, организованных примерно в 10 специализированных команд, за три с половиной года. Это шестикратный рост численности в дисциплине, где большинство финтехов до сих пор спорят о том, является ли analytics engineering реальной должностью. Как сообщает FinTech Magazine, руководитель отдела хранилища данных Иван Щукин создал функцию с нуля после того, как его переманил CTO Андрей Шелёхин, прямо заявивший: «нам нужно создать лучший продукт».
Операционные показатели важнее численности персонала. Часовая задержка обновления против 24-часового лага, который по-прежнему определяет большинство банковских хранилищ, меняет возможности применения аналитики. При 24-часовом цикле вы занимаетесь расследованием постфактум. При часовом — оперативным управлением. Всплеск отклонённых авторизаций карт в 11 утра становится инцидентом, который устраняют до обеда, а не задачей в Jira, которую создаёт аналитическая команда на следующий день.
Показатель от 80 до 90 процентов — это то, что я бы подчеркнул для любого CTO, читающего этот материал. Когда единое хранилище обеспечивает такую долю процессов работы с данными, с автоматическими проверками качества и алертами для каждого пайплайна, вы централизовали источник истины так, как большинство банков могут только нарисовать на доске. Производственные инциденты в финтехах сопоставимого размера почти всегда восходят к двум-трём параллельным хранилищам данных, постепенно рассинхронизировавшимся между собой. Plata устранила этот сценарий отказа по умолчанию.
Отдельно стоит решение о полном версионировании. Каждое изменение каждой записи фиксируется и сохраняется. Щукин откровенно признаёт, что «большинство игроков рынка боятся этого». И он прав, предупреждая об этом. Полное версионирование умножает затраты на хранение, усложняет запросы на удаление в духе GDPR и затрудняет эволюцию схемы. Делать это тем не менее с первого дня в банке — либо смелость, либо безрассудство. Цифра покрытия процессов в 80–90 процентов говорит о том, что решение себя оправдало.
Пятьдесят человек — это дорого. Для экономного финтеха это существенная статья расходов, легко равная бюджету двух инженерных команд. Противовес в том, что Plata планирует открывать каждый новый рынок Латинской Америки силами всего двух-четырёх аналитических инженеров, опираясь на инструментарий, уже построенный центральной командой. В этом и состоит вся концепция: серьёзные инвестиции в платформу, а затем масштабирование по географиям с помощью небольших ячеек.
Что действительно нового
Часовое хранилище не ново по принципу. Потоковая CDC-репликация в Snowflake или ClickHouse технически была возможна уже несколько лет. Новое — то, что мексиканский розничный банк реально работает на этом как на стандарте, а не как на исключении, и строит 80–90 процентов своих потоков данных исходя из этого допущения.
По-настоящему новая ставка — это план полностью вывести из эксплуатации Tableau и Apache Superset. Не дополнить их. Не интегрировать поверх LLM. А именно вывести из эксплуатации. Формулировка Щукина: «в течение следующего года каждый аналитик будет писать свои небольшие BI-инструменты с помощью AI-агентов». Замена — это генерируемые ИИ приложения на Streamlit, бespoke-визуализации на Python, создаваемые по запросу, а не дашборды, которые курирует центральная команда.
Это подлинный разрыв с традицией. Модель «дашборд как артефакт» является отраслевым стандартом на протяжении пятнадцати лет. В каждой корпоративной команде данных есть кладбище устаревших рабочих книг Tableau, которые никто не помнит, кто заказывал. Замена их одноразовыми сгенерированными приложениями на Streamlit переворачивает модель владения. Аналитик больше не потребитель дашборда, запрашивающий изменения у BI-команды. Он автор, у которого LLM выступает в роли напарника-программиста.
Ещё один новый элемент — внутренняя IDE. Сотрудники Plata сейчас работают примерно с 10 различными инструментами для работы с данными: Airflow для планирования, рабочие листы Snowflake для SQL, Tableau и Superset для дашбордов и прочее. Щукин хочет «одно окно для любой задачи». Объединение всего этого в единую среду с поддержкой ИИ включено в дорожную карту на год.
Моё мнение: консолидация IDE — более сложная задача и более ценная. Любой может создать прототип приложения на Streamlit с помощью Claude. Создание интегрированной среды, где планирование, запросы, моделирование, визуализация и lineage находятся в одном окне, а агент понимает вашу конкретную схему, — это многолетние платформенные инвестиции. Plata сигнализирует, что построит это самостоятельно, а не будет ждать вендора. Учитывая, насколько плохо нынешние BI-вендоры справились с переходом на LLM, это может быть верным решением.
Что уже учтено для команд данных
Большинство старших руководителей в области данных уже ожидают, что analytics engineering станет стандартным названием должности для тех, кто работает между сырыми пайплайнами и бизнес-пользователями. Инструменты вроде dbt сделали эту роль понятной. Plata утверждает, что была «в числе первых», кто нанимал под названием «аналитический инженер», и это timing выглядит правдоподобно. Что уже учтено: сама дисциплина. Что не учтено: укомплектование штата целого отдела из пятидесяти человек вокруг неё и отношение к data engineering как к вспомогательной функции.
Часовой цикл обновления также всё чаще воспринимается как норма среди финтехов, серьёзно относящихся к борьбе с мошенничеством и управлению рисками. Команды по платежам уже работают на потоковых стеках для авторизационных потоков. Что удивляет здесь — это масштаб: не один горячий путь, а 80–90 процентов всех процессов работы с данными компании на одном и том же субстрате близкого к реальному времени.
То, что застанет команды данных врасплох, — это честное признание Щукина об ограничениях LLM поверх хранилищ. Он отвергает вендорский питч о том, что можно «интегрировать LLM с любой базой данных, и она превратится в простой компьютер, которому можно задавать любые вопросы». Его контраргумент: «сначала нужно описать свои данные, и именно над этим мы сейчас работаем». Это проблема семантического слоя, и это та самая работа, которую никто не хочет финансировать. Каждая команда, делающая ставку на text-to-SQL как на shortcut, упрётся в эту стену.
Неудобный вывод: большинство финтехов провели 2025 год, покупая AI-функции у своих BI-вендоров и называя это стратегией. Plata выполняет неблагодарную работу по документированию своей схемы достаточно хорошо, чтобы LLM мог о ней рассуждать. Это и есть настоящий ров.
Контрарный взгляд
Контрарная позиция состоит в том, что отказ от Tableau — ошибка, или по меньшей мере преждевременный шаг. Дашборды существуют не просто так. Они обеспечивают единое видение цифр. Когда каждый аналитик генерирует собственное приложение на Streamlit по запросу, вы получаете аналитический эквивалент теневых IT: сорок слегка отличающихся определений «активного клиента», каждое из которых подтверждено LLM, галлюцинировавшим JOIN.
Управление данными — это контраргумент. У курируемого дашборда в Superset есть владелец, журнал изменений и, в идеале, сертифицированная модель данных. У AI-генерированного приложения на Streamlit ничего этого нет — если только Plata не встроит серьёзные ограничения в свою внутреннюю IDE. Часовое обновление не поможет, если два аналитика придут к разным выводам из одних и тех же данных, потому что их сгенерированные запросы разошлись в логике фильтрации.
Есть и риск найма. План Plata открывать новые рынки LATAM силами двух-четырёх аналитических инженеров предполагает, что платформа настолько хороша, что берёт на себя основную нагрузку. Если платформа даст сбой, эти крошечные ячейки станут узкими местами, а центральная команда окажется в режиме тушения пожаров сразу в пяти странах. Модель с небольшими ячейками отлично работает — ровно до тех пор, пока не перестаёт.
Ключевые выводы
- Часовая задержка — теперь минимальная планка для серьёзных финтехов. Если ваше хранилище по-прежнему обновляется раз в 24 часа, вы занимаетесь расследованием постфактум, пока конкуренты работают в режиме реального времени.
- Полное версионирование дорого и того стоит. Plata внедрила его с первого дня и теперь ведёт 80–90 процентов процессов работы с данными на этом фундаменте. Внедрять задним числом — крайне болезненно.
- BI-вендоры предупреждены. Если AI-генерируемые приложения на Streamlit в масштабе заменят кураторские книги Tableau, бизнес-модель на лицензионных доходах традиционного BI рухнет в течение нескольких лет.
- Analytics engineering — теперь правильное название должности при найме. Plata открывает новые рынки ячейками по два-четыре человека. Если ваша организация по-прежнему нанимает «дата-аналитиков», которые не умеют моделировать или поставлять результат, вы отстаёте.
- Семантический слой — настоящий AI-ров. Text-to-SQL не работает без строгого описания данных. Это скучная, дорогостоящая документационная работа, и именно она отделяет демо от продакшена.
Часто задаваемые вопросы
В: Почему важна часовая задержка хранилища данных по сравнению со стандартным 24-часовым обновлением?
В финтехе разница между одним часом и 24 часами — это разница между оперативным управлением и расследованием постфактум. Всплеск неудачных транзакций или паттерн мошенничества, обнаруженный в течение часа, становится инцидентом, на который можно отреагировать в тот же день. При 24-часовом цикле к тому моменту, когда вы видите проблему, ущерб уже нанесён и вы пишете разбор полётов.
В: Могут ли AI-генерируемые приложения на Streamlit реально заменить такие инструменты, как Tableau и Superset?
Технически да — для генерации бespoke-визуализаций. Более сложная проблема — это управление данными: обеспечение того, чтобы каждое генерируемое аналитиком приложение использовало согласованные определения и сертифицированные модели данных. Ставка Plata срабатывает только в том случае, если её внутренняя IDE обеспечивает эти ограничения. Без этого одноразовые AI-дашборды создают больше разногласий, а не меньше.
В: Какова значимость найма аналитических инженеров вместо дата-инженеров?
Analytics engineering располагается между инфраструктурной работой и бизнес-анализом, фокусируясь на трансформации и моделировании данных для использования. Найм под этим названием — как это делала Plata с самого начала — сигнализирует о том, что команда владеет семантическим слоем, а не только пайплайнами. Это также позволяет создавать небольшие ячейки расширения из двух-четырёх человек на новых рынках, поскольку центральная платформа берёт на себя основную нагрузку.
Отсутствующий стандарт, который скоро обойдётся вашему CFO в реальные деньги
Открытого стандарта для совместного использования бизнес-логики между движками лейкхауса не существует. Для руководителей платформ, подписывающих многолетние контракты на вычисления, этот пробел имеет конкретную цену.
Выручка Databricks SQL удвоилась: давление на Snowflake становится реальным
Databricks заявляет об удвоении продаж продукта, конкурирующего со Snowflake. Заголовок — лишь половина истории, а источник не раскрывает деталей.
Solid присоединяется к инициативе Snowflake Open Semantic Interchange
Solid присоединяется к Open Semantic Interchange от Snowflake, делая ставку на то, что vendor-neutral семантическая спецификация — это недостающее звено для надёжных корпоративных AI-агентов.




