AWS Glue 5.1 на Spark 3.5.6: что нужно сделать командам по работе с данными
Любой технический лид, запускавший пакетное задание в воскресное утро, знает этот момент: в Slack-треде, который никто не хочет читать, всплывает несовместимость версий Spark. За последние двенадцать месяцев AWS Glue дважды обновил среду выполнения — тихо, без лишнего шума. Если ваша команда по-прежнему привязывает задания к версии 4.0, вы отстали на два крупных обновления движка. Текущий путь в документации Amazon ведёт напрямую к Glue 5.1, и разрыв между тем, где находится большинство команд, и тем, с чего должны начинаться новые проекты, только увеличивается.
Что произошло
Как сообщалось в пошаговом руководстве Надии Дюбуа от 21 августа 2026 года на tech-insider.org, AWS Glue 5.1 был выпущен 26 ноября 2025 года и теперь работает на Apache Spark 3.5.6, Python 3.11 и Scala 2.12.18. Этот релиз последовал за Glue 5.0, который вышел в конце 2024 года на Spark 3.5.4 и перевёл движок с базовой версии Spark 3.3.0, на которой был заморожен Glue 4.0. На практике команды, пропустившие один цикл обновлений, столкнутся с прыжком на две минорных версии Spark и сменой интерпретатора Python в рамках одной миграции.
Glue 5.0 принёс не только обновление Spark. В него вошли Java 17, Hudi 0.15.0, Iceberg 1.7.1 и Delta Lake 3.3.0, а также добавилась поддержка Amazon SageMaker Unified Studio и SageMaker Lakehouse. Glue 5.1 использует те же версии Python и Scala, что и 5.0, и, по описанию AWS, добавляет улучшения производительности и безопасности поверх обновления до Spark 3.5.6.
Изменение с наибольшим операционным эффектом произошло в июне 2025 года, когда AWS добавил поддержку прямого чтения и записи в таблицы, зарегистрированные в AWS Lake Formation, для заданий Glue 5.0 Spark — при условии, что IAM-роль задания имеет полный доступ к таблицам. Именно такие тихие нововведения меняют паттерны доступа к данным в озере без единого громкого анонса.
Техническая анатомия
Архитектура Glue принципиально не изменилась. По-прежнему есть три ключевых компонента: Glue Data Catalog как общее хранилище метаданных, Crawlers для обнаружения схем и Jobs как вычислительный слой ETL. Data Catalog остаётся главным элементом, поскольку его читают Athena, Redshift Spectrum, EMR и Lake Formation. Каталогизируйте данные один раз — запрашивайте из четырёх движков. В этом и есть суть продукта.
Изменилось то, что находится под капотом — среда выполнения. Переход с Spark 3.3.0 в Glue 4.0 на Spark 3.5.6 в Glue 5.1 — это не патч-обновление. Оптимизатор Catalyst ведёт себя иначе, настройки адаптивного выполнения запросов изменились, а Python 3.11 ломает всё, что было привязано к старому поведению типизации или к модулям стандартной библиотеки, которые были удалены. По опыту работы с командами над аналогичными обновлениями Spark, все стабильно недооценивают поверхность UDF — особенно в местах взаимодействия pandas UDF с версиями PyArrow. Если у вас Scala 2.12 задания, переход пройдёт мягко: Glue 5.x остаётся на Scala 2.12.18. Тем, кто смотрит в сторону Scala 2.13, облегчения здесь нет.
Изменение с прямым чтением/записью через Lake Formation заслуживает отдельного абзаца. До июня 2025 года запуск Spark-задания против таблиц, управляемых Lake Formation, означал необходимость обходить модель прав доступа или ограничиваться чтением только через каталог. Теперь, если IAM-роль задания имеет полный доступ к таблицам, Glue 5.0 Spark может работать с этими таблицами напрямую. Именно это наконец делает Glue полноценным основным вычислительным движком для озёрного хранилища на базе Lake Formation, а не просто участником на уровне метаданных. Для команд, стандартизирующих работу на Iceberg через Lake Formation, это закрывает реальный пробел. Для команд, использующих Delta под управлением Databricks на тех же данных, ситуация менее однозначна: документация Databricks по-прежнему предполагает, что вычислительный уровень находится в вашем управлении.
Один момент, важный для нагрузок с ограниченным бюджетом: задания Glue Python Shell запускают обычный Python без создания кластера Spark. Вычисления Glue ETL тарифицируются посекундно по модели DPU-час, поэтому задание Python Shell для лёгкой оркестрации может быть на порядок дешевле задания Spark, которое большую часть времени тратит на запуск кластера. Это деньги, которые теряют команды, по умолчанию запускающие всё через Spark.
Кто пострадает
Самый тяжёлый квартал ждёт команды, которые запускают производственные задания Glue 4.0 с большим количеством PySpark UDF и без чёткой дисциплины версионирования среды выполнения. Два минорных обновления Spark и переход с Python 3.9 на 3.11 — это не перенос без изменений. Рассчитывайте на то, что регрессионное тестирование съест реальное инженерное время. В команде из десяти человек усилия двух инженеров на квартал — это двадцать процентов мощности, и это ещё до того, как кто-то откроет тикет о сломанном запросе в Athena.
Компании в сфере iGaming и финтеха, выполняющие плановые пакетные ETL-задания против озёр данных на S3, — очевидная группа риска, особенно там, где тот же каталог питает дашборды Athena для отчётности по соответствию требованиям. Неприятный вывод: если вы построили стек отчётности на Glue 4.0 в 2023 году и не трогали его, потому что он работал, — сейчас вы отстали на три года и две версии среды выполнения, и таймер устаревания не ждёт вашего удобства.
У команд, работающих с озёрными хранилищами, новости смешанные. Если вы перешли на Iceberg с Lake Formation, то Glue 5.0 и 5.1 — первые релизы, где всё работает слаженно от начала до конца. Если вы сделали ставку на Delta Lake с вычислениями под управлением Databricks и использовали Glue как дешёвый дополнительный движок, ценностное предложение становится тоньше. Delta Lake 3.3.0 входит в состав Glue 5.0, но операционный центр тяжести Delta по-прежнему находится в другом месте.
Команды, использующие Snowflake как хранилище и Glue только для загрузки данных, в основном не затронуты изменениями в части озёрного хранилища, однако им всё равно стоит обратить внимание на переход на Python 3.11. Любой пользовательский код коннектора, написанный под семантику Python 3.9, нуждается в проверке. Паттерны загрузки данных для Snowflake описаны в документации Snowflake, если вы пересматриваете границы ответственности.
Руководство к действию для команд по данным
Моя позиция: ни один новый проект на Glue, начатый в третьем квартале 2026 года, не должен ориентироваться на версию старше 5.1. Разрыв в среде выполнения будет только увеличиваться, а начинать на 4.0 сегодня — значит записываться на миграцию, которую вы ещё не планировали.
Конкретные шаги на эту неделю:
- Инвентаризируйте задания Glue по версиям. Если к пятнице вы не можете выдать таблицу с каждым заданием и его средой выполнения — это первая проблема, которую нужно решить. Заодно пометьте задания ответственными командами.
- Явно фиксируйте версии среды выполнения. Не полагайтесь на значения по умолчанию. В примечаниях к релизам Glue перечислены точные версии Hadoop, Iceberg, Hudi и Delta Lake для каждого релиза. Фиксируйте их в вашем IaC.
- Проверьте UDF на совместимость с Python 3.11. Всё, что использует
distutils, устаревшие APIasyncioили старые паттерны типизации, требует внимания до того, как вы переведёте задание на версию 5.1. - Пересмотрите тип каждого задания. Задания, которые по сути являются оркестрацией или лёгкой обработкой данных, следует перевести на Python Shell, а не оставлять на Spark ETL. Glue тарифицируется по DPU-час, и запуск кластера Spark для 30-секундной задачи — чистые потери бюджета.
- Протестируйте интеграцию с Lake Formation в песочнице. Если вы работаете с управляемыми таблицами, проверьте путь прямого чтения/записи из июня 2025 года с ролью, имеющей полный доступ к таблицам, прежде чем перестраивать производственные задания.
Для команд, которые оценивают, подходит ли вообще Glue для их задач, честный ответ зависит от характера нагрузки. Если ваши трансформации ориентированы на SQL и хранилище является центром мира, dbt в связке с движком хранилища превзойдёт Glue по удобству в любой момент. Glue оправдывает свои DPU-часы, когда у вас есть реальные Spark-нагрузки, данные, нативные для S3, и каталог, который должен быть общим для нескольких движков.
Ключевые выводы
- AWS Glue 5.1 вышел 26 ноября 2025 года на Spark 3.5.6, Python 3.11 и Scala 2.12.18. Ни один новый проект не должен ориентироваться на более старую среду выполнения.
- Переход с Spark 3.3.0 на Spark 3.5.6 (с Glue 4.0 на 5.1) — это полноценная миграция, а не обновление версии. Планируйте ресурсы соответственно.
- Поддержка прямого чтения/записи через Lake Formation, появившаяся в июне 2025 года, делает Glue полноценным основным вычислительным движком для озёрных хранилищ на базе Lake Formation — при наличии у IAM-роли полного доступа к таблицам.
- Задания Glue Python Shell полностью обходят кластер Spark и являются правильным выбором по умолчанию для лёгких нагрузок, тарифицируемых по DPU-час.
- Data Catalog остаётся главным конкурентным преимуществом Glue: он используется совместно с Athena, Redshift Spectrum, EMR и Lake Formation после единственного обхода данных.
Часто задаваемые вопросы
В: Стоит ли обновлять существующие задания Glue 4.0 напрямую до Glue 5.1?
Да, но относитесь к этому как к полноценной миграции. Вы переходите с Spark 3.3.0 на Spark 3.5.6 и с поведения Python 3.9 на Python 3.11, поэтому планируйте регрессионное тестирование UDF, кода коннекторов и всех зафиксированных версий библиотек. Не переключайте производственные задания массово без предварительного запуска в staging-среде.
В: Когда использовать Glue Python Shell вместо заданий Glue Spark?
Используйте Python Shell, когда нагрузка представляет собой оркестрацию, API-вызовы или лёгкую обработку данных, не требующую распределённых вычислений. Поскольку Glue ETL тарифицируется по DPU-час, а кластеры Spark имеют реальные накладные расходы на запуск, выполнение 20-секундного скрипта в типе задания Spark — пустая трата бюджета. Оставьте Spark для реальных распределённых трансформаций.
В: Изменяет ли Glue 5.1 способ запроса Data Catalog из Athena?
Нет. Интерфейс Data Catalog для Athena, Redshift Spectrum, EMR и Lake Formation не изменился. Меняется то, что сами задания Glue Spark теперь умеют делать — в частности, благодаря добавленной в июне 2025 года возможности прямого чтения и записи таблиц, зарегистрированных в Lake Formation, когда IAM-роль задания имеет полный доступ к таблицам.
Cloudera интегрирует cuDF в Spark 4.1: ускорение в 4 раза без изменения кода
Cloudera встраивает NVIDIA cuDF в Apache Spark 4.1: ускорение до 4x без изменений кода. Что это значит для команд данных на фоне растущих затрат на AI-инфраструктуру.
Японская платформа ценных бумаг: JASDEC присоединяется к JPXI
JPXI, JSF и JASDEC объединяют японский рынок ценных бумаг в единую машиночитаемую платформу. Бета-версия — начало 2027 года. Вот что это значит.
Revizto подключает ChatGPT и Claude к живым данным BIM через MCP
Revizto подключил ChatGPT, Claude и Copilot к живым данным AECO-проектов через новый MCP Server, API и Developer Portal. Что это значит для data-команд.




