Миграция дата-платформы почти никогда не срывается на самом переносе данных — она срывается на вопросах, которые никто не задал заранее. Вот семь, которые мы проверяем в первую очередь.
- Кто владеет данными после переноса? Роли и права доступа в BigQuery/IAM должны быть определены до миграции, а не подгоняться постфактум под то, как всё исторически было устроено.
- Как считается совокупная стоимость — не только вычисления, но и хранение, исходящий трафик и слот-часы BigQuery при пиковой нагрузке?
- Что происходит с существующими пайплайнами — переписываются под управляемые сервисы (Dataflow, Composer) или переносятся как есть на Compute Engine?
- Есть ли план отката, если что-то пойдёт не так на середине переноса, а не только "бэкап на всякий случай"?
- Как валидируются данные после переноса — построчное сравнение, контрольные суммы, сверка агрегатов?
- Кто отвечает за мониторинг и алерты в новой среде с первого дня, а не после первого инцидента?
- Совместим ли CI/CD с целевой инфраструктурой, или релизный процесс придётся выстраивать заново?
Если хотя бы на три из семи пунктов нет чёткого ответа — обычно стоит сначала провести обзор архитектуры, а потом уже планировать даты переноса. Опишите свою платформу, поможем разложить миграцию на понятные шаги.