Миграция дата-платформы почти никогда не срывается на самом переносе данных — она срывается на вопросах, которые никто не задал заранее. Вот семь, которые мы проверяем в первую очередь.

  1. Кто владеет данными после переноса? Роли и права доступа в BigQuery/IAM должны быть определены до миграции, а не подгоняться постфактум под то, как всё исторически было устроено.
  2. Как считается совокупная стоимость — не только вычисления, но и хранение, исходящий трафик и слот-часы BigQuery при пиковой нагрузке?
  3. Что происходит с существующими пайплайнами — переписываются под управляемые сервисы (Dataflow, Composer) или переносятся как есть на Compute Engine?
  4. Есть ли план отката, если что-то пойдёт не так на середине переноса, а не только "бэкап на всякий случай"?
  5. Как валидируются данные после переноса — построчное сравнение, контрольные суммы, сверка агрегатов?
  6. Кто отвечает за мониторинг и алерты в новой среде с первого дня, а не после первого инцидента?
  7. Совместим ли CI/CD с целевой инфраструктурой, или релизный процесс придётся выстраивать заново?

Если хотя бы на три из семи пунктов нет чёткого ответа — обычно стоит сначала провести обзор архитектуры, а потом уже планировать даты переноса. Опишите свою платформу, поможем разложить миграцию на понятные шаги.