Transformer stages parsed from DSX (.dsx) and ISX (.isx) exports. SQL-friendly logic becomes BigQuery SQL; complex stage-variable logic becomes PySpark on Dataproc. Sequences convert to Cloud Composer DAGs. Full lineage, validated parity.
Upload a job, get converted code →DataStage parallel engines require server sizing, patching, and capacity planning. BigQuery runs SQL at warehouse scale with no infrastructure to manage. Pay per query, not per server.
Simple Transformer derivations become BigQuery SQL views and scheduled queries. Complex stage-variable logic with nested conditionals becomes PySpark on Dataproc, writing results back to BigQuery tables.
DataStage Director sequences manage job dependencies and error handlers. Cloud Composer (managed Airflow) handles the same DAG orchestration with built-in retry, alerting, and cross-service integration across GCP.
A Transformer stage with aggregation and a Lookup reference link — converted to a BigQuery SQL query with JOIN and GROUP BY.
-- Parallel Job: Region_Revenue -- Source: SALES_EXTRACT (connector) -- Lookup: REGION_REF (reference link) -- Transformer stage: -- out.REGION = ref.REGION_NAME -- out.REVENUE = lnk.QTY * lnk.PRICE -- Aggregator stage: -- GroupBy: REGION -- Sum: REVENUE → TOTAL_REVENUE -- Count → ORDER_COUNT -- Target: REGION_SUMMARY (dataset)
-- Transformer + Aggregator → BigQuery SQL
CREATE OR REPLACE TABLE
`project.dataset.region_summary` AS
SELECT
r.region_name AS region,
SUM(s.qty * s.price) AS total_revenue,
COUNT(*) AS order_count
FROM `project.dataset.sales_extract` s
LEFT JOIN `project.dataset.region_ref` r
ON s.region_id = r.region_id
GROUP BY r.region_name;
Transformer derivations and Aggregator stages collapse into a single SQL query. Lookup reference links become JOINs. When logic requires Python, MigryX outputs PySpark on Dataproc instead.
| DataStage Component | BigQuery / GCP Equivalent | Notes |
|---|---|---|
| Parallel Job | SQL script / Dataproc job | SQL when possible, PySpark when needed |
| Transformer (simple) | BigQuery SQL VIEW | Derivations become SELECT expressions |
| Transformer (complex) | PySpark on Dataproc | Stage variables with nested logic |
| Lookup stage | LEFT JOIN | Reference link semantics preserved |
| Sort stage | ORDER BY | Sort keys and direction preserved |
| Aggregator stage | GROUP BY | All aggregate functions mapped |
| Join stage | JOIN all types | Inner, left, right, full outer |
| Filter / Funnel | WHERE / CASE | Predicate expressions preserved |
| Job Sequence | Cloud Composer DAG | Airflow orchestration with dependencies |
| DB2 / Oracle connector | BigQuery Transfer Service | Scheduled data ingestion |
| Dataset / File stage | BigQuery table | Columnar storage, partitioning |
Data Matching compares DataStage production output against BigQuery query results — row by row, column by column. Mismatches are flagged with column-level evidence before go-live.
See how Data Matching works →Parallel jobs with Transformer stages converted to BigQuery SQL. Complex logic routed to PySpark on Dataproc. Job sequences converted to Cloud Composer DAGs. All outputs validated with Data Matching before DataStage decommission.
View case studies →Upload a DSX or ISX export. Get parsed lineage, BigQuery SQL code, and a validation report.