
Un ingeniero del dato construye y mantiene la infraestructura que permite que los datos fluyan desde donde se generan hasta donde se analizan. No analiza los datos — construye las tuberías por las que circulan, los limpia y los deja listos para que el analista trabaje con ellos.
Es el rol menos visible y más infravalorado del ecosistema del dato. Y es también el que, si falla, hace que todo lo demás falle silenciosamente.
Qué hace exactamente un ingeniero del dato
En el día a día, un ingeniero del dato:
- Conecta fuentes de datos: tu web, tu CRM, tu plataforma de email, tus herramientas de ads, tu sistema de facturación.
- Construye pipelines: procesos automatizados que mueven datos de un sitio a otro, transformándolos en el camino.
- Limpia y estructura datos: elimina duplicados, normaliza formatos, resuelve inconsistencias.
- Diseña la arquitectura de almacenamiento: decide cómo se organizan las tablas, qué se guarda, durante cuánto tiempo.
- Garantiza que los datos lleguen a tiempo y correctos: monitoriza los pipelines para detectar fallos antes de que el analista se entere por un dashboard roto.
En el contexto de analítica digital con el stack de Google, esto se traduce en tareas muy concretas: conectar GA4 con BigQuery, unir datos de Google Ads con datos de CRM, construir tablas limpias que Looker Studio pueda consumir sin que el analista tenga que escribir SQL complejo cada vez.
Ingeniero del dato vs analista de datos: dónde está la línea
La confusión es habitual porque en empresas pequeñas la misma persona hace las dos cosas. Pero conceptualmente son roles distintos:
El ingeniero del dato se pregunta: ¿cómo consigo que estos datos lleguen limpios y estructurados a donde los necesito?
El analista de datos se pregunta: ¿qué me dicen estos datos y qué decisión debería tomar?
En la práctica, el ingeniero entrega tablas listas. El analista las consulta, las cruza y construye dashboards o exploraciones a partir de ellas.
Ejemplo concreto: el ingeniero construye el pipeline que exporta GA4 a BigQuery cada día, limpia los datos de eventos duplicados y los une con la tabla de transacciones del CRM. El analista usa esa tabla unificada para construir un dashboard de LTV por canal de adquisición. Sin el trabajo del primero, el segundo no tiene nada fiable con lo que trabajar.
Cuándo necesitas un ingeniero del dato (y cuándo no)
No lo necesitas si…
- Tienes una sola fuente de datos (solo GA4, por ejemplo) y la consultas directamente en sus informes estándar o en Looker Studio conectado directamente.
- Tu volumen de datos es manejable con las herramientas estándar — GA4 con su interfaz nativa cubre la mayoría de necesidades de una empresa mediana.
- No necesitas cruzar datos de fuentes distintas para responder tus preguntas de negocio.
Sí lo necesitas cuando…
- Tienes múltiples fuentes que necesitas unificar: GA4 + CRM + Google Ads + Meta Ads, y quieres verlos juntos en un solo dashboard con datos coherentes.
- GA4 se queda corto en retención o granularidad: necesitas histórico más allá de los 14 meses máximos o quieres trabajar con datos sin muestrear.
- Necesitas transformar datos antes de analizarlos: calcular métricas custom que no existen en ninguna herramienta estándar, como un LTV ajustado por cohortes.
- El volumen de consultas manuales se ha vuelto inviable: si cada informe requiere exportar varios CSVs y cruzarlos a mano en Excel, ya tienes un problema de ingeniería de datos, aunque no lo llames así.
El caso práctico más habitual: GA4 → BigQuery → Looker Studio
Esta es la arquitectura más común en proyectos de analítica digital con cierta madurez, y resume bien qué hace la ingeniería del dato en la práctica.
Paso 1 — Exportación de GA4 a BigQuery
GA4 tiene exportación nativa a BigQuery, gratuita y configurable en pocos clics desde Administrador → Vinculaciones de productos → BigQuery. Esto ya es trabajo de ingeniería del dato, aunque lo active el analista: define qué se exporta, con qué frecuencia y a qué proyecto de Google Cloud.
El resultado: tablas diarias con todos los eventos de GA4, sin muestreo, sin limitación de retención, en formato bruto.
Paso 2 — Transformación con SQL
Los datos en bruto de GA4 en BigQuery no son directamente usables para un dashboard — vienen en formato anidado (arrays dentro de columnas) que requiere desanidar con SQL antes de poder construir gráficos simples.
Aquí es donde la ingeniería del dato hace su trabajo real: escribir queries que transforman esos datos brutos en tablas planas y legibles. Por ejemplo, una query que extrae todos los eventos de purchase, desanida los parámetros de items y calcula el valor total por transacción.
SELECT
event_date,
user_pseudo_id,
(SELECT value.string_value FROM UNNEST(event_params) WHERE key = 'transaction_id') AS transaction_id,
(SELECT value.double_value FROM UNNEST(event_params) WHERE key = 'value') AS value
FROM `proyecto.analytics_123456.events_*`
WHERE event_name = 'purchase'
Este tipo de query, repetida y automatizada, es el corazón del trabajo de ingeniería. No es analítica — es construir la base sobre la que la analítica se apoya.
Paso 3 — Vistas o tablas materializadas
En lugar de ejecutar la query pesada cada vez que alguien abre un dashboard, se crea una vista (consulta guardada que se ejecuta cada vez que se llama) o una tabla materializada (resultado precalculado que se actualiza periódicamente). Esto hace que Looker Studio cargue rápido y no sobrecargue las consultas de BigQuery innecesariamente.
Paso 4 — Conexión a Looker Studio
Looker Studio se conecta a la vista o tabla ya limpia, no a los datos brutos de GA4. El analista construye el dashboard sobre algo ya preparado, sin tener que repetir transformaciones SQL cada vez que necesita un nuevo informe.
Unir GA4 con otras fuentes: el caso del CRM
Otro caso práctico habitual: quieres saber qué canal de adquisición trae a los clientes con mayor valor a largo plazo. GA4 te dice de dónde vino la sesión que generó la conversión. El CRM te dice cuánto ha gastado ese cliente en total a lo largo del tiempo. Ninguna herramienta por sí sola responde la pregunta completa.
El trabajo de ingeniería del dato aquí:
- Exportar los datos de GA4 a BigQuery (como antes).
- Exportar o sincronizar los datos del CRM a BigQuery — vía API, conector nativo, o exportación periódica.
- Encontrar la clave de unión entre ambas fuentes — normalmente un ID de usuario o un email hasheado, respetando privacidad.
- Construir una tabla unificada que cruce el canal de adquisición de GA4 con el valor histórico del CRM.
Sin este trabajo previo, la pregunta de negocio simplemente no se puede responder con datos reales — solo con suposiciones.
Herramientas habituales de un ingeniero del dato en este contexto
No hace falta Hadoop ni Spark para la mayoría de proyectos de analítica digital. El stack habitual y suficiente es:
- BigQuery: almacenamiento y procesamiento de datos a escala razonable, con SQL estándar.
- Cloud Functions o Cloud Scheduler: para automatizar pipelines sencillos sin montar infraestructura compleja.
- n8n o Make: para flujos de integración entre herramientas que no requieren código pesado — conectar APIs, mover datos entre plataformas, programar tareas recurrentes.
- dbt (data build tool): para gestionar transformaciones SQL de forma organizada y versionada, en proyectos con más volumen de queries.
- Python: para transformaciones que SQL no puede hacer fácilmente, o para conectar APIs sin conector nativo.
La elección de herramientas depende de la escala. Para una empresa mediana con GA4 y un par de fuentes adicionales, BigQuery + SQL + alguna automatización con n8n es más que suficiente.
Qué pasa si te saltas la ingeniería del dato
El error habitual: el analista intenta resolver con fórmulas de Excel o con conectores directos de Looker Studio lo que en realidad requiere una capa de transformación previa.
El resultado es un dashboard que funciona… hasta que el volumen de datos crece, hasta que se necesita cruzar una fuente nueva, o hasta que alguien pregunta algo que requiere lógica que Looker Studio no puede calcular directamente (como deduplicar usuarios entre sesiones de distintos dispositivos).
En ese punto, hay dos caminos: parchear con soluciones cada vez más frágiles, o parar y construir la capa de ingeniería que debería haber existido desde el principio. El segundo camino es más caro a corto plazo y mucho más barato a largo plazo.
Preguntas frecuentes sobre ingeniería del dato
¿Necesito contratar a un ingeniero del dato o puedo hacerlo yo como analista?
Depende de la complejidad. Si solo necesitas exportar GA4 a BigQuery y escribir algunas queries de transformación, un analista digital con conocimientos de SQL puede hacerlo perfectamente — es lo que suelo hacer yo mismo en proyectos de tamaño medio. Si necesitas pipelines complejos con múltiples fuentes, transformaciones en tiempo real o volúmenes muy grandes, ahí sí conviene un perfil especializado.
¿BigQuery es suficiente o necesito un data warehouse más complejo?
Para la inmensa mayoría de empresas medianas, BigQuery es más que suficiente. Tiene capacidad de sobra, es relativamente económico para volúmenes moderados y se integra de forma nativa con todo el ecosistema de Google. Otras soluciones como Snowflake o Redshift tienen sentido en contextos multi-cloud o con necesidades muy específicas que raramente aplican a una pyme.
¿Cuánto cuesta tener GA4 exportando a BigQuery?
La exportación en sí es gratuita. Lo que se paga es el almacenamiento y el procesamiento de queries en BigQuery, que tiene una capa gratuita generosa (actualmente 1TB de procesamiento de consultas al mes) y precios bajos por encima de ese umbral. Para una empresa mediana, el coste mensual suele ser de pocos euros a unas pocas decenas de euros.
¿Necesito saber programar para hacer ingeniería del dato básica?
Necesitas saber SQL, que no es programación en el sentido estricto pero requiere práctica. Para los casos más sencillos — exportar, desanidar, unir tablas — el SQL de BigQuery es suficiente. Para automatizaciones más complejas, conocimientos básicos de Python ayudan, pero no son imprescindibles si usas herramientas como n8n que minimizan la necesidad de código.
¿Cómo sé si mi proyecto ya necesita ingeniería del dato?
Si te encuentras exportando manualmente CSVs de varias herramientas y cruzándolos a mano en Excel de forma recurrente, ya tienes un problema de ingeniería del dato — solo que lo estás resolviendo de la forma menos eficiente posible. Esa señal es más clara que cualquier volumen de datos específico.
Conclusión
La ingeniería del dato no es un lujo reservado a grandes empresas con petabytes de información. Es la capa que necesitas en el momento en que tienes más de una fuente de datos relevante y quieres respuestas que ninguna herramienta por sí sola puede dar.
Con el stack de Google — GA4, BigQuery, Looker Studio — la mayoría de empresas medianas pueden construir esta capa sin necesidad de infraestructura compleja ni de contratar un equipo especializado. Lo que necesitan es entender qué problema están resolviendo y aplicar las herramientas correctas, en el orden correcto.
¿Tienes datos en varias herramientas que no consigues cruzar de forma fiable? Escríbeme y lo vemos juntos.
¿Necesitas ayuda con la configuración o tienes dudas sobre los pasos a seguir? Contáctame para que juntos llevemos tu proyecto al siguiente nivel.