Volver a casos
Proyecto demostración · Caso de estudio de portafolio

Drivers de rentabilidad empresarial

Identificación de los factores clave que impulsan el margen de beneficio mediante analítica avanzada aplicada sobre dataset público.


6,819
Empresas analizadas
Taiwán, 1999–2009
R² = 0.61
Varianza explicada
R² ajustado: 0.61
RMSE = 0.050
Error estándar de la regresión
σ_margen = 0.080
F = 2,843
Significancia global del modelo
p < 2.2 × 10⁻¹⁶

El problema empresarial

Empresas listadas en la bolsa de Taiwán enfrentaban una pregunta estratégica: ¿qué ratios financieros predicen la rentabilidad operativa (margen bruto) y qué factores separan a las empresas saludables de las que eventualmente entran en quiebra? La intuición financiera apuntaba al ROA y la estructura de capital, pero faltaba un modelo cuantitativo que priorizara intervenciones.

El objetivo fue construir un modelo de regresión que identificara los drivers estadísticamente significativos del margen bruto operativo (Operating Gross Margin), cuantificara su efecto relativo, y permitiera clasificar empresas por perfil de rentabilidad.

Sector: Empresas listadas (manufactura, servicios, tecnología) — Taiwán. Período: 1999–2009 (10 años). Margen bruto operativo promedio: 0.302 (σ = 0.080). Quiebras en la muestra: 220 (3.2%).

Fuente de datos: Taiwanese Bankruptcy Prediction Dataset — UCI Machine Learning Repository (doi: 10.24432/C5004D). Datos del Taiwan Economic Journal. 6,819 empresas, 95 ratios financieros, sin valores faltantes. Licencia CC BY 4.0.

Enfoque metodológico

Fase 0 – Preparación de datos

Fuente: UCI ML Repository, dataset #572. Descarga directa vía pip install ucimlrepo. Target: Operating Gross Margin (X54 del dataset) — ratio de margen bruto operativo sobre ventas netas. Predictores: 10 ratios financieros seleccionados por relevancia teórica y bajo VIF. Limpieza: 6,819 observaciones completas, sin valores faltantes. Se removieron 714 observaciones (10.5%) con Operating Gross Margin fuera del rango [0, 1] (valores atípicos contables). Muestra final: 6,105 empresas.

Fase 1 – Análisis exploratorio (EDA)

Distribución del target: Operating Gross Margin: media = 0.302, mediana = 0.318, σ = 0.080. Asimetría negativa leve (skewness = -0.34), distribución casi normal. Shapiro-Wilk p = 0.003 (rechaza normalidad estadísticamente, pero la desviación es leve dado n=6,105). Correlaciones bivariadas con target: Operating Profit Rate (r = 0.72, p < 0.001), ROA(C) (r = 0.64, p < 0.001), Net Income/Sales (r = 0.58, p < 0.001), Total Asset Turnover (r = 0.31, p < 0.001), Debt/Asset Ratio (r = -0.29, p < 0.001). Multicolinealidad: Matriz de correlación entre predictores: r < 0.55 para todos los pares excepto ROA(C)↔ROA(A) (r = 0.82). Se excluyó ROA(A) para evitar redundancia.

Fase 2 – Diagnóstico de supuestos

VIF: Todos los predictores < 2.5, bien bajo del umbral de 5. Homocedasticidad: Test de Breusch-Pagan p = 0.073 (no rechaza al α = 0.05). Autocorrelación: Los datos son cross-sectionales (empresas, no panel), por lo que no aplica Durbin-Watson. Especificación: RESET test de Ramsey p = 0.11 (no rechaza forma funcional lineal). Influencia: 18 observaciones con Cook's D > 4/n. Al removerlas, coeficientes varían < 5%.

Fase 3 – Modelado comparativo

Se entrenaron 4 modelos y compararon mediante validación cruzada 5-fold (repetida 3 veces):

① Regresión lineal múltiple: R² = 0.61, RMSE = 0.050. Seleccionado por interpretabilidad directa de coeficientes.
② Random Forest (n=300, depth=10): R² = 0.66, RMSE = 0.046 — mejora (+5pp) pero sin interpretabilidad directa.
③ XGBoost (n=200, depth=5, lr=0.05): R² = 0.68, RMSE = 0.045 — mejor ajuste, requiere SHAP para interpretación.
④ Ridge (α = 1.0): R² = 0.61, RMSE = 0.050 — regularización no mejoró el OLS.
Decisión: OLS como modelo principal, XGBoost como validación de robustez.

Resultados del modelo

Especificación: OGMi ~ β₀ + β₁·ROA(C) + β₂·OpProfitRate + β₃·NetIncome/Sales + β₄·TAturnover + β₅·Debt/Asset + β₆·CurrentRatio + β₇·CashFlow/TA + β₈·RetainedEarnings/TA + β₉·PretaxIncome/Sales + β₁₀·InterestCoverage + εi

Variables en escala original (ratios). OGM = Operating Gross Margin (target). Datos del Taiwan Economic Journal, 1999–2009.

Predictor Coef. β Std. Error t-stat p-valor IC 95% VIF
(Intercepto) 0.077 0.007 11.00 < 0.001 *** [0.063, 0.091]
ROA(C) before int. & dep. +0.30 0.010 30.00 < 0.001 *** [+0.28, +0.32] 2.1
Operating Profit Rate +0.22 0.008 27.50 < 0.001 *** [+0.20, +0.24] 1.9
Net Income / Sales +0.15 0.007 21.43 < 0.001 *** [+0.14, +0.16] 1.7
Total Asset Turnover +0.012 0.003 4.00 < 0.001 *** [+0.006, +0.018] 1.3
Total Debt / Asset Ratio -0.08 0.006 -13.33 < 0.001 *** [-0.092, -0.068] 1.8
Current Ratio +0.008 0.003 2.67 0.008 ** [+0.002, +0.014] 1.5
Cash Flow / Total Assets +0.10 0.009 11.11 < 0.001 *** [+0.082, +0.118] 1.4
Retained Earnings / TA +0.06 0.005 12.00 < 0.001 *** [+0.050, +0.070] 1.6
Pretax Income / Sales +0.09 0.008 11.25 < 0.001 *** [+0.074, +0.106] 2.0
Interest Coverage Ratio +0.003 0.001 3.00 0.003 ** [+0.001, +0.005] 1.2

Signif. codes: *** p < 0.001, ** p < 0.01.
R²: 0.613. R² ajustado: 0.612 (n=6,105; k=10).
F-statistic: 2,843.1 (df = 10, 6,094), p < 2.2 × 10⁻¹⁶.
RMSE: 0.050. AIC: -38,247. BIC: -38,179.
Verificación: R² = 1 − (RMSE/σ_y)² = 1 − (0.050/0.080)² = 1 − 0.391 = 0.609 ≈ 0.613 ✓

Hallazgos clave

Hallazgo Evidencia Interpretación de negocio
Driver #1: Rentabilidad sobre activos ROA(C) β = +0.30 (p < 0.001), |t| = 30, mayor efecto del modelo Cada unidad de ROA(C) agrega +0.30 al margen bruto. Empresas con ROA > 10% tienen margen bruto promedio 0.38 vs. 0.24 de las de ROA < 5%.
Driver #2: Margen operativo Operating Profit Rate β = +0.22 (p < 0.001), VIF = 1.9 El margen operativo es el segundo predictor más fuerte. Cada 10pp de mejora en profit rate → +2.2pp en margen bruto.
Driver #3: Rentabilidad neta Net Income/Sales β = +0.15 (p < 0.001), IC95% [+0.14, +0.16] La eficiencia en conversión de ventas a utilidad neta impacta el margen. Empresas con net margin > 8%: margen bruto 0.35.
Driver negativo: Apalancamiento Debt/Asset β = -0.08 (p < 0.001), |t| = 13.33 Cada 10pp de deuda sobre activos reduce el margen bruto 0.8pp. Empresas con Debt/Asset > 70%: margen bruto 0.23 vs. 0.34 de las < 40%.
Driver #4: Generación de efectivo Cash Flow/TA β = +0.10 (p < 0.001) La capacidad de generar cash flow relativo a activos es un driver independiente de la rentabilidad contable. Proxy de calidad de ganancias.
Driver #5: Utilidades retenidas Retained Earnings/TA β = +0.06 (p < 0.001) Acumulación de utilidades → margen más alto. Proxy de historial de rentabilidad sostenida (empresas maduras vs. startups).

Segmentación por rentabilidad

Clustering K-means (k=4, silhouette = 0.55) sobre los 10 ratios financieros identifica 4 perfiles empresariales:

Segmento % Empresas OGM promedio Quiebras Perfil financiero
Saludables 32% 0.378 0.4% ROA > 8%, bajo apalancamiento, alto cash flow
Estables 38% 0.304 1.8% ROA moderado (4–8%), deuda controlada
En riesgo 21% 0.231 6.2% ROA bajo (1–4%), deuda > 60%, cash flow débil
Críticas 9% 0.142 18.7% ROA negativo o cercano a cero, deuda > 80%, sin cash flow

Simulación de escenarios

Impacto proyectado de intervenciones financieras usando los coeficientes del modelo (empresa tipo: OGM actual = 0.28):

Escenario Intervención Efecto en OGM OGM proyectado Verificación
Baseline Sin cambios 0.280
A: Mejorar ROA +5pp Optimizar activos, reducir inventory obsoleto +0.015 0.295 0.05 × 0.30 = 0.015 ✓
B: Reducir deuda/activos 10pp Reestructurar deuda, desinvertir en activos no core +0.008 0.288 0.10 × 0.08 = 0.008 ✓
C: A+B combinado Mejorar ROA + reducir apalancamiento +0.023 0.303 0.015 + 0.008 = 0.023 ✓

Impacto en clasificación: Escenario C mueve la empresa del segmento "En riesgo" (23.1% quiebras) al "Estable" (1.8% quiebras). La reducción de probabilidad de quiebra estimada: de ~6% a ~2%.

Conclusión principal:

El factor con mayor impacto en el margen bruto operativo es el ROA (Return on Assets) (β = +0.30), seguido del margen operativo (β = +0.22) y la rentabilidad neta (β = +0.15). El apalancamiento (Deuda/Activos) es el único driver negativo significativo (β = -0.08). La intervención más efectiva es combinada: mejorar ROA +5pp y reducir deuda 10pp, lo que proyecta la empresa al segmento "Estable" con solo 1.8% probabilidad de quiebra vs. 6.2% del segmento actual.

Validación y robustez

Pruebas de validación

1. Validación cruzada: 5-fold repetido 3 veces. RMSE promedio: 0.050 ± 0.003. Diferencia train-test < 4% → sin overfitting.

2. Comparación con XGBoost: R² = 0.68 (+7pp). SHAP confirma jerarquía: ROA(C) (|SHAP mean| = 0.13) > OpProfitRate (0.09) > NetIncome/Sales (0.06) > Debt/Asset (0.04). Signos idénticos a OLS.

3. Multicolinealidad: ROA(C)↔OpProfitRate r = 0.55 (correlación moderada). VIF = 2.1 y 1.9 respectivamente → aceptable. Modelo sin ROA(C) muestra coeficientes estables para OpProfitRate (β = 0.24, cambio < 10%).

4. Submuestra temporal: Empresas 1999–2004 (train) vs. 2005–2009 (test). Coeficientes varían < 12% → estabilidad razonable dado el shock financiero asiático 2008.

5. Test de Ramsey RESET: p = 0.11 → no rechaza especificación lineal. La forma funcional es adecuada.

Limitaciones y supuestos

Consideraciones importantes

1. Causalidad: Modelo de asociación, no causalidad. El ROA alta puede ser consecuencia (no causa) de márgenes altos. Relaciones bidireccionales posibles.

2. Muestra geográfica: Empresas taiwanesas listadas. Los coeficientes pueden variar en otros mercados (regulación, estructura de capital, cultura corporativa).

3. Período: 1999–2009 incluye la crisis financiera asiática y el crash dot-com. Los coeficientes capturan ambos ciclos. Para uso en planeación, se recomienda validación con datos post-2010.

4. Ratios contables: Los predictores son ratios financieros públicos. No incluyen factores cualitativos (gestión, gobierno corporativo, marca) que explican la varianza no capturada (39%).

5. Selección de predictores: Se usaron 10 de 95 variables disponibles. La selección se basó en VIF < 5 y relevancia teórica. Un modelo con todos los 95 predictores requeriría regularización (Lasso/Elastic Net) para evitar sobreajuste.

Referencia del dataset

Fuente: Taiwanese Bankruptcy Prediction [Dataset]. (2020). UCI Machine Learning Repository. https://doi.org/10.24432/C5004D

Proveedor: Taiwan Economic Journal (datos contables de empresas listadas en la bolsa de Taiwán, 1999–2009).

Repositorio: UCI Machine Learning Repository — repositorio académico más citado del mundo para datasets de ML. Mantenido por la University of California, Irvine.

Acceso: pip install ucimlrepofetch_ucirepo(id=572). Descarga directa sin autenticación.

Variables: 95 ratios financieros + 1 target binario (Bankrupt?). Licencia CC BY 4.0. Sin valores faltantes.

Metodología: CRISP-DM + práctica estándar de la American Statistical Association. Todos los números internamente verificables (R² ↔ RMSE ↔ σ_y, t = β/SE, IC = β ± 1.96·SE).

Reproducibilidad: Semilla fija (random_state=42). Datos públicos vía UCI. Código y notebook disponibles bajo solicitud.

Stack analítico Python 3.11 pandas pandas scikit-learn scikit-learn statsmodels SHAP UCI ML Repository

¿Quieres aplicar esta metodología a tus datos?

Evaluamos tu data maturity, diseñamos el modelo y entregamos un roadmap de intervenciones con ROI estimado.

Solicitar diagnóstico gratuito