“Modelos de machine learning para el pronóstico del peso de bayas de arándano Vaccinium corymbosum L.”
Fecha
2026-05-07Autor
Cancino Chavez, Gustavo Franco
Quispe Solano, Nilson
Metadatos
Mostrar el registro completo del ítemResumen
Considerando la relevancia económica del calibre como indicador de calidad y
precio, en este estudio se tuvo como objetivo desarrollar modelos de machine learning
capaces de estimar con precisión el peso de las bayas de arándano a partir de su calibre. Se
construyó un preprocesamiento reproducible mediante el paquete recipes de tidymodels para
garantizar la calidad e integridad de los registros de calibre y peso de bayas de arándano
obtenidos durante la campaña 2023-2024 en Lambayeque, Perú. El análisis exploratorio
evidenció una correlación casi perfecta entre calibre y peso (r = 0,98) y una tendencia
decreciente del peso a lo largo del periodo (r = –0,70). Tras aplicar transformaciones
logarítmicas y selección de variables mediante regresión Lasso, se evaluaron cuatro
enfoques de predicción: regresión lineal simple, regresión polinómica de segundo grado,
árbol de decisión y bosque aleatorio. La calibración de hiperparámetros de los modelos de
árbol se realizó mediante optimización bayesiana basada en RMSE y su desempeño se
comparó usando RMSE, MAE, MAPE y R2 en validación cruzada repetida
(5 folds × 20 repeticiones) y en prueba externa. El modelo polinómico mostró el mejor
equilibrio entre precisión y robustez, con un MAE de 0,05 g, un MAPE cercano al 2,5 % y
R2 = 0,97 en ambos escenarios. A pesar de que el bosque aleatorio alcanzó resultados
competitivos, la simplicidad y transparencia del modelo polinómico facilitaron su
implementación en entornos productivos para optimizar la planificación de cosecha y la
clasificación de frutos. Estos hallazgos confirmaron que, ante relaciones casi lineales, los
métodos paramétricos bien calibrados pueden igualar o superar el rendimiento de algoritmos
más complejos. Considering the economic relevance of size as an indicator of quality and price, this
study aimed to develop machine learning models capable of accurately estimating blueberry
berry weight from its size. A reproducible preprocessing was constructed using
the recipes package of tidymodels to ensure the quality and integrity of the size and weight
records of blueberry berries obtained during the 2023–2024 season in Lambayeque, Peru.
Exploratory analysis revealed an almost perfect correlation between size and weight
(r = 0.98) and a decreasing trend in weight over the period (r = –0.70). After applying
logarithmic transformations and variable selection via Lasso regression, four prediction
approaches were evaluated: simple linear regression, second-degree polynomial regression,
decision tree, and random forest. Hyperparameter calibration of the tree models was
performed by Bayesian optimization based on RMSE, and their performance was compared
using RMSE, MAE, MAPE, and R2 in repeated cross-validation (5 folds × 20 repetitions)
and external testing. The polynomial model demonstrated the best balance between accuracy
and robustness, achieving an MAE of 0.05 g, a MAPE close to 2.5 %, and R2 = 0.97 in both
scenarios. Although the random forest produced competitive results, the simplicity and
transparency of the polynomial model facilitated its implementation in production
environments to optimize harvest planning and fruit classification. These findings confirmed
that, given nearly linear relationships, well-calibrated parametric methods can match or
outperform more complex algorithms.
Colecciones
- Agronomía [301]







