Authors: Ambuj Kumar Misra
Abstract: Accurate agricultural yield forecasting is critical for food security, economic planning, and sustainable resource management. This study presents a comprehensive comparative analysis of eight machine learning algorithms — including linear regression, ridge regression, lasso regression, support vector regression (SVR), decision trees, random forest, gradient boosting, and XGBoost — applied to multi-crop yield prediction across diverse agro-climatic zones in the United States Midwest. Using a dataset of 12,480 field-season observations spanning 2005 to 2023, encompassing maize, wheat, and soybean, we systematically evaluate each model's predictive accuracy, computational efficiency, interpretability, and robustness to missing data. Ensemble methods, particularly XGBoost (R² = 0.93, RMSE = 1.97 t/ha) and Gradient Boosting (R² = 0.91, RMSE = 2.21 t/ha), significantly outperformed traditional regression models in predictive performance. Feature importance analysis revealed that seasonal rainfall, maximum growing-season temperature, and soil pH were the three dominant predictors across all crops. Our findings provide actionable guidance for agricultural data scientists and policymakers seeking to deploy production-ready yield forecasting systems. We conclude with recommendations on model selection based on data availability, interpretability requirements, and computational constraints.
