Introducción
México es uno de los principales productores de fresa en el mundo; en 2023, el valor de las exportaciones representó 1220 mdd (SIAP, 2024). El manejo integrado de plagas y enfermedades es una estrategia esencial para mejorar la calidad y rendimiento de fresa; por ello, la incorporación de técnicas de inteligencia artificial y de visión por computadora que faciliten el reconocimiento y detección de problemas fitosanitarios es de gran interés (ur Rehman et al., 2024). Los métodos tradicionales de identificación de enfermedades son laboriosos y propensos a errores; en contraste, las técnicas de visión por computadora facilitan su identificación temprana e intervención oportuna (Hu et al., 2023).
Kim et al. (2021) aplicaron el modelo de red neuronal convolucional (CNN) con transferecnia de aprendizaje ResNet152 para identificar en el cultivo de fresa las enfermedades pudrición de la corona, causada por hongos y bacterias, y tizón de la hoja (Neopestalotiopsis spp.), antracnosis (Colletotrichum siamense), cenicilla (Sphaerotheca macularis), moho gris (Botrytis cinerea) con una precisión media promedio (mAP, mean average precision) de 96 %. Los modelos híbridos combinan las capacidades de extracción de características de CNN con la capacidad de clasificación de modelos de aprendizaje automático, como bosque aleatorio o las máquinas de soporte vectorial (Kumar et al., 2024). Knauer et al. (2019) utilizaron un modelo CNN híbrido acoplado a un modelo de bosque aleatorio para identificar especies de árboles a partir de imágenes hiperespectrales, y obtuvieron una precisión global de clasificación (ACC) de 78 %.
Dong et al. (2020) utilizaron MobileNetv2 con una ACC de 89 % para clasificar coberturas de suelo y fue superior a los modelos MobileNet1, ResNet152, Xception e Inception-ResNetv2; asimismo, Huerta-Mora et al. (2021) compararon los modelos MobileNetv2 y Xception, este último fue superior con una ACC de 92 % con base en imágenes de la base de datos plant village(Hughes y Salathé, 2015). Los modelos CNN, vi-transformers, CNN híbridas y modelos CNN YOLO han mostrado alto desempeño para identificar enfermedades de interés agrícola (Chen et al., 2023; Zhu et al., 2024).
El objetivo de esta investigación fue implementar dos arquitecturas de redes neuronales convolucionales híbridas con base en el modelo CNN con transferencia de aprendizaje MobileNetv2 (CNN-M) acoplado a un modelo bosque aleatorio (RF, random forest) y a un modelo máquina de soporte vectorial (SVM, support vector machine) para clasificar 10 clases objetivo a partir de imágenes digitales RGB (red, green, blue).
Materiales y métodos
Clases objetivo
Las 10 clases objetivo fueron: tres enfermedades en frutos de fresa, antracnosis (Colletotrichum spp.), cenicilla (Sphaerotheca macularis) y moho gris (Botrytis cinerea); cuatro enfermedades en hojas de fresa mancha angular (Xanthomonas fragariae), viruela (Ramularia tulasnei), cenicilla (Sphaerotheca macularis), y quemadura de la hoja (Diplocarpon earlianum), así como deficiencia nutricional de calcio en hojas, hojas sanas y frutos sanos.
Conjunto de datos
En este estudio se realizaron ocho etapas desde la colecta de datos hasta la evaluación del desempeño en predicción de los modelos convolucionaes híbridos CNNM-SVM y CNN-M-RF (Figura 1). La extracción automática de características con CNN-M se realizó a partir de la capa de aplanado y de la última capa completamente conectada.
Las imágenes que se utilizaron en este estudio provienen de diferentes estudios reportados en la literatura. Se usaron imágenes con enfermedades en frutos y hojas de fresa (Afzaal et al., 2021), hojas enfermas y sanas de la base de datos plant village(Hughes y Salathé, 2015), frutos frescos y podridos (Choi et al., 2022), frutas (Shreya, 2023), frutos frescos y podridos (Sultana et al., 2022) y deficiencia de calcio en hojas (Hariri y Avşar, 2022) (Cuadro 1).
Cuadro 1 Descripción del conjunto de imágenes por clase objetivo considerada en este estudio.
| Clase objetivo | Nombre común | Agente causal | Cantidad |
| an | Antracnosis | Colletotrichum spp. | 97 |
| cf | Cenicilla en fruto | Sphaerotheca macularis | 135 |
| mg | Moho gris del fruto | Botrytis cinerea | 477 |
| ma | Mancha angular | Xanthomonas fragariae | 435 |
| vi | Viruela | Ramularia tulasnei | 615 |
| ch | Cenicilla en hoja | Sphaerotheca macularis | 533 |
| qh | Quemadura de la hoja | Diplocarpon earlianum | 1,109 |
| dc | Deficiencia de calcio | 805 | |
| hs | Hojas sanas | 875 | |
| fs | Frutos sanos | 465 | |
| Total | 5,546 |
Las imágenes se colectaron bajo diferentes condiciones de iluminación y se capturaron con diferente resolución, tamaño y fondo; por lo cual, éstas se homogeneizaron a un tamaño de 224 × 224 píxeles, resolución de 96 ppp y modelo de color RGB (red, green, blue); después, cada imagen se guardó en formato JPG de acuerdo con la entrada estándar del modelo MobileNetv2 (Figura 2).

Figura 2 Ejemplos de las 10 clases objetivo: A) antracnosis (Colletotrichum spp.), B) cenicilla en fruto (Sphaerotheca macularis), C) moho gris del fruto (Botrytis cinérea), D) mancha angular (Xanthomonas fragariae), E) viruela (Ramularia tulasnei), F) cenicilla en hoja (Sphaerotheca macularis), G) quemadura de la hoja (Diplocarpon earlianum), H) deficiencia de calcio, I) hojas sanas, J) frutos sanos.
Hardware y software
Los algoritmos se ejecutaron en el lenguaje Python 3.10.11 con tensorflow 2.12 como back end y en la plataforma Keras 2.12 como front end; se utilizaron los siguientes módulos de Python: Numpy 1.22.4, Pandas 1.5.3, OpenCV 4.6.0, Matplotlib 3.7.1 y Seaborn 0.12.2. La ejecución de los códigos se realizó en la plataforma Web Google-Colab (Bisong, 2019).
En el entrenamiento de CNN-M y CNN-M-SVM se utilizó una GPU (graphics processing unit) Nvidia A100 con 40 GB de memoria de video HBM2G y 81 GB de memoria RAM con 256 GB de disco duro. Para el modelo CNN-M-RF se utilizó una capacidad RAM de 51 GB de memoria, 256 GB de disco duro y CPU Intel Xeon de 2.20 GHz; además, se utilizó un almacenamiento en Google Drive de 15 GB para guardar las imágenes, códigos y modelos finales.
Arquitecturas de redes neuronales convolucionales
Una red neuronal convolucional (CNN) realiza tres tareas principales: 1) transforma una imagen de entrada a un tensor de dimensión a × h × ch, donde a es el ancho, h es la altura y ch es el número de canales RGB; realiza un producto escalar entre el tensor y el filtro, a este resultado se le aplica la función de activación ReLU y se realiza un agrupamiento con base en valores máximos (maxpooling) o valores promedio (averagepooling) para extraer las características más relevantes de la imagen; 2) transforma el tensor resultante de las capas de convolución a un vector unidimensional que contiene las características extraídas y éstas se introducen a un bloque de neuronas completamente conectadas, y 3) aplica una función de activación softmax a la última capa de salida para calcular la probabilidad de pertenencia para cada clase objetivo (Dong et al., 2020).
El modelo CNN con transferencia de aprendizaje MobileNetv2 (CNN-M) está diseñado para dispositivos móviles, equipos con bajos recursos de cómputo y uso de imágenes con resolución 224 × 224 pixeles. CNN-M aplica filtros sobre sobre el mapa de características en canales separados con filtro de 1 × 1, este método es más eficiente que una CNN estándar. Este modelo utiliza operaciones lineales para reducir la dimensión de los datos antes de pasar a la capa de convolución, sin perder información en el proceso de extracción de características (Sandler et al., 2018). CNN-M es un modelo de clasificación preentrenado con imágenes de ImageNet(Deng et al., 2009).
En este estudio, los parámetros de la última capa de CNN-M (Figura 3-D) se definieron como entrenables y los hiperparámetros después de la capa de aplanado se establecieron como sigue: dropout (0.5, 0.6) desactiva de manera aleatoria neuronas durante el proceso de entrenamiento para prevenir sobreajuste (overfittting) del modelo. Se utilzaron dos capas de 256 neuronas completamente conectadas, la capa de salida utilizó una función de activación softmax para calcular la probabilidad de pertenencia de cada clase objetivo, la función de pérdida categorical crossentropy se utilizó como función objetivo durante el entrenamiento del modelo, la métrica precisión global de clasificación (ACC, Accuracy) se utilizó para monitorear el desempeño del modelo, y el optimizador Adamax se utilizó para determinar los parámetros de la red convolucional durante el entrenamiento (Géron, 2022).
Modelos CNN-M híbridos
Los modelos CNN-M híbridos se construyen en dos etapas, en la primera se entrena el modelo CNN-M y en la segunda se extraen las características de entrada de los modelos de aprendizaje. Estas entradas se obtienen en dos capas diferentes, en la capa de aplanado (F, flatten) y en la última capa de neuronas completamente conectadas (FC, full conected) del modelo CNN-M (Knauer et al., 2019; Kumar et al., 2024). En este estudio se utilizaron dos modelos híbridos CNN-M-SVM y CNN-RF (Figura 3).
CNN-M-SVM es un modelo CNN-M acoplado a un modelo de aprendizaje SVM que se entrena con las características extraídas de CNN-M para clasificar las clases objetivo. SVM maximiza el margen dis que separa las clases mediante un hiperplano, con base en puntos cercanos llamados vectores soporte (Raschka y Mirjalili, 2019).
donde dis es la distancia entre dos vectores y w es el vector de pesos del hiperplano.
La forma dual para expresar dis es buscar los vectores de soporte (x i , x j ) que maximicen la siguiente función:
j =1 donde α i y α j son multiplicadores de Lagrange, y i es la clase objetivo de la muestra xi, yj es la clase objetivo de la muestra xj y K (xi, yj) es el kernel o núcleo del producto escalar, sujeta a:
donde C es el parámetro de regularización y l es el número total de muestras (Raschka y Mirjalili, 2019).
El modelo CNN-M-RF híbrido utiliza como entrada del modelo RF las características extraídas con CNN-M (Figura 3). RF es un clasificador que consiste en un conjunto de árboles de decisión, los cuales se forman a partir de muestras aleatorias con reemplazo del conjunto de datos de entrenamiento. Los nodos de cada árbol se dividen con base en características extraídas de forma aleatoria. Cada árbol de RF realiza una predicción de clase; en seguida, la predicción final de una clase objetivo se realiza por voto mayoritario (Khozeimeh et al., 2022). El número de características nc en cada nodo se determinó por nc = √m, donde m es el número de características del conjunto de entrenamiento. En general RF es robusto y evita el sobreajuste (Raschka y Mirjalili, 2019).
Métricas de desempeño
La evaluación del desempeño de los modelos de predicción se realizó con base en ACC y F1macro; esta última es una métrica más conservadora que ACC cuando se tienen muestras de clases desbalanceadas. Las métricas se obtienen con las predicciones del conjunto de datos de prueba (test) y con la matriz de confusión que contiene diferentes conteos de valores: verdaderos positivos (TP, true positive) son valores verdaderos que se clasifican como verdaderos; verdaderos negativos (TN, true negative) son valores negativos que se clasifican como negativos; falsos positivos (FP) son valores negativos que se clasifican como positivos; falsos negativos (FN) son valores positivos que se clasifican como negativos (Raschka y Mirjalili, 2019).
ACC se define como:
Precisión (P) se define como:
Sensibilidad (S) se calcula como:
F1 se calcula como:
F1macro se calcula como:
donde C es el número total de clases objetivo.
Entrenamiento y prueba de los modelos convolucionales
Las imágenes del conjunto de datos se agruparon por clase objetivo en carpetas con el nombre de cada clase; posteriormente, las imágenes en cada carpeta se identificaron con el nombre de la clase y un número consecutivo ascendente. Las imágenes se redimensionaron a un tamaño 224 × 224 píxeles, de acuerdo con la entrada del modelo MobileNetv2.
Partición y aumento del conjunto de datos
El conjunto original de datos se particionó de forma aleatoria y estratificada por clase objetivo en tres subconjuntos: entrenamiento (80 %), validación (10 %) y prueba (10 %) (Pham et al., 2020). Los conjuntos de entrenamiento se aumentaron, para cada clase, por un factor de cuatro, excepto las clases antracnosis y cenicilla que se incrementaron por un factor de 15 por medio de transformaciones de cada imagen. Con las siguientes transformaciones: rotación (25 º), volteado horizontal, volteado vertical, brillo (de 0.5 a 1.5), traslación horizontal (0.2), traslación vertical (0.2), distorsión (0.2) y zoom (0.3) el conjunto de entrenamiento se incrementó a 22,175 imágenes para mejorar la capacidad de aprendizaje de los modelos (Chollet, 2021).
Selección de hiperparámetros óptimos
La selección de hiperparámetros óptimos del modelo CNN-M se realizó mediante una búsqueda por rejilla que maximicen ACC. Los intervalos de valores fueron para dropout = 0.3, 0.5, 0.7; neuronas = 300, 400, 600, y optimizador = adamax, rmsprop, adadelta. El entrenamiento de los modelos se limitó a 100 ciclos (epochs) con tamaño de lote (batch) de 50 imágenes en entrenamiento y 10 en validación, y se aplicó la técnica de regularización earlystopping, con una tolerancia de cinco ciclos para evitar el sobreajuste.
La selección de hiperparámetros óptimos de SVM y RF se realizó por medio de una búsqueda por rejilla y validación cruzada (CV, cross validation) con k = 3 particiones. Los modelos SVM y RF utilizaron diferentes intervalos de valores de búsqueda para sus hiperparámetros (Cuadro 2).
Cuadro 2 Intervalo de valores para la búsqueda de hiperparámetros óptimos de los modelos máquina de soporte vectorial (SVM) y bosque aleatorio (RF) con características de entrada extraídas del modelo de red neuronal convolucional con transferencia de aprendizaje MobileNetv2 (CNN-M).
| Clasificador | Capa† | Hiperparámetros†† | Intervalo de valores |
| CNN-M-RF | F y FC | n | 250, 300, 350, 400, 450 |
| f | gini, entropy, log loss | ||
| d | 8, 12, 14, 16, 18, 20 | ||
| mx | sqrt, log2 | ||
| CNN-M-SVM | F | C | 0.001, 0.01, 0.1, 1 |
| γ | 0.001, 0.01, 0.1, 1 | ||
| FC | C | 0.001, 0.01, 0.1, 1, 10, 100, 1000, 2000 | |
| γ | 0.001, 0.01, 0.1, 1, 10, 100, 1000, 2000 |
†F: características extraídas de la capa de aplanado (flatten) de CNN-M, FC: características extraídas de la capa completamente conectada de CNN-M. ††C: parámetro de regularización, γ: parámetro del kernel lineal, n: número de árboles, f: función objetivo, d: profundidad del árbol, mx: máximo de características para dividir el árbol.
El entrenamiento de los clasificadores SVM y RF, con base en las características extraídas en la capa de aplanado F, se realizó con un conjunto de características reducidas de 9,000 componentes principales que representaron 92 % de varianza total acumulada. La optimización de CNN-M se obtuvo con base en la curva de aprendizaje, versus ciclos de tiempo, para determinar el ciclo de entrenamiento con máximo desempeño (Kumar et al., 2024). La evaluación en predicción de los modelos se realizó con el conjunto de datos de prueba (10 %), el cual consistió de una partición aleatoria estratificada por clase objetivo del conjunto original de imágenes.
Resultados y discusión
Hiperparámetros óptimos
Los hiperparámetros óptimos del modelo CNN-M fueron: dropout = 0.5, neuronas = 300 en las últimas dos capas y optimizador = adamax con ocho ciclos de entrenamiento (Figura 4). Los hiperparámetros del clasificador SVM acoplado a CNN-M con la capa F fueron (C = 0.001, γ = 0.001), y con la capa FC (C = 0.1, γ = 0.001) con un tiempo de entrenamiento de 6 h 45 m. Similarmente, los hiperparámetros del clasificador RF acoplado a CNN-M con la capa F fueron (f = gini, d = 20, mx = log2, n = 300) y con la capa FC fueron (f = gini, d = 16, mx = sqrt, n = 350) con un tiempo de entrenamiento de 2 h 55 m.
Desempeño en predicción de los modelos híbridos
CNN-M-SVM fue ligeramente superior a CNN-M-RF, con F1macro = 97.6 y ACC = 98.9. CNN-M-SVM alcanzó su máximo desempeño F = 9000 componentes y CNN-MRF alcanzó F1macro = 97.2 y ACC = 98.7, con FC = 300 componentes (Cuadro 3).
Cuadro 3 Evaluación del desempeño en predicción de los modelos convolucionales híbridos con base en el conjunto de prueba.
| Modelo | Capa† | NCE†† | F1macro (% ) | ACC (%) |
| CNN-M-SVM | FC | 300 | 96.8 | 98.6 |
| F | 9000 | 97.6 | 98.9 | |
| CNN-M-RF | FC | 300 | 97.2 | 98.7 |
| F | 9000 | 96.8 | 98.6 |
†F: capa de aplanado, FC: completamente conectada, ††NCE: componentes principales extraídos.
El desempeño en predicción de los modelos híbridos a nivel de clases, con base en la matriz de confusión, CNNM-SVM obtuvo su menor desempeño para clasificar antracnosis en frutos (an), mientras que frutos sanos (fs) y frutos con moho gris (mg) fueron confundidos por el modelo; las demás clases objetivo fueron clasificadas con valores de sensibiloidad (S) superiores a 93 % (Figura 5).

Figura 5 Matriz de confusión para la clasificación de las 10 clases objetivo con el modelo CNN-M-SVM con el conjunto de datos de prueba (test): an: antracnosis, dc: deficiencia de calcio, fs: frutos sanos, hs: hojas sanas, ma: mancha angular, mg: moho gris en fruto, cf: cenicilla en fruto, ch: cenicilla en hoja, qh: quemadura de la hoja, vi: viruela.
En términos de F1, CNN-M-SVM obtuvo su menor valor para identificar la clase an con F1 de 88.9 %, debido principalmente al número reducido de la clase objetivo an con (97 imágenes). El modelo alcanzó un alto desempeño para clasificar las nueve clases restantes con F1 superiores a 96 % (Cuadro 4).
Cuadro 4 Métricas de Precisión (P), Sensibilidad (S) y F1 obtenidas de la matriz de confusión para el modelo CNN-M-SVM para cada clase objetivo.
| Clase | (%) | (%) | (%) |
| an | 80.0 | 100 | 88.9 |
| dc | 100 | 97.6 | 98.8 |
| fs | 100 | 97.9 | 98.9 |
| hs | 100 | 100 | 100 |
| ma | 93.2 | 100 | 96.5 |
| mg | 100 | 94.1 | 97.0 |
| cf | 92.9 | 100 | 96.3 |
| ch | 100 | 100 | 100 |
| qh | 100 | 100 | 100 |
| vi | 100 | 100 | 100 |
| F1macro | 97.6 |
an: antracnosis, dc: deficiencia de calcio, fs: frutos sanos, hs: hojas sanas, ma: mancha angular, mg: moho gris en fruto, cf: cenicilla en fruto, ch: cenicilla en hoja, qh: quemadura de la hoja, vi: viruela.
Los resultados obtenidos muestran que los modelos CNN híbridos mejoran la precisión global de clasificación (ACC) de los modelos CNN. En este estudio, el modelo de aprendizaje SVM fue ligeramente superior a RF; sin embargo, SVM utilizó 9000 características extraídas de CNN-M y RF utilizó 300 características de CNN-M, con desempeños ligeramente inferiores. En términos de tiempos computacionales CNN-M-SVM empleó aproximadamente dos veces más recursos que CNNM-RF. Los resultados coinciden con lo reportado por Khozeimeh et al. (2022).
Conclusiones
El modelos híbrido CNN-M-SVM fue ligeramente superior a CNN-N-RF; sin embargo, ambos modelos alcanzaron una precisión global de clasificación (ACC) superior a 98.5 %. A nivel de clases objetivo, CNN-M-SVM alcanzó un puntaje F1 superior a 96 % en nueve de las clases objetivo, y un valor F1 de 88.9 % para identificar la clase anctracnosis en frutos de fresa. Los resultados muestran el potencial de los modelos CNN híbridos para el desarrollo de plataformas web y aplicaciones en dispositivos móviles para el diagnóstico automático de enfermedades en cultivos a partir de imágenes.










nueva página del texto (beta)





