Resumen

Completados

Enhorabuena por aprender a crear un modelo de clasificación de audio binario.

Ha aprendido cómo se representa el sonido analógico como muestras digitales, cómo las formas de onda muestran amplitud a lo largo del tiempo y cómo los espectrogramas muestran contenido de frecuencia con el tiempo. También has visto cómo cargar las clases yes y no desde el conjunto de datos de comandos de voz, convertir formas de onda en tensores de espectrograma, entrenar una red neuronal convolucional y evaluar el modelo con datos de validación.

Pasos siguientes

Para profundizar, pruebe estas ideas:

  • Amplíe el modelo para clasificar los ocho comandos del conjunto de datos mini comandos de voz cargando SOURCE_DATASET_PATH en lugar del binario BINARY_DATASET_PATH. La label_names matriz y el num_labels valor se actualizan automáticamente a partir de los nombres de directorio.
  • Use el conjunto de datos de comandos de voz completo y las traindivisiones , validationy test proporcionadas por los conjuntos de datos de TensorFlow para una evaluación más rigurosa. Los conjuntos de datos de TensorFlow exponen el conjunto de etiquetas estándar de detección de palabras clave, incluidos los comandos de destino más _unknown_ y _silence_, por lo que actualiza la capa de salida y el control de etiquetas para ese conjunto de etiquetas.
  • Pruebe a transferir el aprendizaje para el reconocimiento de audio con un modelo YAMNet previamente entrenado.