Nota
El acceso a esta página requiere autorización. Puede intentar iniciar sesión o cambiar directorios.
El acceso a esta página requiere autorización. Puede intentar cambiar los directorios.
Para crear un modelo NER personalizado, necesita datos de calidad para entrenarlo. En este artículo se explica cómo seleccionar y preparar los datos, además de definir un esquema. La definición del esquema es el primer paso en el ciclo de vida del desarrollo del proyecto, y define los tipos/categorías de entidades que necesita que su modelo extraiga del texto en tiempo de ejecución.
Diseño de esquema
El esquema define los tipos o categorías de entidad que necesita que el modelo extraiga del texto en runtime.
Revise los documentos de su conjunto de datos para familiarizarse con su formato y estructura.
Identifique las entidades que desea extraer de los datos.
Por ejemplo, si extrae entidades de correos electrónicos de soporte técnico, es posible que tenga que extraer "Nombre del cliente", "Nombre del producto", "Fecha de solicitud" y "Información de contacto".
Evite la ambigüedad de los tipos de entidad.
La ambigüedad se produce cuando los tipos de entidades que se seleccionan son similares entre sí. Cuanto más ambiguo sea el esquema, más datos etiquetados se necesitan para diferenciar entre distintos tipos de entidades.
Por ejemplo, si va a extraer datos de un contrato legal, para extraer "Nombre de primera parte" y "Nombre de segunda parte", debe agregar más ejemplos para superar la ambigüedad, ya que los nombres de ambas partes tienen un aspecto similar. Evite la ambigüedad, ya que ahorra tiempo y esfuerzo y produce mejores resultados.
Evite entidades complejas. Las entidades complejas pueden ser difíciles de identificar con precisión en el texto. Considere la posibilidad de dividirla en varias entidades.
Por ejemplo, extraer "Dirección" sería un reto si no se desglosa en entidades más pequeñas. Hay tantas variaciones en la forma en que aparecen las direcciones que se tardaría un gran número de entidades etiquetadas en enseñar al modelo a extraer una dirección, en su conjunto, sin desglosarla. Sin embargo, si reemplaza "Address" por "Street Name", "PO Box", "City", "State" y "Zip", el modelo requiere menos etiquetas por entidad.
Selección de datos
La calidad de los datos con los que entrena el modelo afecta enormemente al rendimiento del modelo.
Use datos de la vida real que reflejen el espacio de problemas del dominio para entrenar de forma eficaz el modelo. Puede usar datos sintéticos para acelerar el proceso de entrenamiento inicial del modelo, pero difiere de los datos de la vida real y hace que el modelo sea menos eficaz cuando se usa.
Equilibra la distribución de datos tanto como sea posible sin desviarse de la distribución en la vida real.
Use diversos datos siempre que sea posible para evitar el sobreajuste del modelo. Una menor diversidad en los datos de entrenamiento puede dar lugar a correlaciones falsas del aprendizaje del modelo que pueden no existir en los datos de la vida real.
Evite los documentos duplicados en los datos. Los datos duplicados tienen un efecto negativo en el proceso de entrenamiento, las métricas del modelo y el rendimiento del modelo.
Considere de dónde proceden los datos. Si va a recopilar datos de una persona, departamento o parte de su escenario, es probable que falte diversidad que puede ser importante para que el modelo obtenga información.
Nota:
Si los documentos están en varios idiomas, seleccione la opción habilitar multilingüe durante la creación del proyecto y establezca la opción de idioma en el idioma de la mayoría de los documentos.
Preparación de los datos
Como requisito previo para crear un proyecto, los datos de entrenamiento deben cargarse en un contenedor de blobs de la cuenta de almacenamiento. Puede crear y cargar documentos de entrenamiento desde Azure directamente o mediante la herramienta Explorador de Azure Storage. La herramienta Explorador de Azure Storage permite cargar más datos rápidamente.
- Creación y carga de documentos desde Azure
- Creación y carga de documentos mediante el Explorador de Azure Storage
Solo se puede usar documentos .txt. Si los datos están en otro formato, puede usar el comando de análisis CLUtils para cambiar el formato del documento.
Puede cargar un conjunto de datos anotado o puede cargar uno sin anotar y etiquetar los datos.
Conjunto de pruebas
Al definir el conjunto de pruebas, asegúrese de incluir documentos de ejemplo que no estén presentes en el conjunto de entrenamiento. Definir el conjunto de pruebas es un paso importante para calcular el rendimiento del modelo. Además, asegúrese de que el conjunto de pruebas incluye documentos que representan todas las entidades usadas en el proyecto.
Pasos siguientes
Si aún no lo ha hecho, cree un proyecto NER personalizado. Si es la primera vez que usa NER personalizado, considere la posibilidad de seguir el inicio rápido para crear un proyecto de ejemplo. Para obtener más información, consulte el artículo de procedimientos.