你当前正在访问 Microsoft Azure Global Edition 技术文档网站。 如果需要访问由世纪互联运营的 Microsoft Azure 中国技术文档网站,请访问 https://docs.azure.cn

生成和训练自定义提取模型

此内容适用于:🟩v4.0 (正式版) | 以前的版本:🟦v3.1 (正式版)🟥v3.0 (停用)🟦v2.1

文档智能自定义模型需要少量训练文档才能开始。 如果至少有五个文档,可以开始训练自定义模型。 可以训练自定义模板模型(自定义表单)自定义神经模型(自定义文档)。 本文档指导你完成训练自定义模型的过程。

自定义模型输入要求

首先,确保训练数据集遵循文档智能的输入要求。

支持以下文件格式。

模型 PDF 图片:
JPEG/JPG、PNG、BMP、TIFF、HEIF
Office:
Word(DOCX)、Excel(XLSX)、PowerPoint(PPTX)、HTML
版式
常规文档
预生成
自定义提取
自定义分类
  • 照片和扫描:为获得最佳结果,请为每个文档提供一张清晰的照片或高质量的扫描。
  • PDF 和 TIFF:对于 PDF 和 TIFF,最多可以处理 2,000 页。 (使用免费层订阅时,只处理前两个页面。
  • 文件大小:用于分析文档的文件大小是付费层 (S0) 层的 500 MB,免费层为 4 MB(F0) 层。
  • 图像尺寸:尺寸必须介于 50 像素 x 50 像素和 10,000 像素 x 10,000 像素之间。
  • 密码锁:如果 PDF 是密码锁定的,则必须在提交之前删除该锁。
  • 文本高度:要提取的文本的最小高度是 1024 x 768 像素图像的 12 像素。 此尺寸对应于 150 点/英寸的大约 8 号字文本。
  • 自定义模型训练:自定义模板模型的最大训练页数为 500,自定义神经模型为 50,000。
  • 自定义提取模型训练:对于模板模型,训练数据的总大小为 50 MB,神经网络模型为 1 GB。
  • 自定义分类模型训练:训练数据的总大小为 1 GB,最大为 10,000 页。 对于 2024-11-30(GA),训练数据的总大小为 2 GB,最大为 10,000 页。
  • Office 文件类型(DOCX、XLSX、PPTX):最大字符串长度限制为 800 万个字符。

训练数据建议

按照以下提示进一步优化您的数据集以便进行训练:

  • 使用基于文本的 PDF 文档,而不是基于图像的文档。 扫描的 PDF 作为图像进行处理。
  • 对于包含输入字段的表单,请使用已填写完所有字段的示例。
  • 使用每个字段中具有不同值的表单。
  • 如果表单图像质量较低,请使用更大的数据集(10-15 个图像)。

上传训练数据

收集一组用于训练的表单或文档后,需要将其上传到Azure blob 存储容器。 如果不知道如何使用容器创建Azure storage帐户,请遵循 Azure 门户的 Azure 存储 快速入门。 可以使用免费定价层 (F0) 试用该服务,稍后升级到生产付费层。

视频:训练自定义模型

  • 收集并上传训练数据集后,即可训练自定义模型。 在以下视频中,我们将创建一个项目,并探索成功标记和训练模型的一些基础知识。

在文档智能工作室中创建项目

Document Intelligence Studio 提供和协调完成数据集和训练模型所需的所有 API 调用。

  1. 首先导航到 Document Intelligence Studio。 首次使用 Studio 时,需要 初始化订阅、资源组和资源。 然后,按照 自定义项目的先决条件 配置 Studio 以访问训练数据集。

  2. 在 Studio 中,选择 “自定义提取模型 ”磁贴,然后选择“ 创建项目 ”按钮。

    在文档智能工作室中创建项目的屏幕截图。

    1. create project 对话框中,提供项目的名称(可选)说明,然后选择“继续”。

    2. 在工作流的下一步中,选择或创建文档智能资源,然后再选择继续。

    重要

    自定义神经模型仅在几个区域中可用。 如果打算训练神经模型,请在其中一个 受支持的区域中选择或创建资源。

    选择文档智能资源的屏幕截图。

  3. 接下来,选择用于上传自定义模型训练数据集的存储帐户。 如果训练文档位于容器的根目录中, 则文件夹路径 应为空。 如果文档位于子文件夹中,请在 “文件夹路径 ”字段中输入容器根目录中的相对路径。 配置存储帐户后,选择“继续”。

    选择存储帐户的屏幕截图。

  4. 最后,查看project设置,然后选择 Create Project创建新的project。 你现在应该位于标记窗口中,可以看到数据集中的文件已列出。

标记数据

在项目中,第一个任务是使用要提取的字段标记数据集。

上传到存储的文件列在屏幕左侧,第一个文件已准备好标记。

  1. 通过选择屏幕右上角的加号按钮➕开始标记数据集并创建第一个字段。

    “创建标签”的屏幕截图。

  2. 输入字段的名称。

  3. 通过选择文档中的单词或单词,为字段赋值。 在右侧导航栏的下拉列表或字段列表中选择字段。 标记的值低于字段列表中的字段名称。

  4. 对要为数据集标记的所有字段重复此过程。

  5. 通过选择每个文档并选择要标记的文本来标记数据集中的剩余文档。

现在已标记数据集中的所有文档。 .labels.json.ocr.json 文件对应于训练数据集中的每个文档和一个新的 fields.json 文件。 此训练数据集提交以训练模型。

训练模型

标记数据集后,即可训练模型。 选择右上角的训练按钮。

  1. 在“训练模型”对话框中提供唯一的模型 ID,并提供说明(可选)。 模型 ID 接受字符串数据类型。

  2. 对于生成模式,请选择要训练的模型类型。 详细了解 模型类型和功能

    “训练模型”对话框的屏幕截图。

  3. 选择 “训练 ”以启动训练过程。

  4. 模板模型在几分钟内训练。 神经模型可能需要长达 30 分钟才能训练。

  5. 导航到“模型”菜单,查看训练操作的状态。

测试模型

模型训练完成后,可以通过在模型列表页上选择模型来测试模型。

  1. 选择模型,然后在 “测试 ”按钮上选择。

  2. 选择 + Add 按钮以选择要测试模型的文件。

  3. 选择文件后,选择 “分析 ”按钮以测试模型。

  4. 模型结果显示在主窗口中,提取的字段列在右侧导航栏中。

  5. 通过评估每个字段的结果来验证模型。

  6. 右侧导航栏还有示例代码,用于从 API 调用模型和 JSON 结果。

恭喜你掌握了在文档智能工作室中训练自定义模型的技能! 模型可用于 REST API 或 SDK 来分析文档。

适用于:🟩v2.1. 其他版本:v3.0

使用文档智能自定义模型时,可以将自己的训练数据提供给 训练自定义模型 操作,以便模型可以训练到行业特定的表单。 按照本指南了解如何收集和准备数据以有效训练模型。

至少需要五个相同类型的已完成表单。

如果要使用手动标记的训练数据,必须从至少五个相同类型的已完成表单开始。 除了所需的数据集之外,你仍然可以使用未标记的表单。

自定义模型输入要求

首先,确保训练数据集遵循文档智能的输入要求。

支持以下文件格式。

模型 PDF 图片:
JPEG/JPG、PNG、BMP、TIFF、HEIF
Office:
Word(DOCX)、Excel(XLSX)、PowerPoint(PPTX)、HTML
版式
常规文档
预生成
自定义提取
自定义分类
  • 照片和扫描:为获得最佳结果,请为每个文档提供一张清晰的照片或高质量的扫描。
  • PDF 和 TIFF:对于 PDF 和 TIFF,最多可以处理 2,000 页。 (使用免费层订阅时,只处理前两个页面。
  • 文件大小:用于分析文档的文件大小是付费层 (S0) 层的 500 MB,免费层为 4 MB(F0) 层。
  • 图像尺寸:尺寸必须介于 50 像素 x 50 像素和 10,000 像素 x 10,000 像素之间。
  • 密码锁:如果 PDF 是密码锁定的,则必须在提交之前删除该锁。
  • 文本高度:要提取的文本的最小高度是 1024 x 768 像素图像的 12 像素。 此尺寸对应于 150 点/英寸的大约 8 号字文本。
  • 自定义模型训练:自定义模板模型的最大训练页数为 500,自定义神经模型为 50,000。
  • 自定义提取模型训练:对于模板模型,训练数据的总大小为 50 MB,神经网络模型为 1 GB。
  • 自定义分类模型训练:训练数据的总大小为 1 GB,最大为 10,000 页。 对于 2024-11-30(GA),训练数据的总大小为 2 GB,最大为 10,000 页。
  • Office 文件类型(DOCX、XLSX、PPTX):最大字符串长度限制为 800 万个字符。

训练数据建议

按照以下提示,进一步优化您的数据集以进行训练。

  • 使用基于文本的 PDF 文档,而不是基于图像的文档。 扫描的 PDF 作为图像进行处理。
  • 对于已完成的表单,请使用填充了所有字段的示例。
  • 使用每个字段中具有不同值的表单。
  • 对已完成的表单使用更大的数据集(10-15 个图像)。

上传训练数据

收集用于训练的文档集后,需要将其上传到Azure blob 存储容器。 如果您不知道如何使用容器创建 Azure 存储帐户,请参考 Azure 门户的 Azure 存储快速入门指南。 使用标准性能层。

如果要使用手动标记的数据,请上传与您训练文档对应的.labels.json.ocr.json文件。 可以使用 示例标记工具 (或你自己的 UI)生成这些文件。

在子文件夹中组织数据(可选)

默认情况下, 训练自定义模型 API 仅使用位于存储容器根目录的文档。 但是,如果在 API 调用中指定数据,则可以使用子文件夹中的数据进行训练。 通常, 训练自定义模型 调用的正文采用以下格式,其中 <SAS URL> 容器的共享访问签名 URL 如下:

{
  "source":"<SAS URL>"
}

如果将以下内容添加到请求正文,API 会使用位于子文件夹中的文档进行训练。 该字段是可选的,并将 "prefix" 训练数据集限制为路径以给定字符串开头的文件。 因此,例如,值 "Test"会导致 API 仅查看以单词 Test 开头的文件或文件夹。

{
  "source": "<SAS URL>",
  "sourceFilter": {
    "prefix": "<prefix string>",
    "includeSubFolders": true
  },
  "useLabelFile": false
}

后续步骤

了解如何生成训练数据集后,请按照快速入门来训练自定义文档智能模型并开始在表单上使用。

另请参阅