CodeGenTokenizer Classe
Definição
Importante
Algumas informações se referem a produtos de pré-lançamento que podem ser substancialmente modificados antes do lançamento. A Microsoft não oferece garantias, expressas ou implícitas, das informações aqui fornecidas.
Represente o modelo de codificação de par de bytes. Implementar o tokenizer CodeGen descrito em https://huggingface.co/docs/transformers/main/en/model_doc/codegen#overview
public class CodeGenTokenizer : Microsoft.ML.Tokenizers.Tokenizer
type CodeGenTokenizer = class
inherit Tokenizer
Public Class CodeGenTokenizer
Inherits Tokenizer
- Herança
- Derivado
Propriedades
| Nome | Description |
|---|---|
| AddBeginningOfSentence |
Obtém o sinalizador que indica se o token de sentença deve ser incluído no início da codificação. |
| AddEndOfSentence |
Obtém o sinalizador que indica se o token de fim de sentença deve ser incluído na codificação. |
| AddPrefixSpace |
Obtém o sinalizador que indica se um espaço à esquerda deve ser incluído antes de codificar o texto. |
| BeginningOfSentenceId |
Obtém o fim da ID do token de sentença. |
| BeginningOfSentenceToken |
Obtém o início do token de sentença. |
| EndOfSentenceId |
Obtém o fim da ID do token de sentença. |
| EndOfSentenceToken |
Obtém o fim do token de sentença. |
| Normalizer |
Obtém o Normalizador em uso pelo Tokenizer. |
| PreTokenizer |
Obtém o PreTokenizer usado pelo Tokenizer. |
| SpecialTokens |
Obtém os tokens adicionados. |
| UnknownToken |
O token Desconhecido. |
| UnknownTokenId |
Obtém a ID do token Desconhecido. |
| Vocabulary |
Obtém os tokens de mapeamento de dicionário para Ids. |
Métodos
| Nome | Description |
|---|---|
| CountTokens(ReadOnlySpan<Char>, Boolean, Boolean, Boolean, Boolean, Boolean) |
Obtenha o número de tokens aos quais o texto de entrada será codificado. |
| CountTokens(ReadOnlySpan<Char>, Boolean, Boolean) |
Obtenha o número de tokens aos quais o texto de entrada será codificado. (Herdado de Tokenizer) |
| CountTokens(String, Boolean, Boolean, Boolean, Boolean, Boolean) |
Obtenha o número de tokens aos quais o texto de entrada será codificado. |
| CountTokens(String, Boolean, Boolean) |
Obtenha o número de tokens aos quais o texto de entrada será codificado. (Herdado de Tokenizer) |
| CountTokens(String, ReadOnlySpan<Char>, EncodeSettings) |
Obtenha o número de tokens aos quais o texto de entrada será codificado. |
| Create(Stream, Stream, Boolean, Boolean, Boolean) |
Crie um tokenizer CodeGen com base nos fluxos de vocação e mesclagem fornecidos. |
| Decode(IEnumerable<Int32>, Boolean, Boolean) |
Decodificar as IDs fornecidas, de volta para uma cadeia de caracteres. |
| Decode(IEnumerable<Int32>, Span<Char>, Boolean, Boolean, Int32, Int32) |
Decodificar as IDs fornecidas de volta ao texto e armazenar o resultado no |
| Decode(IEnumerable<Int32>, Span<Char>, Int32, Int32) |
Decodificar as IDs fornecidas de volta ao texto e armazenar o resultado no |
| Decode(IEnumerable<Int32>) |
Decodificar as IDs fornecidas, de volta para uma cadeia de caracteres. |
| EncodeToIds(ReadOnlySpan<Char>, Boolean, Boolean, Boolean, Boolean, Boolean) |
Codifica o texto de entrada em IDs de tokens. |
| EncodeToIds(ReadOnlySpan<Char>, Boolean, Boolean) |
Codifica o texto de entrada em IDs de token. (Herdado de Tokenizer) |
| EncodeToIds(ReadOnlySpan<Char>, Int32, Boolean, Boolean, Boolean, String, Int32, Boolean, Boolean) |
Codifica o texto de entrada em IDs de tokens até o número máximo de tokens. |
| EncodeToIds(ReadOnlySpan<Char>, Int32, String, Int32, Boolean, Boolean) |
Codifica o texto de entrada para IDs de token até o número máximo de tokens. (Herdado de Tokenizer) |
| EncodeToIds(String, Boolean, Boolean, Boolean, Boolean, Boolean) |
Codifica o texto de entrada em IDs de tokens. |
| EncodeToIds(String, Boolean, Boolean) |
Codifica o texto de entrada em IDs de token. (Herdado de Tokenizer) |
| EncodeToIds(String, Int32, Boolean, Boolean, Boolean, String, Int32, Boolean, Boolean) |
Codifica o texto de entrada em IDs de tokens até o número máximo de tokens. |
| EncodeToIds(String, Int32, String, Int32, Boolean, Boolean) |
Codifica o texto de entrada para IDs de token até o número máximo de tokens. <param name="text">O texto a ser codificado.</param> (Herdado de Tokenizer) |
| EncodeToIds(String, ReadOnlySpan<Char>, EncodeSettings) |
Codifica o texto de entrada em IDs de token. |
| EncodeToTokens(ReadOnlySpan<Char>, Boolean, Boolean, Boolean, String, Boolean, Boolean) |
Codifica o texto de entrada para objeto tem a lista de tokens, IDs de tokens, mapeamento de deslocamento de tokens. |
| EncodeToTokens(ReadOnlySpan<Char>, String, Boolean, Boolean) |
Codifica o texto de entrada em uma lista de EncodedTokens. (Herdado de Tokenizer) |
| EncodeToTokens(String, Boolean, Boolean, Boolean, String, Boolean, Boolean) |
Codifica o texto de entrada para objeto tem a lista de tokens, IDs de tokens, mapeamento de deslocamento de tokens. |
| EncodeToTokens(String, ReadOnlySpan<Char>, EncodeSettings) |
Codifica o texto de entrada em uma lista de EncodedTokens. |
| EncodeToTokens(String, String, Boolean, Boolean) |
Codifica o texto de entrada em uma lista de EncodedTokens. (Herdado de Tokenizer) |
| GetIndexByTokenCount(ReadOnlySpan<Char>, Int32, Boolean, Boolean, Boolean, String, Int32, Boolean, Boolean) |
Localize o índice da capacidade máxima de codificação desde o início dentro do texto sem ultrapassar o limite de token. |
| GetIndexByTokenCount(ReadOnlySpan<Char>, Int32, String, Int32, Boolean, Boolean) |
Localize o índice da capacidade máxima de codificação sem ultrapassar o limite de token. (Herdado de Tokenizer) |
| GetIndexByTokenCount(String, Int32, Boolean, Boolean, Boolean, String, Int32, Boolean, Boolean) |
Localize o índice da capacidade máxima de codificação desde o início dentro do texto sem ultrapassar o limite de token. |
| GetIndexByTokenCount(String, Int32, String, Int32, Boolean, Boolean) |
Localize o índice da capacidade máxima de codificação sem ultrapassar o limite de token. (Herdado de Tokenizer) |
| GetIndexByTokenCount(String, ReadOnlySpan<Char>, EncodeSettings, Boolean, String, Int32) |
Localize o índice da capacidade máxima de codificação sem ultrapassar o limite de token. |
| GetIndexByTokenCountFromEnd(ReadOnlySpan<Char>, Int32, Boolean, Boolean, Boolean, String, Int32, Boolean, Boolean) |
Localize o índice da capacidade máxima de codificação do final dentro do texto sem ultrapassar o limite de token. |
| GetIndexByTokenCountFromEnd(ReadOnlySpan<Char>, Int32, String, Int32, Boolean, Boolean) |
Localize o índice da capacidade máxima de codificação sem ultrapassar o limite de token. (Herdado de Tokenizer) |
| GetIndexByTokenCountFromEnd(String, Int32, Boolean, Boolean, Boolean, String, Int32, Boolean, Boolean) |
Localize o índice da capacidade máxima de codificação do final dentro do texto sem ultrapassar o limite de token. |
| GetIndexByTokenCountFromEnd(String, Int32, String, Int32, Boolean, Boolean) |
Localize o índice da capacidade máxima de codificação sem ultrapassar o limite de token. (Herdado de Tokenizer) |