Idioma

CodeGenTokenizer Classe

Definição

Represente o modelo de codificação de par de bytes. Implementar o tokenizer CodeGen descrito em https://huggingface.co/docs/transformers/main/en/model_doc/codegen#overview

public class CodeGenTokenizer : Microsoft.ML.Tokenizers.Tokenizer
type CodeGenTokenizer = class
    inherit Tokenizer
Public Class CodeGenTokenizer
Inherits Tokenizer
Herança
CodeGenTokenizer
Derivado

Propriedades

Nome Description
AddBeginningOfSentence

Obtém o sinalizador que indica se o token de sentença deve ser incluído no início da codificação.

AddEndOfSentence

Obtém o sinalizador que indica se o token de fim de sentença deve ser incluído na codificação.

AddPrefixSpace

Obtém o sinalizador que indica se um espaço à esquerda deve ser incluído antes de codificar o texto.

BeginningOfSentenceId

Obtém o fim da ID do token de sentença.

BeginningOfSentenceToken

Obtém o início do token de sentença.

EndOfSentenceId

Obtém o fim da ID do token de sentença.

EndOfSentenceToken

Obtém o fim do token de sentença.

Normalizer

Obtém o Normalizador em uso pelo Tokenizer.

PreTokenizer

Obtém o PreTokenizer usado pelo Tokenizer.

SpecialTokens

Obtém os tokens adicionados.

UnknownToken

O token Desconhecido.

UnknownTokenId

Obtém a ID do token Desconhecido.

Vocabulary

Obtém os tokens de mapeamento de dicionário para Ids.

Métodos

Nome Description
CountTokens(ReadOnlySpan<Char>, Boolean, Boolean, Boolean, Boolean, Boolean)

Obtenha o número de tokens aos quais o texto de entrada será codificado.

CountTokens(ReadOnlySpan<Char>, Boolean, Boolean)

Obtenha o número de tokens aos quais o texto de entrada será codificado.

(Herdado de Tokenizer)
CountTokens(String, Boolean, Boolean, Boolean, Boolean, Boolean)

Obtenha o número de tokens aos quais o texto de entrada será codificado.

CountTokens(String, Boolean, Boolean)

Obtenha o número de tokens aos quais o texto de entrada será codificado.

(Herdado de Tokenizer)
CountTokens(String, ReadOnlySpan<Char>, EncodeSettings)

Obtenha o número de tokens aos quais o texto de entrada será codificado.

Create(Stream, Stream, Boolean, Boolean, Boolean)

Crie um tokenizer CodeGen com base nos fluxos de vocação e mesclagem fornecidos.

Decode(IEnumerable<Int32>, Boolean, Boolean)

Decodificar as IDs fornecidas, de volta para uma cadeia de caracteres.

Decode(IEnumerable<Int32>, Span<Char>, Boolean, Boolean, Int32, Int32)

Decodificar as IDs fornecidas de volta ao texto e armazenar o resultado no destination intervalo.

Decode(IEnumerable<Int32>, Span<Char>, Int32, Int32)

Decodificar as IDs fornecidas de volta ao texto e armazenar o resultado no destination intervalo.

Decode(IEnumerable<Int32>)

Decodificar as IDs fornecidas, de volta para uma cadeia de caracteres.

EncodeToIds(ReadOnlySpan<Char>, Boolean, Boolean, Boolean, Boolean, Boolean)

Codifica o texto de entrada em IDs de tokens.

EncodeToIds(ReadOnlySpan<Char>, Boolean, Boolean)

Codifica o texto de entrada em IDs de token.

(Herdado de Tokenizer)
EncodeToIds(ReadOnlySpan<Char>, Int32, Boolean, Boolean, Boolean, String, Int32, Boolean, Boolean)

Codifica o texto de entrada em IDs de tokens até o número máximo de tokens.

EncodeToIds(ReadOnlySpan<Char>, Int32, String, Int32, Boolean, Boolean)

Codifica o texto de entrada para IDs de token até o número máximo de tokens.

(Herdado de Tokenizer)
EncodeToIds(String, Boolean, Boolean, Boolean, Boolean, Boolean)

Codifica o texto de entrada em IDs de tokens.

EncodeToIds(String, Boolean, Boolean)

Codifica o texto de entrada em IDs de token.

(Herdado de Tokenizer)
EncodeToIds(String, Int32, Boolean, Boolean, Boolean, String, Int32, Boolean, Boolean)

Codifica o texto de entrada em IDs de tokens até o número máximo de tokens.

EncodeToIds(String, Int32, String, Int32, Boolean, Boolean)

Codifica o texto de entrada para IDs de token até o número máximo de tokens.

<param name="text">O texto a ser codificado.</param> (Herdado de Tokenizer)
EncodeToIds(String, ReadOnlySpan<Char>, EncodeSettings)

Codifica o texto de entrada em IDs de token.

EncodeToTokens(ReadOnlySpan<Char>, Boolean, Boolean, Boolean, String, Boolean, Boolean)

Codifica o texto de entrada para objeto tem a lista de tokens, IDs de tokens, mapeamento de deslocamento de tokens.

EncodeToTokens(ReadOnlySpan<Char>, String, Boolean, Boolean)

Codifica o texto de entrada em uma lista de EncodedTokens.

(Herdado de Tokenizer)
EncodeToTokens(String, Boolean, Boolean, Boolean, String, Boolean, Boolean)

Codifica o texto de entrada para objeto tem a lista de tokens, IDs de tokens, mapeamento de deslocamento de tokens.

EncodeToTokens(String, ReadOnlySpan<Char>, EncodeSettings)

Codifica o texto de entrada em uma lista de EncodedTokens.

EncodeToTokens(String, String, Boolean, Boolean)

Codifica o texto de entrada em uma lista de EncodedTokens.

(Herdado de Tokenizer)
GetIndexByTokenCount(ReadOnlySpan<Char>, Int32, Boolean, Boolean, Boolean, String, Int32, Boolean, Boolean)

Localize o índice da capacidade máxima de codificação desde o início dentro do texto sem ultrapassar o limite de token.

GetIndexByTokenCount(ReadOnlySpan<Char>, Int32, String, Int32, Boolean, Boolean)

Localize o índice da capacidade máxima de codificação sem ultrapassar o limite de token.

(Herdado de Tokenizer)
GetIndexByTokenCount(String, Int32, Boolean, Boolean, Boolean, String, Int32, Boolean, Boolean)

Localize o índice da capacidade máxima de codificação desde o início dentro do texto sem ultrapassar o limite de token.

GetIndexByTokenCount(String, Int32, String, Int32, Boolean, Boolean)

Localize o índice da capacidade máxima de codificação sem ultrapassar o limite de token.

(Herdado de Tokenizer)
GetIndexByTokenCount(String, ReadOnlySpan<Char>, EncodeSettings, Boolean, String, Int32)

Localize o índice da capacidade máxima de codificação sem ultrapassar o limite de token.

GetIndexByTokenCountFromEnd(ReadOnlySpan<Char>, Int32, Boolean, Boolean, Boolean, String, Int32, Boolean, Boolean)

Localize o índice da capacidade máxima de codificação do final dentro do texto sem ultrapassar o limite de token.

GetIndexByTokenCountFromEnd(ReadOnlySpan<Char>, Int32, String, Int32, Boolean, Boolean)

Localize o índice da capacidade máxima de codificação sem ultrapassar o limite de token.

(Herdado de Tokenizer)
GetIndexByTokenCountFromEnd(String, Int32, Boolean, Boolean, Boolean, String, Int32, Boolean, Boolean)

Localize o índice da capacidade máxima de codificação do final dentro do texto sem ultrapassar o limite de token.

GetIndexByTokenCountFromEnd(String, Int32, String, Int32, Boolean, Boolean)

Localize o índice da capacidade máxima de codificação sem ultrapassar o limite de token.

(Herdado de Tokenizer)

Aplica-se a