Observação
O acesso a essa página exige autorização. Você pode tentar entrar ou alterar diretórios.
O acesso a essa página exige autorização. Você pode tentar alterar os diretórios.
Importante
A partir de 20 de setembro de 2023, você não pode criar novos recursos do Personalizador. O serviço Personalizador está sendo desativado em 25 de agosto de 2026. Recomendamos migrar para o software livre microsoft/learning-loop.
O Aprendizado de Reforço é uma abordagem para aprendizado de máquina que aprende comportamentos recebendo comentários de seu uso.
O Aprendizado por Reforço funciona por:
- Proporcionando uma oportunidade ou grau de liberdade para promulgar um comportamento - como tomar decisões ou escolhas.
- Fornecendo informações contextuais sobre o ambiente e as opções.
- Fornecendo comentários sobre como o comportamento atinge uma determinada meta.
Embora haja muitos subtipos e estilos de aprendizado por reforço, é assim que o conceito funciona no Personalizador:
- Seu aplicativo oferece a oportunidade de mostrar uma parte do conteúdo de uma lista de alternativas.
- Seu aplicativo fornece informações sobre cada alternativa e o contexto do usuário.
- Seu aplicativo calcula uma pontuação de recompensa.
Ao contrário de algumas abordagens de aprendizado por reforço, o Personalizador não requer uma simulação para funcionar. Seus algoritmos de aprendizagem são projetados para reagir a um mundo externo (versus controlá-lo) e aprender com cada ponto de dados, entendendo que é uma oportunidade única que custa tempo e dinheiro para criar, e que há um arrependimento não nulo (perda de recompensa possível) se houver um desempenho subótimo.
Que tipo de algoritmos de aprendizado de reforço o Personalizador usa?
A versão atual do Personalizador usa bandidos contextuais, uma abordagem do aprendizado de reforço que é estruturada em torno da tomada de decisões ou da realização de escolhas entre ações discretas, em determinado contexto.
A memória de decisão, o modelo que foi treinado para capturar a melhor decisão possível, dado um contexto, usa um conjunto de modelos lineares. Eles têm demonstrado repetidamente resultados positivos para os negócios e são uma abordagem comprovada, em parte porque podem aprender com o mundo real muito rapidamente sem precisar de treinamento de múltiplas passagens, e em parte porque podem complementar modelos de aprendizagem supervisionada e modelos de rede neural profunda.
A alocação do tráfego de investigação/melhor ação é feita aleatoriamente seguindo o percentual definido para a exploração, e o algoritmo padrão para a exploração é o epsílon Greedy.
Histórico de bandidos contextuais
John Langford cunhou o nome Contextual Bandits (Langford e Zhang [2007]) para descrever um subconjunto tratável de aprendizado de reforço e trabalhou em meia dúzia de artigos melhorando nossa compreensão de como aprender neste paradigma:
- Beygelzimer et al. [2011]
- Dudík et al. [2011a, b]
- Agarwal et al. [2014, 2012]
- Beygelzimer e Langford [2009]
- Li et al. [2010]
John também deu vários tutoriais anteriormente sobre tópicos como Previsão Conjunta (ICML 2015), Teoria de Bandido Contextual (NIPS 2013), Aprendizado Ativo (ICML 2009) e Limites de Complexidade de Exemplo (ICML 2003)
Quais estruturas de machine learning o Personalizador usa?
Atualmente, o Personalizador usa Vowpal Wabbit como base para o aprendizado de máquina. Essa estrutura permite a taxa de transferência máxima e a menor latência ao fazer classificações de personalização e treinar o modelo com todos os eventos.
Referências
- Tomando decisões contextuais com baixa dívida técnica
- Uma abordagem de reduções para classificação justa
- Bandidos contextuais eficientes em mundos não estacionários
- Previsão de perdas residuais: aprendizado por reforço sem feedback incremental
- Mapeamento de instruções e observações visuais para ações com aprendizado por reforço
- Aprendendo a pesquisar melhor que seu professor