Pesquisa de mestrado · IA para Jogos · UFRGS

HTN Method Selection Guided by Multi-Objective Reinforcement Learning and Dynamic Preferences

Instituto de Informática, Universidade Federal do Rio Grande do Sul

O HTN define o que é válido.

O MORL aprende o que é preferível.

As preferências dinâmicas determinam o que importa agora.

Um NPC escrito com uma rede hierárquica de tarefas é válido por construção: ele só faz o que o designer permitiu. O preço é a rigidez — quando as prioridades mudam, e segurança passa a valer mais que velocidade, o domínio precisa ser reescrito. Soltar um aprendiz sobre as ações primitivas resolve a rigidez e joga fora a garantia. Este trabalho move o aprendizado para outro lugar: a escolha do método.

Filtragem: o domínio diz o que é legal

Em cada tarefa composta, o HTN expõe apenas os métodos cujas pré-condições valem no estado atual. Tudo o que é semanticamente inválido sob as restrições do designer sai de cena antes de o aprendizado ser consultado.

Aprendizado: MORL condicionado a preferências escolhe entre os sobreviventes

As recompensas são vetores, não escalares, então objetivos em conflito permanecem separados em vez de colapsar num número só. Condicionar a política a um vetor de preferências dá um único agente que cobre o espaço de trade-offs: para toda preferência linear existe uma política ótima no conjunto de cobertura convexa.

Preferências: o que importa, agora

O vetor de pesos carrega o trade-off atual entre missão, segurança, recursos e tempo. Mudá-lo muda o método selecionado — sem tocar no domínio HTN. É esse o ponto: adaptação sem reautoria.

Crédito onde a decisão foi tomada

Só o método selecionado é decomposto, e as tarefas primitivas seguem em execução convencional. O crédito é atribuído no nível da decisão hierárquica, e não a ações individuais, que é o que mantém o sinal de aprendizado legível e o comportamento explicável.

Como será avaliado

Comparar

  • HTN por primeiro aplicável
  • HTN heurístico
  • HTN-RL escalar
  • RL escalar contextual + máscara HTN
  • HTN + MORL condicionado a preferências

Estressar

  • Preferências dinâmicas
  • Contexto inédito
  • Preferências não vistas

Medir

  • Desempenho
  • Adaptação
  • Generalização
  • Validade semântica
  • Latência

Materiais

O artigo principal não está publicado aqui. O que está disponível é o pôster e, quando sair, o artigo do ERAMIA-RS.

HTN Method Selection Guided by Multi-Objective Reinforcement Learning and Dynamic Preferences
Pôster: arquitetura, atribuição hierárquica de crédito e os experimentos propostos.
  • Pôster (PDF) UFRGS · 1,1 MB
  • Artigo do ERAMIA-RS Em preparação para ERAMIA-RS
  • Protótipo Protótipo em grid world com execução HTN, sensoriamento, navegação e replanejamento. Recompensas vetoriais, objetivos conflitantes e preferências dinâmicas são o próximo passo. O repositório é privado enquanto o trabalho está em andamento.