{"product_id":"aprendizagem-por-reforco-von-satyanarayana-s-thayyaba-khatoon-md-und-n-v-madhu-bindu","title":"Aprendizagem por reforço","description":"\u003cp\u003eEste livro está estruturado em cinco unidades, oferecendo uma experiência de aprendizagem holística. A viagem começa com uma introdução aos algoritmos bandit, explorando conceitos fundamentais como os algoritmos Upper Confidence Bound (UCB) e Probably Approximately Correct (PAC). A unidade seguinte introduz a estrutura completa da Aprendizagem por Reforço (RL), indo além dos algoritmos bandit para considerar as interacções agente-ambiente ao longo de vários passos de tempo. Os processos de decisão de Markov (MDP) são introduzidos como um quadro fundamental para modelar tarefas de tomada de decisão sequenciais. A quarta unidade abrange métodos de programação dinâmica, métodos de diferença temporal (TD) e a equação de optimalidade de Bellman em RL. Estes conceitos permitem aos agentes planear, aprender e otimizar eficazmente as suas acções. A unidade final explora técnicas avançadas de RL, como traços de elegibilidade, aproximação de funções, métodos de mínimos quadrados, Q-learning ajustado, Deep Q-Network (DQN) e algoritmos de gradiente de política.\u003c\/p\u003e\u003cdiv class=\"aw-variant-hidden-subtitle-div\" id=\"aw-variant-subtitle-9786206403371\"\u003e\u003ch3\u003eLivro da nova geração\u003c\/h3\u003e\u003c\/div\u003e","brand":"Autorenwelt Shop","offers":[{"title":"Softcover - 9786206403371","offer_id":47027264061765,"sku":"9786206403371","price":68.9,"currency_code":"EUR","in_stock":true}],"thumbnail_url":"\/\/cdn.shopify.com\/s\/files\/1\/0940\/0622\/files\/a007a814-4536-4c9d-a080-21533f1b070c.jpg?v=1758694842","url":"https:\/\/shop.autorenwelt.de\/products\/aprendizagem-por-reforco-von-satyanarayana-s-thayyaba-khatoon-md-und-n-v-madhu-bindu","provider":"Autorenwelt Shop","version":"1.0","type":"link"}