<?xml version="1.0" encoding="UTF-8"?><urlset xmlns="http://www.sitemaps.org/schemas/sitemap/0.9"><url><loc>https://oharauniversity.com</loc></url><url><loc>https://oharauniversity.com/blog/rlhf-llm-alignment-ppo-to-dpo</loc></url><url><loc>https://oharauniversity.com/blog/meta-rl-rl2-to-pearl</loc></url><url><loc>https://oharauniversity.com/blog/imitation-learning-inverse-rl-bc-to-gail</loc></url><url><loc>https://oharauniversity.com/blog/exploration-strategies-epsilon-greedy-to-rnd</loc></url><url><loc>https://oharauniversity.com/blog/hierarchical-rl-options-to-feudal-networks</loc></url><url><loc>https://oharauniversity.com/blog/offline-rl-bcq-to-decision-transformer</loc></url><url><loc>https://oharauniversity.com/blog/multi-agent-rl-independent-to-qmix</loc></url><url><loc>https://oharauniversity.com/blog/model-based-rl-dyna-q-to-dreamer</loc></url><url><loc>https://oharauniversity.com/blog/policy-gradient-reinforce-to-natural-pg</loc></url><url><loc>https://oharauniversity.com/blog/q-learning-tabular-to-rainbow</loc></url><url><loc>https://oharauniversity.com/blog/actor-critic-methods-a2c-to-sac</loc></url></urlset>