Variance reduction for policy gradient with action-dependent factorized baselines
OpenAI Blog
·
·
1 views