Implemented prior conditioned annealing (untested)

This commit is contained in:
2023-04-25 17:05:34 +02:00
parent 09159774d9
commit 76ea3a6326
4 changed files with 694 additions and 6 deletions
+4 -2
View File
@@ -25,7 +25,7 @@ from stable_baselines3.common.torch_layers import (
MlpExtractor,
NatureCNN,
)
from stable_baselines3.common.type_aliases import Schedule
from stable_baselines3.common.type_aliases import Schedules
from stable_baselines3.common.policies import BasePolicy
from stable_baselines3.common.torch_layers import (
@@ -88,6 +88,7 @@ class ActorCriticPolicy(BasePolicy):
activation_fn: Type[nn.Module] = nn.Tanh,
ortho_init: bool = True,
use_sde: bool = False,
use_pca: bool = False,
std_init: float = 1.0,
full_std: bool = True,
sde_net_arch: Optional[List[int]] = None,
@@ -153,6 +154,7 @@ class ActorCriticPolicy(BasePolicy):
"sde_net_arch is deprecated and will be removed in SB3 v2.4.0.", DeprecationWarning)
self.use_sde = use_sde
self.use_pca = use_pca
self.dist_kwargs = dist_kwargs
self.sqrt_induced_gaussian = sqrt_induced_gaussian
@@ -160,7 +162,7 @@ class ActorCriticPolicy(BasePolicy):
# Action distribution
self.action_dist = make_proba_distribution(
action_space, use_sde=use_sde, dist_kwargs=dist_kwargs)
action_space, use_sde=use_sde, use_pca=use_pca, dist_kwargs=dist_kwargs)
self._build(lr_schedule)