updates
This commit is contained in:
@@ -54,7 +54,7 @@ class BallInACupReward(alr_reward_fct.AlrReward):
|
||||
action_cost = np.sum(np.square(action))
|
||||
|
||||
if self.check_collision(sim):
|
||||
reward = - 1e-5 * action_cost - 1000
|
||||
reward = - 1e-4 * action_cost - 1000
|
||||
return reward, False, True
|
||||
|
||||
if step == self.sim_time - 1:
|
||||
@@ -62,10 +62,10 @@ class BallInACupReward(alr_reward_fct.AlrReward):
|
||||
dist_final = self.dists_final[-1]
|
||||
|
||||
cost = 0.5 * min_dist + 0.5 * dist_final
|
||||
reward = np.exp(-2 * cost) - 1e-5 * action_cost
|
||||
reward = np.exp(-2 * cost) - 1e-4 * action_cost
|
||||
success = dist_final < 0.05 and ball_in_cup
|
||||
else:
|
||||
reward = - 1e-5 * action_cost
|
||||
reward = - 1e-4 * action_cost
|
||||
success = False
|
||||
|
||||
return reward, success, False
|
||||
|
||||
@@ -1,4 +1,4 @@
|
||||
from alr_envs.utils.dmp_env_wrapper import DmpEnvWrapper
|
||||
from alr_envs.utils.detpmp_env_wrapper import DetPMPEnvWrapper
|
||||
from alr_envs.mujoco.ball_in_a_cup.ball_in_a_cup import ALRBallInACupEnv
|
||||
from alr_envs.mujoco.ball_in_a_cup.ball_in_a_cup_simple import ALRBallInACupEnv as ALRBallInACupEnvSimple
|
||||
|
||||
@@ -20,18 +20,18 @@ def make_simple_env(rank, seed=0):
|
||||
def _init():
|
||||
env = ALRBallInACupEnvSimple()
|
||||
|
||||
env = DmpEnvWrapper(env,
|
||||
policy_type="motor",
|
||||
start_pos=env.start_pos[1::2],
|
||||
final_pos=env.start_pos[1::2],
|
||||
num_dof=3,
|
||||
num_basis=8,
|
||||
duration=3.5,
|
||||
alpha_phase=3,
|
||||
post_traj_time=4.5,
|
||||
dt=env.dt,
|
||||
learn_goal=False,
|
||||
weights_scale=50)
|
||||
env = DetPMPEnvWrapper(env,
|
||||
num_dof=3,
|
||||
num_basis=5,
|
||||
width=0.005,
|
||||
policy_type="motor",
|
||||
start_pos=env.start_pos[1::2],
|
||||
duration=3.5,
|
||||
post_traj_time=4.5,
|
||||
dt=env.dt,
|
||||
weights_scale=0.1,
|
||||
zero_centered=True
|
||||
)
|
||||
|
||||
env.seed(seed + rank)
|
||||
return env
|
||||
|
||||
Reference in New Issue
Block a user