diff --git a/HER/bitflip/main.py b/HER/bitflip/main.py index bc60b49..dbbf217 100644 --- a/HER/bitflip/main.py +++ b/HER/bitflip/main.py @@ -53,7 +53,7 @@ def main(): max_size = 1_000_000 input_shape = n_bits memory = HER(max_mem=max_size, input_shape=input_shape, n_actions=1, - batch_size=batch_size, goal_shape=n_bits, strategy=None, + batch_size=batch_size, goal_shape=n_bits, strategy='final', reward_fn=env.compute_reward) agent = Agent(lr=0.001, epsilon=0.2, n_actions=n_bits, eps_dec=0.0, batch_size=batch_size, input_dims=2*input_shape, gamma=0.98) diff --git a/HER/bitflip/test_her.py b/HER/bitflip/test_her.py index 9d2a5d9..e9b3756 100644 --- a/HER/bitflip/test_her.py +++ b/HER/bitflip/test_her.py @@ -23,7 +23,7 @@ while not d: action = env.action_space_sample() o_, r, d, i = env.step(action) - agl_ = o_[2*n_bits:3*n_bits] + agl_ = o_[n_bits:2*n_bits] s.append(o[:n_bits]) a.append(action) re.append(r)