mirror of
https://github.com/saymrwulf/stable-baselines3.git
synced 2026-07-24 19:43:50 +00:00
Remove deprecated monitor format and improve tests
This commit is contained in:
parent
a2b1bf06d3
commit
8b559d71ab
3 changed files with 44 additions and 45 deletions
|
|
@ -12,6 +12,7 @@ Breaking Changes:
|
|||
- Return type of `evaluation.evaluate_policy()` has been changed
|
||||
- Refactored the replay buffer to avoid transformation between PyTorch and NumPy
|
||||
- Created `OffPolicyRLModel` base class
|
||||
- Remove deprecated JSON format for `Monitor`
|
||||
|
||||
New Features:
|
||||
^^^^^^^^^^^^^
|
||||
|
|
|
|||
|
|
@ -8,33 +8,47 @@ import gym
|
|||
from torchy_baselines.common.monitor import Monitor, get_monitor_files, load_results
|
||||
|
||||
|
||||
def test_monitor():
|
||||
def test_monitor(tmp_path):
|
||||
"""
|
||||
test the monitor wrapper
|
||||
"""
|
||||
env = gym.make("CartPole-v1")
|
||||
env.seed(0)
|
||||
monitor_file = "/tmp/stable_baselines-test-{}.monitor.csv".format(uuid.uuid4())
|
||||
monitor_file = os.path.join(str(tmp_path), "stable_baselines-test-{}.monitor.csv".format(uuid.uuid4()))
|
||||
monitor_env = Monitor(env, monitor_file)
|
||||
monitor_env.reset()
|
||||
for _ in range(1000):
|
||||
_, _, done, _ = monitor_env.step(0)
|
||||
total_steps = 1000
|
||||
ep_rewards = []
|
||||
ep_lengths = []
|
||||
ep_len, ep_reward = 0, 0
|
||||
for _ in range(total_steps):
|
||||
_, reward, done, _ = monitor_env.step(0)
|
||||
ep_len += 1
|
||||
ep_reward += reward
|
||||
if done:
|
||||
ep_rewards.append(ep_reward)
|
||||
ep_lengths.append(ep_len)
|
||||
monitor_env.reset()
|
||||
ep_len, ep_reward = 0, 0
|
||||
|
||||
file_handler = open(monitor_file, 'rt')
|
||||
monitor_env.close()
|
||||
assert monitor_env.get_total_steps() == total_steps
|
||||
assert sum(ep_lengths) == sum(monitor_env.get_episode_lengths())
|
||||
assert sum(monitor_env.get_episode_rewards()) == sum(ep_rewards)
|
||||
_ = monitor_env.get_episode_times()
|
||||
|
||||
first_line = file_handler.readline()
|
||||
assert first_line.startswith('#')
|
||||
metadata = json.loads(first_line[1:])
|
||||
assert metadata['env_id'] == "CartPole-v1"
|
||||
assert set(metadata.keys()) == {'env_id', 't_start'}, "Incorrect keys in monitor metadata"
|
||||
with open(monitor_file, 'rt') as file_handler:
|
||||
first_line = file_handler.readline()
|
||||
assert first_line.startswith('#')
|
||||
metadata = json.loads(first_line[1:])
|
||||
assert metadata['env_id'] == "CartPole-v1"
|
||||
assert set(metadata.keys()) == {'env_id', 't_start'}, "Incorrect keys in monitor metadata"
|
||||
|
||||
last_logline = pandas.read_csv(file_handler, index_col=None)
|
||||
assert set(last_logline.keys()) == {'l', 't', 'r'}, "Incorrect keys in monitor logline"
|
||||
file_handler.close()
|
||||
last_logline = pandas.read_csv(file_handler, index_col=None)
|
||||
assert set(last_logline.keys()) == {'l', 't', 'r'}, "Incorrect keys in monitor logline"
|
||||
os.remove(monitor_file)
|
||||
|
||||
|
||||
def test_monitor_load_results(tmp_path):
|
||||
"""
|
||||
test load_results on log files produced by the monitor wrapper
|
||||
|
|
|
|||
|
|
@ -14,22 +14,21 @@ import numpy as np
|
|||
|
||||
class Monitor(gym.Wrapper):
|
||||
EXT = "monitor.csv"
|
||||
file_handler = None
|
||||
|
||||
def __init__(self,
|
||||
env: gym.Env,
|
||||
filename: Optional[str] = None,
|
||||
allow_early_resets: bool = True,
|
||||
reset_keywords=(),
|
||||
info_keywords=()):
|
||||
reset_keywords: Tuple[str, ...] = (),
|
||||
info_keywords: Tuple[str, ...] = ()):
|
||||
"""
|
||||
A monitor wrapper for Gym environments, it is used to know the episode reward, length, time and other data.
|
||||
|
||||
:param env: (gym.Env) The environment
|
||||
:param filename: (Optional[str]) the location to save a log file, can be None for no log
|
||||
:param allow_early_resets: (bool) allows the reset of the environment before it is done
|
||||
:param reset_keywords: (tuple) extra keywords for the reset call, if extra parameters are needed at reset
|
||||
:param info_keywords: (tuple) extra information to log, from the information return of environment.step
|
||||
:param reset_keywords: (Tuple[str, ...]) extra keywords for the reset call, if extra parameters are needed at reset
|
||||
:param info_keywords: (Tuple[str, ...]) extra information to log, from the information return of environment.step
|
||||
"""
|
||||
super(Monitor, self).__init__(env=env)
|
||||
self.t_start = time.time()
|
||||
|
|
@ -93,12 +92,12 @@ class Monitor(gym.Wrapper):
|
|||
if done:
|
||||
self.needs_reset = True
|
||||
ep_rew = sum(self.rewards)
|
||||
eplen = len(self.rewards)
|
||||
ep_info = {"r": round(ep_rew, 6), "l": eplen, "t": round(time.time() - self.t_start, 6)}
|
||||
ep_len = len(self.rewards)
|
||||
ep_info = {"r": round(ep_rew, 6), "l": ep_len, "t": round(time.time() - self.t_start, 6)}
|
||||
for key in self.info_keywords:
|
||||
ep_info[key] = info[key]
|
||||
self.episode_rewards.append(ep_rew)
|
||||
self.episode_lengths.append(eplen)
|
||||
self.episode_lengths.append(ep_len)
|
||||
self.episode_times.append(time.time() - self.t_start)
|
||||
ep_info.update(self.current_reset_info)
|
||||
if self.logger:
|
||||
|
|
@ -168,41 +167,26 @@ def get_monitor_files(path: str) -> List[str]:
|
|||
|
||||
def load_results(path: str) -> pandas.DataFrame:
|
||||
"""
|
||||
Load all Monitor logs from a given directory path matching ``*monitor.csv`` and ``*monitor.json``
|
||||
Load all Monitor logs from a given directory path matching ``*monitor.csv``
|
||||
|
||||
:param path: (str) the directory path containing the log file(s)
|
||||
:return: (pandas.DataFrame) the logged data
|
||||
"""
|
||||
# get both csv and (old) json files
|
||||
monitor_files = (glob(os.path.join(path, "*monitor.json")) + get_monitor_files(path))
|
||||
if not monitor_files:
|
||||
monitor_files = get_monitor_files(path)
|
||||
if len(monitor_files) == 0:
|
||||
raise LoadMonitorResultsError("no monitor files of the form *%s found in %s" % (Monitor.EXT, path))
|
||||
data_frames = []
|
||||
headers = []
|
||||
data_frames, headers = [], []
|
||||
for file_name in monitor_files:
|
||||
with open(file_name, 'rt') as file_handler:
|
||||
if file_name.endswith('csv'):
|
||||
first_line = file_handler.readline()
|
||||
assert first_line[0] == '#'
|
||||
header = json.loads(first_line[1:])
|
||||
data_frame = pandas.read_csv(file_handler, index_col=None)
|
||||
headers.append(header)
|
||||
elif file_name.endswith('json'): # Deprecated json format
|
||||
episodes = []
|
||||
lines = file_handler.readlines()
|
||||
header = json.loads(lines[0])
|
||||
headers.append(header)
|
||||
for line in lines[1:]:
|
||||
episode = json.loads(line)
|
||||
episodes.append(episode)
|
||||
data_frame = pandas.DataFrame(episodes)
|
||||
else:
|
||||
assert 0, 'unreachable'
|
||||
first_line = file_handler.readline()
|
||||
assert first_line[0] == '#'
|
||||
header = json.loads(first_line[1:])
|
||||
data_frame = pandas.read_csv(file_handler, index_col=None)
|
||||
headers.append(header)
|
||||
data_frame['t'] += header['t_start']
|
||||
data_frames.append(data_frame)
|
||||
data_frame = pandas.concat(data_frames)
|
||||
data_frame.sort_values('t', inplace=True)
|
||||
data_frame.reset_index(inplace=True)
|
||||
data_frame['t'] -= min(header['t_start'] for header in headers)
|
||||
# data_frame.headers = headers # HACK to preserve backwards compatibility
|
||||
return data_frame
|
||||
|
|
|
|||
Loading…
Reference in a new issue