{
  "best_metric": null,
  "best_model_checkpoint": null,
  "epoch": 0.19665683382497542,
  "eval_steps": 500,
  "global_step": 100,
  "is_hyper_param_search": false,
  "is_local_process_zero": true,
  "is_world_process_zero": true,
  "log_history": [
    {
      "advantages": 2.7939677238464355e-09,
      "completion_length": 8.2421875,
      "epoch": 0.0019665683382497543,
      "grad_norm": 73.396728515625,
      "kl": 0.0,
      "learning_rate": 9.996062992125985e-07,
      "loss": -0.0,
      "reward": 0.421875,
      "reward_mean": 0.421875,
      "reward_std": 0.4207838624715805,
      "rewards/accuracy_reward": 0.3671875,
      "rewards/format_reward": 0.0546875,
      "step": 1
    },
    {
      "advantages": 1.30385160446167e-08,
      "completion_length": 6.2265625,
      "epoch": 0.003933136676499509,
      "grad_norm": 33.743553161621094,
      "kl": 0.00023555755615234375,
      "learning_rate": 9.992125984251968e-07,
      "loss": 0.0,
      "reward": 0.3671875,
      "reward_mean": 0.3671875,
      "reward_std": 0.3780332952737808,
      "rewards/accuracy_reward": 0.3359375,
      "rewards/format_reward": 0.03125,
      "step": 2
    },
    {
      "advantages": 2.7939677238464355e-09,
      "completion_length": 6.890625,
      "epoch": 0.0058997050147492625,
      "grad_norm": 30.476116180419922,
      "kl": 0.0075225830078125,
      "learning_rate": 9.988188976377952e-07,
      "loss": 0.0003,
      "reward": 0.1640625,
      "reward_mean": 0.1640625,
      "reward_std": 0.23516450077295303,
      "rewards/accuracy_reward": 0.1484375,
      "rewards/format_reward": 0.015625,
      "step": 3
    },
    {
      "advantages": 3.725290298461914e-09,
      "completion_length": 5.390625,
      "epoch": 0.007866273352999017,
      "grad_norm": 55.89965057373047,
      "kl": 0.008209228515625,
      "learning_rate": 9.984251968503935e-07,
      "loss": 0.0003,
      "reward": 0.3203125,
      "reward_mean": 0.3203125,
      "reward_std": 0.3277340978384018,
      "rewards/accuracy_reward": 0.296875,
      "rewards/format_reward": 0.0234375,
      "step": 4
    },
    {
      "advantages": 6.51925802230835e-09,
      "completion_length": 18.703125,
      "epoch": 0.00983284169124877,
      "grad_norm": 33.78343200683594,
      "kl": 0.0233154296875,
      "learning_rate": 9.98031496062992e-07,
      "loss": 0.0009,
      "reward": 0.3359375,
      "reward_mean": 0.3359375,
      "reward_std": 0.3921879827976227,
      "rewards/accuracy_reward": 0.296875,
      "rewards/format_reward": 0.0390625,
      "step": 5
    },
    {
      "advantages": -9.313225746154785e-10,
      "completion_length": 14.34375,
      "epoch": 0.011799410029498525,
      "grad_norm": 31.182445526123047,
      "kl": 0.11962890625,
      "learning_rate": 9.976377952755906e-07,
      "loss": 0.0048,
      "reward": 0.4609375,
      "reward_mean": 0.4609375,
      "reward_std": 0.366675928235054,
      "rewards/accuracy_reward": 0.4140625,
      "rewards/format_reward": 0.046875,
      "step": 6
    },
    {
      "advantages": -9.313225746154785e-10,
      "completion_length": 16.015625,
      "epoch": 0.01376597836774828,
      "grad_norm": 36.71164321899414,
      "kl": 0.17236328125,
      "learning_rate": 9.97244094488189e-07,
      "loss": 0.0069,
      "reward": 0.4140625,
      "reward_mean": 0.4140625,
      "reward_std": 0.36344416439533234,
      "rewards/accuracy_reward": 0.34375,
      "rewards/format_reward": 0.0703125,
      "step": 7
    },
    {
      "advantages": 4.656612873077393e-10,
      "completion_length": 14.2890625,
      "epoch": 0.015732546705998034,
      "grad_norm": 20.71697425842285,
      "kl": 0.1279296875,
      "learning_rate": 9.968503937007873e-07,
      "loss": 0.0051,
      "reward": 0.328125,
      "reward_mean": 0.328125,
      "reward_std": 0.3781374543905258,
      "rewards/accuracy_reward": 0.234375,
      "rewards/format_reward": 0.09375,
      "step": 8
    },
    {
      "advantages": 1.0244548320770264e-08,
      "completion_length": 18.4140625,
      "epoch": 0.017699115044247787,
      "grad_norm": 44.881996154785156,
      "kl": 0.144287109375,
      "learning_rate": 9.964566929133858e-07,
      "loss": 0.0058,
      "reward": 0.4609375,
      "reward_mean": 0.4609375,
      "reward_std": 0.425466924905777,
      "rewards/accuracy_reward": 0.359375,
      "rewards/format_reward": 0.1015625,
      "step": 9
    },
    {
      "advantages": 6.984919309616089e-09,
      "completion_length": 31.625,
      "epoch": 0.01966568338249754,
      "grad_norm": 20.24094581604004,
      "kl": 0.30615234375,
      "learning_rate": 9.960629921259842e-07,
      "loss": 0.0123,
      "reward": 0.4140625,
      "reward_mean": 0.4140625,
      "reward_std": 0.4798755645751953,
      "rewards/accuracy_reward": 0.1953125,
      "rewards/format_reward": 0.21875,
      "step": 10
    },
    {
      "advantages": 6.28642737865448e-09,
      "completion_length": 58.515625,
      "epoch": 0.021632251720747297,
      "grad_norm": 19.67401885986328,
      "kl": 0.509765625,
      "learning_rate": 9.956692913385827e-07,
      "loss": 0.0204,
      "reward": 0.8671875,
      "reward_mean": 0.8671875,
      "reward_std": 0.5856130719184875,
      "rewards/accuracy_reward": 0.421875,
      "rewards/format_reward": 0.4453125,
      "step": 11
    },
    {
      "advantages": -1.862645149230957e-09,
      "completion_length": 73.9921875,
      "epoch": 0.02359882005899705,
      "grad_norm": 16.55826759338379,
      "kl": 0.4716796875,
      "learning_rate": 9.95275590551181e-07,
      "loss": 0.0189,
      "reward": 0.859375,
      "reward_mean": 0.859375,
      "reward_std": 0.5268974006175995,
      "rewards/accuracy_reward": 0.2734375,
      "rewards/format_reward": 0.5859375,
      "step": 12
    },
    {
      "advantages": -3.725290298461914e-09,
      "completion_length": 87.0,
      "epoch": 0.025565388397246803,
      "grad_norm": 49.7137565612793,
      "kl": 0.763671875,
      "learning_rate": 9.948818897637796e-07,
      "loss": 0.0306,
      "reward": 1.0703125,
      "reward_mean": 1.0703125,
      "reward_std": 0.42902977764606476,
      "rewards/accuracy_reward": 0.3046875,
      "rewards/format_reward": 0.765625,
      "step": 13
    },
    {
      "advantages": -6.51925802230835e-09,
      "completion_length": 77.3984375,
      "epoch": 0.02753195673549656,
      "grad_norm": 19.227468490600586,
      "kl": 0.45703125,
      "learning_rate": 9.94488188976378e-07,
      "loss": 0.0183,
      "reward": 1.0234375,
      "reward_mean": 1.0234375,
      "reward_std": 0.5277487635612488,
      "rewards/accuracy_reward": 0.296875,
      "rewards/format_reward": 0.7265625,
      "step": 14
    },
    {
      "advantages": -2.3283064365386963e-09,
      "completion_length": 104.4921875,
      "epoch": 0.029498525073746312,
      "grad_norm": 11.86002254486084,
      "kl": 0.53515625,
      "learning_rate": 9.940944881889763e-07,
      "loss": 0.0214,
      "reward": 1.3203125,
      "reward_mean": 1.3203125,
      "reward_std": 0.4756143093109131,
      "rewards/accuracy_reward": 0.4609375,
      "rewards/format_reward": 0.859375,
      "step": 15
    },
    {
      "advantages": -1.0244548320770264e-08,
      "completion_length": 112.875,
      "epoch": 0.03146509341199607,
      "grad_norm": 15.211345672607422,
      "kl": 0.517822265625,
      "learning_rate": 9.937007874015746e-07,
      "loss": 0.0208,
      "reward": 1.21875,
      "reward_mean": 1.21875,
      "reward_std": 0.5509299039840698,
      "rewards/accuracy_reward": 0.4140625,
      "rewards/format_reward": 0.8046875,
      "step": 16
    },
    {
      "advantages": -6.51925802230835e-09,
      "completion_length": 93.9140625,
      "epoch": 0.03343166175024582,
      "grad_norm": 15.568902015686035,
      "kl": 0.2431640625,
      "learning_rate": 9.933070866141732e-07,
      "loss": 0.0097,
      "reward": 1.21875,
      "reward_mean": 1.21875,
      "reward_std": 0.542364239692688,
      "rewards/accuracy_reward": 0.3671875,
      "rewards/format_reward": 0.8515625,
      "step": 17
    },
    {
      "advantages": -6.51925802230835e-09,
      "completion_length": 102.453125,
      "epoch": 0.035398230088495575,
      "grad_norm": 41.2782096862793,
      "kl": 1.21728515625,
      "learning_rate": 9.929133858267717e-07,
      "loss": 0.0487,
      "reward": 1.109375,
      "reward_mean": 1.109375,
      "reward_std": 0.5937502682209015,
      "rewards/accuracy_reward": 0.3203125,
      "rewards/format_reward": 0.7890625,
      "step": 18
    },
    {
      "advantages": -4.190951585769653e-09,
      "completion_length": 98.3125,
      "epoch": 0.03736479842674533,
      "grad_norm": 7.929398536682129,
      "kl": 0.1077880859375,
      "learning_rate": 9.9251968503937e-07,
      "loss": 0.0043,
      "reward": 1.34375,
      "reward_mean": 1.34375,
      "reward_std": 0.3829391896724701,
      "rewards/accuracy_reward": 0.4453125,
      "rewards/format_reward": 0.8984375,
      "step": 19
    },
    {
      "advantages": 0.0,
      "completion_length": 94.0234375,
      "epoch": 0.03933136676499508,
      "grad_norm": 16.730735778808594,
      "kl": 0.307373046875,
      "learning_rate": 9.921259842519684e-07,
      "loss": 0.0123,
      "reward": 1.234375,
      "reward_mean": 1.234375,
      "reward_std": 0.4302446246147156,
      "rewards/accuracy_reward": 0.3984375,
      "rewards/format_reward": 0.8359375,
      "step": 20
    },
    {
      "advantages": -6.51925802230835e-09,
      "completion_length": 97.8203125,
      "epoch": 0.04129793510324484,
      "grad_norm": 21.99318504333496,
      "kl": 1.177734375,
      "learning_rate": 9.917322834645667e-07,
      "loss": 0.0472,
      "reward": 1.1640625,
      "reward_mean": 1.1640625,
      "reward_std": 0.4926678240299225,
      "rewards/accuracy_reward": 0.3359375,
      "rewards/format_reward": 0.828125,
      "step": 21
    },
    {
      "advantages": 7.916241884231567e-09,
      "completion_length": 91.359375,
      "epoch": 0.043264503441494594,
      "grad_norm": 8.741955757141113,
      "kl": 0.1123046875,
      "learning_rate": 9.913385826771653e-07,
      "loss": 0.0045,
      "reward": 1.1171875,
      "reward_mean": 1.1171875,
      "reward_std": 0.34009817242622375,
      "rewards/accuracy_reward": 0.203125,
      "rewards/format_reward": 0.9140625,
      "step": 22
    },
    {
      "advantages": -2.3283064365386963e-09,
      "completion_length": 93.953125,
      "epoch": 0.04523107177974434,
      "grad_norm": 11.802384376525879,
      "kl": 0.27587890625,
      "learning_rate": 9.909448818897638e-07,
      "loss": 0.011,
      "reward": 1.203125,
      "reward_mean": 1.203125,
      "reward_std": 0.46494027972221375,
      "rewards/accuracy_reward": 0.328125,
      "rewards/format_reward": 0.875,
      "step": 23
    },
    {
      "advantages": 2.7939677238464355e-09,
      "completion_length": 94.328125,
      "epoch": 0.0471976401179941,
      "grad_norm": 11.852699279785156,
      "kl": 0.5703125,
      "learning_rate": 9.905511811023622e-07,
      "loss": 0.0228,
      "reward": 1.2421875,
      "reward_mean": 1.2421875,
      "reward_std": 0.45807915925979614,
      "rewards/accuracy_reward": 0.375,
      "rewards/format_reward": 0.8671875,
      "step": 24
    },
    {
      "advantages": -1.3969838619232178e-09,
      "completion_length": 88.7578125,
      "epoch": 0.049164208456243856,
      "grad_norm": 13.340582847595215,
      "kl": 0.62890625,
      "learning_rate": 9.901574803149605e-07,
      "loss": 0.0252,
      "reward": 1.1171875,
      "reward_mean": 1.1171875,
      "reward_std": 0.28060516715049744,
      "rewards/accuracy_reward": 0.203125,
      "rewards/format_reward": 0.9140625,
      "step": 25
    },
    {
      "advantages": 4.656612873077393e-10,
      "completion_length": 98.4765625,
      "epoch": 0.051130776794493606,
      "grad_norm": 9.020747184753418,
      "kl": 0.20166015625,
      "learning_rate": 9.89763779527559e-07,
      "loss": 0.0081,
      "reward": 1.3984375,
      "reward_mean": 1.3984375,
      "reward_std": 0.47477173805236816,
      "rewards/accuracy_reward": 0.484375,
      "rewards/format_reward": 0.9140625,
      "step": 26
    },
    {
      "advantages": -5.122274160385132e-09,
      "completion_length": 77.9375,
      "epoch": 0.05309734513274336,
      "grad_norm": 21.881322860717773,
      "kl": 0.3818359375,
      "learning_rate": 9.893700787401574e-07,
      "loss": 0.0152,
      "reward": 1.21875,
      "reward_mean": 1.21875,
      "reward_std": 0.43768274784088135,
      "rewards/accuracy_reward": 0.296875,
      "rewards/format_reward": 0.921875,
      "step": 27
    },
    {
      "advantages": -9.313225746154785e-10,
      "completion_length": 92.25,
      "epoch": 0.05506391347099312,
      "grad_norm": 9.383493423461914,
      "kl": 0.254638671875,
      "learning_rate": 9.88976377952756e-07,
      "loss": 0.0102,
      "reward": 1.3671875,
      "reward_mean": 1.3671875,
      "reward_std": 0.3385206162929535,
      "rewards/accuracy_reward": 0.4140625,
      "rewards/format_reward": 0.953125,
      "step": 28
    },
    {
      "advantages": 3.725290298461914e-09,
      "completion_length": 85.1171875,
      "epoch": 0.05703048180924287,
      "grad_norm": 30.991477966308594,
      "kl": 1.28125,
      "learning_rate": 9.885826771653543e-07,
      "loss": 0.0513,
      "reward": 1.1640625,
      "reward_mean": 1.1640625,
      "reward_std": 0.39110979437828064,
      "rewards/accuracy_reward": 0.2578125,
      "rewards/format_reward": 0.90625,
      "step": 29
    },
    {
      "advantages": 1.862645149230957e-09,
      "completion_length": 81.1640625,
      "epoch": 0.058997050147492625,
      "grad_norm": 24.372304916381836,
      "kl": 0.0733642578125,
      "learning_rate": 9.881889763779528e-07,
      "loss": 0.0029,
      "reward": 1.171875,
      "reward_mean": 1.171875,
      "reward_std": 0.3422764390707016,
      "rewards/accuracy_reward": 0.1953125,
      "rewards/format_reward": 0.9765625,
      "step": 30
    },
    {
      "advantages": -4.656612873077393e-10,
      "completion_length": 77.625,
      "epoch": 0.06096361848574238,
      "grad_norm": 6.256011486053467,
      "kl": 0.2802734375,
      "learning_rate": 9.877952755905512e-07,
      "loss": 0.0112,
      "reward": 1.3515625,
      "reward_mean": 1.3515625,
      "reward_std": 0.3247981071472168,
      "rewards/accuracy_reward": 0.3984375,
      "rewards/format_reward": 0.953125,
      "step": 31
    },
    {
      "advantages": 3.259629011154175e-09,
      "completion_length": 82.5234375,
      "epoch": 0.06293018682399214,
      "grad_norm": 28.372577667236328,
      "kl": 0.72509765625,
      "learning_rate": 9.874015748031495e-07,
      "loss": 0.0289,
      "reward": 1.328125,
      "reward_mean": 1.328125,
      "reward_std": 0.40172310173511505,
      "rewards/accuracy_reward": 0.359375,
      "rewards/format_reward": 0.96875,
      "step": 32
    },
    {
      "advantages": 3.259629011154175e-09,
      "completion_length": 78.6015625,
      "epoch": 0.06489675516224189,
      "grad_norm": 8.32628059387207,
      "kl": 0.2509765625,
      "learning_rate": 9.87007874015748e-07,
      "loss": 0.0101,
      "reward": 1.2578125,
      "reward_mean": 1.2578125,
      "reward_std": 0.3470960259437561,
      "rewards/accuracy_reward": 0.3203125,
      "rewards/format_reward": 0.9375,
      "step": 33
    },
    {
      "advantages": -7.916241884231567e-09,
      "completion_length": 76.9921875,
      "epoch": 0.06686332350049164,
      "grad_norm": 12.231820106506348,
      "kl": 0.705078125,
      "learning_rate": 9.866141732283464e-07,
      "loss": 0.0281,
      "reward": 1.3359375,
      "reward_mean": 1.3359375,
      "reward_std": 0.36884965002536774,
      "rewards/accuracy_reward": 0.3984375,
      "rewards/format_reward": 0.9375,
      "step": 34
    },
    {
      "advantages": -6.05359673500061e-09,
      "completion_length": 85.4140625,
      "epoch": 0.0688298918387414,
      "grad_norm": 7.937285900115967,
      "kl": 0.6318359375,
      "learning_rate": 9.86220472440945e-07,
      "loss": 0.0252,
      "reward": 1.1875,
      "reward_mean": 1.1875,
      "reward_std": 0.4013403356075287,
      "rewards/accuracy_reward": 0.25,
      "rewards/format_reward": 0.9375,
      "step": 35
    },
    {
      "advantages": 3.725290298461914e-09,
      "completion_length": 65.0078125,
      "epoch": 0.07079646017699115,
      "grad_norm": 6.335597515106201,
      "kl": 0.33447265625,
      "learning_rate": 9.858267716535433e-07,
      "loss": 0.0134,
      "reward": 1.375,
      "reward_mean": 1.375,
      "reward_std": 0.21287934482097626,
      "rewards/accuracy_reward": 0.3984375,
      "rewards/format_reward": 0.9765625,
      "step": 36
    },
    {
      "advantages": 2.7939677238464355e-09,
      "completion_length": 90.34375,
      "epoch": 0.0727630285152409,
      "grad_norm": 12.471525192260742,
      "kl": 0.5400390625,
      "learning_rate": 9.854330708661416e-07,
      "loss": 0.0216,
      "reward": 1.3125,
      "reward_mean": 1.3125,
      "reward_std": 0.4211360365152359,
      "rewards/accuracy_reward": 0.375,
      "rewards/format_reward": 0.9375,
      "step": 37
    },
    {
      "advantages": 1.3969838619232178e-09,
      "completion_length": 91.015625,
      "epoch": 0.07472959685349066,
      "grad_norm": 8.75705623626709,
      "kl": 0.393798828125,
      "learning_rate": 9.850393700787402e-07,
      "loss": 0.0157,
      "reward": 1.2109375,
      "reward_mean": 1.2109375,
      "reward_std": 0.2788218855857849,
      "rewards/accuracy_reward": 0.25,
      "rewards/format_reward": 0.9609375,
      "step": 38
    },
    {
      "advantages": -1.862645149230957e-09,
      "completion_length": 78.109375,
      "epoch": 0.07669616519174041,
      "grad_norm": 11.226151466369629,
      "kl": 0.77734375,
      "learning_rate": 9.846456692913385e-07,
      "loss": 0.0311,
      "reward": 1.140625,
      "reward_mean": 1.140625,
      "reward_std": 0.39796434342861176,
      "rewards/accuracy_reward": 0.234375,
      "rewards/format_reward": 0.90625,
      "step": 39
    },
    {
      "advantages": 3.725290298461914e-09,
      "completion_length": 76.890625,
      "epoch": 0.07866273352999016,
      "grad_norm": 8.900260925292969,
      "kl": 0.314453125,
      "learning_rate": 9.84251968503937e-07,
      "loss": 0.0125,
      "reward": 1.3515625,
      "reward_mean": 1.3515625,
      "reward_std": 0.4872392266988754,
      "rewards/accuracy_reward": 0.4140625,
      "rewards/format_reward": 0.9375,
      "step": 40
    },
    {
      "advantages": -4.656612873077393e-10,
      "completion_length": 87.890625,
      "epoch": 0.08062930186823992,
      "grad_norm": 4.436505317687988,
      "kl": 0.1689453125,
      "learning_rate": 9.838582677165354e-07,
      "loss": 0.0068,
      "reward": 1.359375,
      "reward_mean": 1.359375,
      "reward_std": 0.35620683431625366,
      "rewards/accuracy_reward": 0.4140625,
      "rewards/format_reward": 0.9453125,
      "step": 41
    },
    {
      "advantages": 1.3969838619232178e-09,
      "completion_length": 79.234375,
      "epoch": 0.08259587020648967,
      "grad_norm": 7.758790969848633,
      "kl": 0.3955078125,
      "learning_rate": 9.834645669291337e-07,
      "loss": 0.0158,
      "reward": 1.140625,
      "reward_mean": 1.140625,
      "reward_std": 0.37062767148017883,
      "rewards/accuracy_reward": 0.21875,
      "rewards/format_reward": 0.921875,
      "step": 42
    },
    {
      "advantages": -8.847564458847046e-09,
      "completion_length": 84.375,
      "epoch": 0.08456243854473942,
      "grad_norm": 7.8579206466674805,
      "kl": 0.32861328125,
      "learning_rate": 9.830708661417323e-07,
      "loss": 0.0132,
      "reward": 1.3046875,
      "reward_mean": 1.3046875,
      "reward_std": 0.35983623564243317,
      "rewards/accuracy_reward": 0.421875,
      "rewards/format_reward": 0.8828125,
      "step": 43
    },
    {
      "advantages": -8.847564458847046e-09,
      "completion_length": 76.5,
      "epoch": 0.08652900688298919,
      "grad_norm": 11.924860000610352,
      "kl": 0.133056640625,
      "learning_rate": 9.826771653543306e-07,
      "loss": 0.0053,
      "reward": 1.484375,
      "reward_mean": 1.484375,
      "reward_std": 0.45704275369644165,
      "rewards/accuracy_reward": 0.5859375,
      "rewards/format_reward": 0.8984375,
      "step": 44
    },
    {
      "advantages": -9.313225746154785e-09,
      "completion_length": 73.6328125,
      "epoch": 0.08849557522123894,
      "grad_norm": 12.773225784301758,
      "kl": 0.1728515625,
      "learning_rate": 9.822834645669292e-07,
      "loss": 0.0069,
      "reward": 1.3125,
      "reward_mean": 1.3125,
      "reward_std": 0.5340957641601562,
      "rewards/accuracy_reward": 0.3984375,
      "rewards/format_reward": 0.9140625,
      "step": 45
    },
    {
      "advantages": -7.450580596923828e-09,
      "completion_length": 73.671875,
      "epoch": 0.09046214355948869,
      "grad_norm": 6.257918834686279,
      "kl": 0.404296875,
      "learning_rate": 9.818897637795275e-07,
      "loss": 0.0162,
      "reward": 1.328125,
      "reward_mean": 1.328125,
      "reward_std": 0.3570019602775574,
      "rewards/accuracy_reward": 0.3984375,
      "rewards/format_reward": 0.9296875,
      "step": 46
    },
    {
      "advantages": -3.725290298461914e-09,
      "completion_length": 76.3359375,
      "epoch": 0.09242871189773845,
      "grad_norm": 4.853702545166016,
      "kl": 0.10546875,
      "learning_rate": 9.81496062992126e-07,
      "loss": 0.0042,
      "reward": 1.2109375,
      "reward_mean": 1.2109375,
      "reward_std": 0.44745784997940063,
      "rewards/accuracy_reward": 0.3203125,
      "rewards/format_reward": 0.890625,
      "step": 47
    },
    {
      "advantages": -9.778887033462524e-09,
      "completion_length": 77.4921875,
      "epoch": 0.0943952802359882,
      "grad_norm": 6.102271556854248,
      "kl": 0.3193359375,
      "learning_rate": 9.811023622047244e-07,
      "loss": 0.0128,
      "reward": 1.2109375,
      "reward_mean": 1.2109375,
      "reward_std": 0.4329347312450409,
      "rewards/accuracy_reward": 0.3515625,
      "rewards/format_reward": 0.859375,
      "step": 48
    },
    {
      "advantages": -4.656612873077393e-10,
      "completion_length": 82.890625,
      "epoch": 0.09636184857423795,
      "grad_norm": 10.042110443115234,
      "kl": 0.2685546875,
      "learning_rate": 9.807086614173227e-07,
      "loss": 0.0108,
      "reward": 1.2265625,
      "reward_mean": 1.2265625,
      "reward_std": 0.32646483182907104,
      "rewards/accuracy_reward": 0.3203125,
      "rewards/format_reward": 0.90625,
      "step": 49
    },
    {
      "advantages": 3.725290298461914e-09,
      "completion_length": 73.9765625,
      "epoch": 0.09832841691248771,
      "grad_norm": 11.935688018798828,
      "kl": 0.2119140625,
      "learning_rate": 9.803149606299213e-07,
      "loss": 0.0084,
      "reward": 1.171875,
      "reward_mean": 1.171875,
      "reward_std": 0.40755802392959595,
      "rewards/accuracy_reward": 0.28125,
      "rewards/format_reward": 0.890625,
      "step": 50
    },
    {
      "advantages": 0.0,
      "completion_length": 78.359375,
      "epoch": 0.10029498525073746,
      "grad_norm": 28.840940475463867,
      "kl": 0.171875,
      "learning_rate": 9.799212598425196e-07,
      "loss": 0.0069,
      "reward": 1.15625,
      "reward_mean": 1.15625,
      "reward_std": 0.4017329066991806,
      "rewards/accuracy_reward": 0.2734375,
      "rewards/format_reward": 0.8828125,
      "step": 51
    },
    {
      "advantages": -3.259629011154175e-09,
      "completion_length": 72.6484375,
      "epoch": 0.10226155358898721,
      "grad_norm": 4.821761131286621,
      "kl": 0.232421875,
      "learning_rate": 9.795275590551182e-07,
      "loss": 0.0093,
      "reward": 1.15625,
      "reward_mean": 1.15625,
      "reward_std": 0.3499477952718735,
      "rewards/accuracy_reward": 0.25,
      "rewards/format_reward": 0.90625,
      "step": 52
    },
    {
      "advantages": -1.7229467630386353e-08,
      "completion_length": 66.9921875,
      "epoch": 0.10422812192723697,
      "grad_norm": 11.487689971923828,
      "kl": 0.2890625,
      "learning_rate": 9.791338582677165e-07,
      "loss": 0.0116,
      "reward": 1.078125,
      "reward_mean": 1.078125,
      "reward_std": 0.4392603039741516,
      "rewards/accuracy_reward": 0.2578125,
      "rewards/format_reward": 0.8203125,
      "step": 53
    },
    {
      "advantages": -1.862645149230957e-09,
      "completion_length": 74.8125,
      "epoch": 0.10619469026548672,
      "grad_norm": 13.841636657714844,
      "kl": 0.16015625,
      "learning_rate": 9.787401574803148e-07,
      "loss": 0.0064,
      "reward": 1.296875,
      "reward_mean": 1.296875,
      "reward_std": 0.44579020142555237,
      "rewards/accuracy_reward": 0.46875,
      "rewards/format_reward": 0.828125,
      "step": 54
    },
    {
      "advantages": -4.6566128730773926e-09,
      "completion_length": 77.0234375,
      "epoch": 0.10816125860373647,
      "grad_norm": 7.192145824432373,
      "kl": 0.10009765625,
      "learning_rate": 9.783464566929134e-07,
      "loss": 0.004,
      "reward": 1.2109375,
      "reward_mean": 1.2109375,
      "reward_std": 0.43688884377479553,
      "rewards/accuracy_reward": 0.3046875,
      "rewards/format_reward": 0.90625,
      "step": 55
    },
    {
      "advantages": -1.210719347000122e-08,
      "completion_length": 77.953125,
      "epoch": 0.11012782694198624,
      "grad_norm": 6.540230751037598,
      "kl": 0.22509765625,
      "learning_rate": 9.779527559055117e-07,
      "loss": 0.009,
      "reward": 1.1875,
      "reward_mean": 1.1875,
      "reward_std": 0.41050654649734497,
      "rewards/accuracy_reward": 0.3515625,
      "rewards/format_reward": 0.8359375,
      "step": 56
    },
    {
      "advantages": -5.587935447692871e-09,
      "completion_length": 77.484375,
      "epoch": 0.11209439528023599,
      "grad_norm": 14.802718162536621,
      "kl": 0.1748046875,
      "learning_rate": 9.775590551181103e-07,
      "loss": 0.007,
      "reward": 1.2890625,
      "reward_mean": 1.2890625,
      "reward_std": 0.49435967206954956,
      "rewards/accuracy_reward": 0.40625,
      "rewards/format_reward": 0.8828125,
      "step": 57
    },
    {
      "advantages": 4.6566128730773926e-09,
      "completion_length": 87.359375,
      "epoch": 0.11406096361848574,
      "grad_norm": 6.671513557434082,
      "kl": 0.064208984375,
      "learning_rate": 9.771653543307086e-07,
      "loss": 0.0026,
      "reward": 1.3359375,
      "reward_mean": 1.3359375,
      "reward_std": 0.39633266627788544,
      "rewards/accuracy_reward": 0.390625,
      "rewards/format_reward": 0.9453125,
      "step": 58
    },
    {
      "advantages": 5.587935447692871e-09,
      "completion_length": 88.390625,
      "epoch": 0.1160275319567355,
      "grad_norm": 7.06370735168457,
      "kl": 0.1552734375,
      "learning_rate": 9.76771653543307e-07,
      "loss": 0.0062,
      "reward": 1.109375,
      "reward_mean": 1.109375,
      "reward_std": 0.5222920477390289,
      "rewards/accuracy_reward": 0.2734375,
      "rewards/format_reward": 0.8359375,
      "step": 59
    },
    {
      "advantages": -1.3969838619232178e-09,
      "completion_length": 91.2265625,
      "epoch": 0.11799410029498525,
      "grad_norm": 4.297262191772461,
      "kl": 0.0701904296875,
      "learning_rate": 9.763779527559055e-07,
      "loss": 0.0028,
      "reward": 1.359375,
      "reward_mean": 1.359375,
      "reward_std": 0.3391612768173218,
      "rewards/accuracy_reward": 0.4609375,
      "rewards/format_reward": 0.8984375,
      "step": 60
    },
    {
      "advantages": -3.725290298461914e-09,
      "completion_length": 74.875,
      "epoch": 0.119960668633235,
      "grad_norm": 9.713900566101074,
      "kl": 0.135986328125,
      "learning_rate": 9.759842519685038e-07,
      "loss": 0.0054,
      "reward": 1.3359375,
      "reward_mean": 1.3359375,
      "reward_std": 0.30991755425930023,
      "rewards/accuracy_reward": 0.4140625,
      "rewards/format_reward": 0.921875,
      "step": 61
    },
    {
      "advantages": -4.190951585769653e-09,
      "completion_length": 84.2734375,
      "epoch": 0.12192723697148476,
      "grad_norm": 5.280374050140381,
      "kl": 0.1318359375,
      "learning_rate": 9.755905511811024e-07,
      "loss": 0.0053,
      "reward": 1.28125,
      "reward_mean": 1.28125,
      "reward_std": 0.3746369481086731,
      "rewards/accuracy_reward": 0.4140625,
      "rewards/format_reward": 0.8671875,
      "step": 62
    },
    {
      "advantages": -9.313225746154785e-10,
      "completion_length": 82.953125,
      "epoch": 0.12389380530973451,
      "grad_norm": 32.09885025024414,
      "kl": 0.09814453125,
      "learning_rate": 9.751968503937007e-07,
      "loss": 0.0039,
      "reward": 1.5,
      "reward_mean": 1.5,
      "reward_std": 0.4168272465467453,
      "rewards/accuracy_reward": 0.546875,
      "rewards/format_reward": 0.953125,
      "step": 63
    },
    {
      "advantages": 0.0,
      "completion_length": 73.8046875,
      "epoch": 0.12586037364798427,
      "grad_norm": 6.336835861206055,
      "kl": 0.107177734375,
      "learning_rate": 9.748031496062993e-07,
      "loss": 0.0043,
      "reward": 1.3203125,
      "reward_mean": 1.3203125,
      "reward_std": 0.3958475738763809,
      "rewards/accuracy_reward": 0.4140625,
      "rewards/format_reward": 0.90625,
      "step": 64
    },
    {
      "advantages": 2.3283064365386963e-09,
      "completion_length": 79.453125,
      "epoch": 0.127826941986234,
      "grad_norm": 4.610178470611572,
      "kl": 0.107421875,
      "learning_rate": 9.744094488188976e-07,
      "loss": 0.0043,
      "reward": 1.3125,
      "reward_mean": 1.3125,
      "reward_std": 0.34977948665618896,
      "rewards/accuracy_reward": 0.359375,
      "rewards/format_reward": 0.953125,
      "step": 65
    },
    {
      "advantages": 9.313225746154785e-10,
      "completion_length": 77.5390625,
      "epoch": 0.12979351032448377,
      "grad_norm": 5.720119476318359,
      "kl": 0.08984375,
      "learning_rate": 9.74015748031496e-07,
      "loss": 0.0036,
      "reward": 1.1640625,
      "reward_mean": 1.1640625,
      "reward_std": 0.393473744392395,
      "rewards/accuracy_reward": 0.2265625,
      "rewards/format_reward": 0.9375,
      "step": 66
    },
    {
      "advantages": 4.190951585769653e-09,
      "completion_length": 84.1328125,
      "epoch": 0.13176007866273354,
      "grad_norm": 4.835913181304932,
      "kl": 0.087646484375,
      "learning_rate": 9.736220472440945e-07,
      "loss": 0.0035,
      "reward": 1.2578125,
      "reward_mean": 1.2578125,
      "reward_std": 0.41207757592201233,
      "rewards/accuracy_reward": 0.328125,
      "rewards/format_reward": 0.9296875,
      "step": 67
    },
    {
      "advantages": 8.381903171539307e-09,
      "completion_length": 90.1796875,
      "epoch": 0.13372664700098327,
      "grad_norm": 6.525809288024902,
      "kl": 0.0760498046875,
      "learning_rate": 9.732283464566928e-07,
      "loss": 0.003,
      "reward": 1.328125,
      "reward_mean": 1.328125,
      "reward_std": 0.41827574372291565,
      "rewards/accuracy_reward": 0.375,
      "rewards/format_reward": 0.953125,
      "step": 68
    },
    {
      "advantages": -1.3969838619232178e-09,
      "completion_length": 90.859375,
      "epoch": 0.13569321533923304,
      "grad_norm": 4.9273576736450195,
      "kl": 0.0615234375,
      "learning_rate": 9.728346456692914e-07,
      "loss": 0.0025,
      "reward": 1.3046875,
      "reward_mean": 1.3046875,
      "reward_std": 0.2861885726451874,
      "rewards/accuracy_reward": 0.34375,
      "rewards/format_reward": 0.9609375,
      "step": 69
    },
    {
      "advantages": -5.122274160385132e-09,
      "completion_length": 86.8984375,
      "epoch": 0.1376597836774828,
      "grad_norm": 6.3384175300598145,
      "kl": 0.0799560546875,
      "learning_rate": 9.724409448818897e-07,
      "loss": 0.0032,
      "reward": 1.4765625,
      "reward_mean": 1.4765625,
      "reward_std": 0.3569970428943634,
      "rewards/accuracy_reward": 0.5234375,
      "rewards/format_reward": 0.953125,
      "step": 70
    },
    {
      "advantages": -1.862645149230957e-09,
      "completion_length": 91.8359375,
      "epoch": 0.13962635201573254,
      "grad_norm": 8.349952697753906,
      "kl": 0.091064453125,
      "learning_rate": 9.72047244094488e-07,
      "loss": 0.0036,
      "reward": 1.3671875,
      "reward_mean": 1.3671875,
      "reward_std": 0.36144891381263733,
      "rewards/accuracy_reward": 0.4296875,
      "rewards/format_reward": 0.9375,
      "step": 71
    },
    {
      "advantages": -4.190951585769653e-09,
      "completion_length": 93.2734375,
      "epoch": 0.1415929203539823,
      "grad_norm": 5.260560035705566,
      "kl": 0.070068359375,
      "learning_rate": 9.716535433070866e-07,
      "loss": 0.0028,
      "reward": 1.203125,
      "reward_mean": 1.203125,
      "reward_std": 0.22620804607868195,
      "rewards/accuracy_reward": 0.234375,
      "rewards/format_reward": 0.96875,
      "step": 72
    },
    {
      "advantages": -4.6566128730773926e-09,
      "completion_length": 90.703125,
      "epoch": 0.14355948869223206,
      "grad_norm": 3.7890641689300537,
      "kl": 0.08154296875,
      "learning_rate": 9.71259842519685e-07,
      "loss": 0.0033,
      "reward": 1.3984375,
      "reward_mean": 1.3984375,
      "reward_std": 0.27723701298236847,
      "rewards/accuracy_reward": 0.4296875,
      "rewards/format_reward": 0.96875,
      "step": 73
    },
    {
      "advantages": -8.614733815193176e-09,
      "completion_length": 89.0546875,
      "epoch": 0.1455260570304818,
      "grad_norm": 3.9344229698181152,
      "kl": 0.090087890625,
      "learning_rate": 9.708661417322835e-07,
      "loss": 0.0036,
      "reward": 1.328125,
      "reward_mean": 1.328125,
      "reward_std": 0.33274175226688385,
      "rewards/accuracy_reward": 0.3984375,
      "rewards/format_reward": 0.9296875,
      "step": 74
    },
    {
      "advantages": -2.7939677238464355e-09,
      "completion_length": 84.0703125,
      "epoch": 0.14749262536873156,
      "grad_norm": 4.234160423278809,
      "kl": 0.0850830078125,
      "learning_rate": 9.704724409448818e-07,
      "loss": 0.0034,
      "reward": 1.4375,
      "reward_mean": 1.4375,
      "reward_std": 0.34010058641433716,
      "rewards/accuracy_reward": 0.453125,
      "rewards/format_reward": 0.984375,
      "step": 75
    },
    {
      "advantages": -9.313225746154785e-10,
      "completion_length": 97.2578125,
      "epoch": 0.14945919370698132,
      "grad_norm": 10.69190502166748,
      "kl": 0.0625,
      "learning_rate": 9.700787401574804e-07,
      "loss": 0.0025,
      "reward": 1.359375,
      "reward_mean": 1.359375,
      "reward_std": 0.3079911321401596,
      "rewards/accuracy_reward": 0.3984375,
      "rewards/format_reward": 0.9609375,
      "step": 76
    },
    {
      "advantages": 0.0,
      "completion_length": 91.8984375,
      "epoch": 0.15142576204523106,
      "grad_norm": 95.32444763183594,
      "kl": 0.0677490234375,
      "learning_rate": 9.696850393700787e-07,
      "loss": 0.0027,
      "reward": 1.4453125,
      "reward_mean": 1.4453125,
      "reward_std": 0.3461739867925644,
      "rewards/accuracy_reward": 0.4765625,
      "rewards/format_reward": 0.96875,
      "step": 77
    },
    {
      "advantages": -1.862645149230957e-09,
      "completion_length": 95.0390625,
      "epoch": 0.15339233038348082,
      "grad_norm": 14.374885559082031,
      "kl": 0.08642578125,
      "learning_rate": 9.69291338582677e-07,
      "loss": 0.0035,
      "reward": 1.2109375,
      "reward_mean": 1.2109375,
      "reward_std": 0.3442206382751465,
      "rewards/accuracy_reward": 0.2578125,
      "rewards/format_reward": 0.953125,
      "step": 78
    },
    {
      "advantages": 0.0,
      "completion_length": 96.015625,
      "epoch": 0.1553588987217306,
      "grad_norm": 4.495371341705322,
      "kl": 0.0810546875,
      "learning_rate": 9.688976377952756e-07,
      "loss": 0.0032,
      "reward": 1.390625,
      "reward_mean": 1.390625,
      "reward_std": 0.37435220181941986,
      "rewards/accuracy_reward": 0.46875,
      "rewards/format_reward": 0.921875,
      "step": 79
    },
    {
      "advantages": 1.862645149230957e-09,
      "completion_length": 98.34375,
      "epoch": 0.15732546705998032,
      "grad_norm": 4.3864898681640625,
      "kl": 0.0927734375,
      "learning_rate": 9.68503937007874e-07,
      "loss": 0.0037,
      "reward": 1.3046875,
      "reward_mean": 1.3046875,
      "reward_std": 0.3569970428943634,
      "rewards/accuracy_reward": 0.3515625,
      "rewards/format_reward": 0.953125,
      "step": 80
    },
    {
      "advantages": 5.587935447692871e-09,
      "completion_length": 94.21875,
      "epoch": 0.1592920353982301,
      "grad_norm": 5.280333518981934,
      "kl": 0.0870361328125,
      "learning_rate": 9.681102362204725e-07,
      "loss": 0.0035,
      "reward": 1.28125,
      "reward_mean": 1.28125,
      "reward_std": 0.3391076475381851,
      "rewards/accuracy_reward": 0.3046875,
      "rewards/format_reward": 0.9765625,
      "step": 81
    },
    {
      "advantages": 0.0,
      "completion_length": 89.8671875,
      "epoch": 0.16125860373647985,
      "grad_norm": 8.896856307983398,
      "kl": 0.08056640625,
      "learning_rate": 9.677165354330708e-07,
      "loss": 0.0032,
      "reward": 1.3125,
      "reward_mean": 1.3125,
      "reward_std": 0.29697999358177185,
      "rewards/accuracy_reward": 0.328125,
      "rewards/format_reward": 0.984375,
      "step": 82
    },
    {
      "advantages": -2.7939677238464355e-09,
      "completion_length": 91.296875,
      "epoch": 0.16322517207472959,
      "grad_norm": 8.412531852722168,
      "kl": 0.102783203125,
      "learning_rate": 9.673228346456691e-07,
      "loss": 0.0041,
      "reward": 1.40625,
      "reward_mean": 1.40625,
      "reward_std": 0.35358209908008575,
      "rewards/accuracy_reward": 0.4609375,
      "rewards/format_reward": 0.9453125,
      "step": 83
    },
    {
      "advantages": -7.450580596923828e-09,
      "completion_length": 92.046875,
      "epoch": 0.16519174041297935,
      "grad_norm": 6.489206790924072,
      "kl": 0.123046875,
      "learning_rate": 9.669291338582677e-07,
      "loss": 0.0049,
      "reward": 1.359375,
      "reward_mean": 1.359375,
      "reward_std": 0.37246015667915344,
      "rewards/accuracy_reward": 0.390625,
      "rewards/format_reward": 0.96875,
      "step": 84
    },
    {
      "advantages": 1.862645149230957e-09,
      "completion_length": 107.09375,
      "epoch": 0.1671583087512291,
      "grad_norm": 9.581528663635254,
      "kl": 0.077880859375,
      "learning_rate": 9.66535433070866e-07,
      "loss": 0.0031,
      "reward": 1.2734375,
      "reward_mean": 1.2734375,
      "reward_std": 0.22673209011554718,
      "rewards/accuracy_reward": 0.328125,
      "rewards/format_reward": 0.9453125,
      "step": 85
    },
    {
      "advantages": -6.05359673500061e-09,
      "completion_length": 101.71875,
      "epoch": 0.16912487708947885,
      "grad_norm": 4.0904693603515625,
      "kl": 0.080078125,
      "learning_rate": 9.661417322834646e-07,
      "loss": 0.0032,
      "reward": 1.3046875,
      "reward_mean": 1.3046875,
      "reward_std": 0.34358832240104675,
      "rewards/accuracy_reward": 0.34375,
      "rewards/format_reward": 0.9609375,
      "step": 86
    },
    {
      "advantages": 3.259629011154175e-09,
      "completion_length": 97.6875,
      "epoch": 0.1710914454277286,
      "grad_norm": 10.445027351379395,
      "kl": 0.077880859375,
      "learning_rate": 9.65748031496063e-07,
      "loss": 0.0031,
      "reward": 1.40625,
      "reward_mean": 1.40625,
      "reward_std": 0.19226361066102982,
      "rewards/accuracy_reward": 0.4140625,
      "rewards/format_reward": 0.9921875,
      "step": 87
    },
    {
      "advantages": -4.656612873077393e-10,
      "completion_length": 95.0234375,
      "epoch": 0.17305801376597837,
      "grad_norm": 7.029585838317871,
      "kl": 0.108154296875,
      "learning_rate": 9.653543307086613e-07,
      "loss": 0.0043,
      "reward": 1.296875,
      "reward_mean": 1.296875,
      "reward_std": 0.3804280459880829,
      "rewards/accuracy_reward": 0.3671875,
      "rewards/format_reward": 0.9296875,
      "step": 88
    },
    {
      "advantages": -3.725290298461914e-09,
      "completion_length": 99.7734375,
      "epoch": 0.1750245821042281,
      "grad_norm": 4.4387946128845215,
      "kl": 0.103271484375,
      "learning_rate": 9.649606299212598e-07,
      "loss": 0.0041,
      "reward": 1.40625,
      "reward_mean": 1.40625,
      "reward_std": 0.2885475754737854,
      "rewards/accuracy_reward": 0.4453125,
      "rewards/format_reward": 0.9609375,
      "step": 89
    },
    {
      "advantages": 3.259629011154175e-09,
      "completion_length": 88.3515625,
      "epoch": 0.17699115044247787,
      "grad_norm": 6.666729927062988,
      "kl": 0.131103515625,
      "learning_rate": 9.645669291338581e-07,
      "loss": 0.0052,
      "reward": 1.421875,
      "reward_mean": 1.421875,
      "reward_std": 0.325187012553215,
      "rewards/accuracy_reward": 0.484375,
      "rewards/format_reward": 0.9375,
      "step": 90
    },
    {
      "advantages": -5.587935447692871e-09,
      "completion_length": 93.1328125,
      "epoch": 0.17895771878072764,
      "grad_norm": 13.34407901763916,
      "kl": 0.118896484375,
      "learning_rate": 9.641732283464567e-07,
      "loss": 0.0048,
      "reward": 1.296875,
      "reward_mean": 1.296875,
      "reward_std": 0.2998630553483963,
      "rewards/accuracy_reward": 0.3671875,
      "rewards/format_reward": 0.9296875,
      "step": 91
    },
    {
      "advantages": -5.587935447692871e-09,
      "completion_length": 93.65625,
      "epoch": 0.18092428711897737,
      "grad_norm": 7.363097667694092,
      "kl": 0.11181640625,
      "learning_rate": 9.63779527559055e-07,
      "loss": 0.0045,
      "reward": 1.3125,
      "reward_mean": 1.3125,
      "reward_std": 0.3491063266992569,
      "rewards/accuracy_reward": 0.390625,
      "rewards/format_reward": 0.921875,
      "step": 92
    },
    {
      "advantages": 9.313225746154785e-10,
      "completion_length": 88.90625,
      "epoch": 0.18289085545722714,
      "grad_norm": 3.4406275749206543,
      "kl": 0.086669921875,
      "learning_rate": 9.633858267716536e-07,
      "loss": 0.0035,
      "reward": 1.3515625,
      "reward_mean": 1.3515625,
      "reward_std": 0.24411603808403015,
      "rewards/accuracy_reward": 0.375,
      "rewards/format_reward": 0.9765625,
      "step": 93
    },
    {
      "advantages": 4.656612873077393e-10,
      "completion_length": 90.8984375,
      "epoch": 0.1848574237954769,
      "grad_norm": 3.9054296016693115,
      "kl": 0.084716796875,
      "learning_rate": 9.62992125984252e-07,
      "loss": 0.0034,
      "reward": 1.484375,
      "reward_mean": 1.484375,
      "reward_std": 0.33557310700416565,
      "rewards/accuracy_reward": 0.5078125,
      "rewards/format_reward": 0.9765625,
      "step": 94
    },
    {
      "advantages": 5.122274160385132e-09,
      "completion_length": 84.265625,
      "epoch": 0.18682399213372664,
      "grad_norm": 34.2310676574707,
      "kl": 0.113525390625,
      "learning_rate": 9.625984251968503e-07,
      "loss": 0.0045,
      "reward": 1.359375,
      "reward_mean": 1.359375,
      "reward_std": 0.2987973093986511,
      "rewards/accuracy_reward": 0.3984375,
      "rewards/format_reward": 0.9609375,
      "step": 95
    },
    {
      "advantages": 3.259629011154175e-09,
      "completion_length": 85.9609375,
      "epoch": 0.1887905604719764,
      "grad_norm": 4.989116191864014,
      "kl": 0.0828857421875,
      "learning_rate": 9.622047244094488e-07,
      "loss": 0.0033,
      "reward": 1.359375,
      "reward_mean": 1.359375,
      "reward_std": 0.34010058641433716,
      "rewards/accuracy_reward": 0.3828125,
      "rewards/format_reward": 0.9765625,
      "step": 96
    },
    {
      "advantages": -1.3969838619232178e-09,
      "completion_length": 92.6015625,
      "epoch": 0.19075712881022616,
      "grad_norm": 8.827666282653809,
      "kl": 0.10107421875,
      "learning_rate": 9.618110236220474e-07,
      "loss": 0.004,
      "reward": 1.2421875,
      "reward_mean": 1.2421875,
      "reward_std": 0.3388516902923584,
      "rewards/accuracy_reward": 0.296875,
      "rewards/format_reward": 0.9453125,
      "step": 97
    },
    {
      "advantages": -1.3969838619232178e-09,
      "completion_length": 89.703125,
      "epoch": 0.1927236971484759,
      "grad_norm": 4.21494722366333,
      "kl": 0.088134765625,
      "learning_rate": 9.614173228346457e-07,
      "loss": 0.0035,
      "reward": 1.3671875,
      "reward_mean": 1.3671875,
      "reward_std": 0.2856517806649208,
      "rewards/accuracy_reward": 0.40625,
      "rewards/format_reward": 0.9609375,
      "step": 98
    },
    {
      "advantages": -4.6566128730773926e-09,
      "completion_length": 87.2421875,
      "epoch": 0.19469026548672566,
      "grad_norm": 6.1861395835876465,
      "kl": 0.098388671875,
      "learning_rate": 9.61023622047244e-07,
      "loss": 0.0039,
      "reward": 1.296875,
      "reward_mean": 1.296875,
      "reward_std": 0.31742775440216064,
      "rewards/accuracy_reward": 0.359375,
      "rewards/format_reward": 0.9375,
      "step": 99
    },
    {
      "advantages": -1.210719347000122e-08,
      "completion_length": 84.4921875,
      "epoch": 0.19665683382497542,
      "grad_norm": 4.156157970428467,
      "kl": 0.089599609375,
      "learning_rate": 9.606299212598424e-07,
      "loss": 0.0036,
      "reward": 1.3671875,
      "reward_mean": 1.3671875,
      "reward_std": 0.29000134766101837,
      "rewards/accuracy_reward": 0.390625,
      "rewards/format_reward": 0.9765625,
      "step": 100
    }
  ],
  "logging_steps": 1.0,
  "max_steps": 2540,
  "num_input_tokens_seen": 0,
  "num_train_epochs": 5,
  "save_steps": 100,
  "stateful_callbacks": {
    "TrainerControl": {
      "args": {
        "should_epoch_stop": false,
        "should_evaluate": false,
        "should_log": false,
        "should_save": true,
        "should_training_stop": false
      },
      "attributes": {}
    }
  },
  "total_flos": 0.0,
  "train_batch_size": 1,
  "trial_name": null,
  "trial_params": null
}
