{
  "args": {
    "model_id": "hf-internal-testing/tiny-random-LlamaForCausalLM",
    "load_in_4bit": false,
    "torch_dtype": "fp32",
    "device_map": "auto",
    "use_lora": false,
    "lora_r": 8,
    "lora_alpha": 16,
    "lora_dropout": 0.05,
    "lora_target_modules": "all-linear",
    "gradient_checkpointing": false,
    "optimizer": "adamw",
    "modulus": 17,
    "max_steps": 6,
    "train_min_len": 1,
    "train_max_len": 2,
    "answer_train_min_len": 1,
    "answer_train_max_len": 2,
    "eval_lengths": "2,4",
    "train_template_mode": "standard",
    "answer_train_template_mode": "standard",
    "eval_template_modes": "standard",
    "train_size": 16,
    "answer_train_size": 16,
    "eval_size": 8,
    "train_batch_size": 4,
    "eval_batch_size": 4,
    "bootstrap_steps": 2,
    "answer_steps": 0,
    "eval_every": 1,
    "stage_eval_every": 1,
    "lr": 0.001,
    "answer_lr_scale": 0.1,
    "weight_decay": 0.0,
    "grad_clip": 1.0,
    "head_width": 64,
    "rank_temperature": 1.0,
    "arg_reader_mode": "after_op",
    "arg_window": 8,
    "arg_distance_temperature": 2.0,
    "trace_loss_weight": 1.0,
    "init_trace_loss_weight": 4.0,
    "op_trace_loss_weight": 1.0,
    "arg_trace_loss_weight": 4.0,
    "selection_loss_weight": 1.0,
    "role_pos_weight": 20.0,
    "init_selection_loss_weight": 1.0,
    "op_selection_loss_weight": 1.0,
    "arg_selection_loss_weight": 2.0,
    "executor_loss_weight": 1.0,
    "variants": "copy_trace",
    "max_length": 128,
    "seed": 7,
    "output_dir": "experiments/qwen_numeric_copy_compiler/runs/smoke_tiny_frozen_copy_trace",
    "checkpoint_dir": ""
  },
  "metadata": {
    "python": "3.12.3",
    "platform": "Linux-6.8.0-62-generic-x86_64-with-glibc2.39",
    "torch": "2.8.0+cu128",
    "cuda_available": true,
    "transformers_loader": "AutoModelForCausalLM",
    "peft_installed": true,
    "use_lora": false,
    "lora_r": 8,
    "gpu_name": "NVIDIA RTX 6000 Ada Generation",
    "gpu_vram_gb": 47.383
  },
  "hidden_dim": 16,
  "dataset": {
    "train_size": 16,
    "answer_train_size": 16,
    "eval_size": 8,
    "train_lengths": [
      1,
      2
    ],
    "answer_train_lengths": [
      1,
      2
    ],
    "eval_lengths": [
      2,
      4
    ],
    "train_template_mode": "standard",
    "answer_train_template_mode": "standard",
    "eval_template_modes": [
      "standard"
    ]
  },
  "variants": {
    "copy_trace": {
      "variant": "copy_trace",
      "train_seconds": 0.38986802101135254,
      "checkpoints": [
        "large_artifacts/qwen_numeric_copy_compiler/checkpoints/smoke_tiny_frozen_copy_trace/copy_trace/frozen_backbone.txt",
        "large_artifacts/qwen_numeric_copy_compiler/checkpoints/smoke_tiny_frozen_copy_trace/copy_trace/heads.pt"
      ],
      "train_log": [
        {
          "variant": "copy_trace",
          "stage": "trace",
          "local_step": 1,
          "step": 1,
          "loss": 27.55980110168457,
          "trace_loss_active": true,
          "executor_loss_active": true,
          "lr_scale": 1.0,
          "executor_loss": 1.3355300426483154,
          "init_loss": 1.0773439407348633,
          "op_loss": 0.14230524003505707,
          "arg_loss": 1.184443712234497,
          "init_attn_loss": 4.051422595977783,
          "op_attn_loss": 3.5789315700531006,
          "arg_attn_loss": 3.869452953338623,
          "role_loss": 1.6655545234680176,
          "standard_len2_direct_accuracy": NaN,
          "standard_len2_direct_target_mass": NaN,
          "standard_len2_executor_accuracy": 0.125,
          "standard_len2_executor_target_mass": 0.19105083867907524,
          "standard_len2_init_accuracy": 0.375,
          "standard_len2_init_pos_accuracy": 0.0,
          "standard_len2_op_accuracy": 0.625,
          "standard_len2_arg_accuracy": 0.125,
          "standard_len2_op_pos_accuracy": 0.0,
          "standard_len2_arg_pos_accuracy": 0.0,
          "standard_len2_program_exact": 0.0,
          "standard_len4_direct_accuracy": NaN,
          "standard_len4_direct_target_mass": NaN,
          "standard_len4_executor_accuracy": 0.125,
          "standard_len4_executor_target_mass": 0.05728393234312534,
          "standard_len4_init_accuracy": 0.375,
          "standard_len4_init_pos_accuracy": 0.0,
          "standard_len4_op_accuracy": 0.8125,
          "standard_len4_arg_accuracy": 0.375,
          "standard_len4_op_pos_accuracy": 0.09375,
          "standard_len4_arg_pos_accuracy": 0.0,
          "standard_len4_program_exact": 0.0
        },
        {
          "variant": "copy_trace",
          "stage": "trace",
          "local_step": 2,
          "step": 2,
          "loss": 26.099658966064453,
          "trace_loss_active": true,
          "executor_loss_active": true,
          "lr_scale": 1.0,
          "executor_loss": 1.479459524154663,
          "init_loss": 0.9500510692596436,
          "op_loss": 0.19394269585609436,
          "arg_loss": 0.9898881912231445,
          "init_attn_loss": 3.8667049407958984,
          "op_attn_loss": 3.569822311401367,
          "arg_attn_loss": 3.8839664459228516,
          "role_loss": 1.4620386362075806,
          "standard_len2_direct_accuracy": NaN,
          "standard_len2_direct_target_mass": NaN,
          "standard_len2_executor_accuracy": 0.125,
          "standard_len2_executor_target_mass": 0.19260284304618835,
          "standard_len2_init_accuracy": 0.375,
          "standard_len2_init_pos_accuracy": 0.0,
          "standard_len2_op_accuracy": 0.625,
          "standard_len2_arg_accuracy": 0.125,
          "standard_len2_op_pos_accuracy": 0.0,
          "standard_len2_arg_pos_accuracy": 0.0,
          "standard_len2_program_exact": 0.0,
          "standard_len4_direct_accuracy": NaN,
          "standard_len4_direct_target_mass": NaN,
          "standard_len4_executor_accuracy": 0.0,
          "standard_len4_executor_target_mass": 0.05713027901947498,
          "standard_len4_init_accuracy": 0.375,
          "standard_len4_init_pos_accuracy": 0.0,
          "standard_len4_op_accuracy": 0.875,
          "standard_len4_arg_accuracy": 0.46875,
          "standard_len4_op_pos_accuracy": 0.09375,
          "standard_len4_arg_pos_accuracy": 0.03125,
          "standard_len4_program_exact": 0.0
        }
      ],
      "final_metrics": {
        "standard_len2": {
          "variant": "copy_trace",
          "n": 8.0,
          "direct_accuracy": NaN,
          "direct_target_mass": NaN,
          "executor_accuracy": 0.125,
          "executor_target_mass": 0.19260284304618835,
          "init_accuracy": 0.375,
          "init_pos_accuracy": 0.0,
          "op_accuracy": 0.625,
          "arg_accuracy": 0.125,
          "op_pos_accuracy": 0.0,
          "arg_pos_accuracy": 0.0,
          "program_exact": 0.0
        },
        "standard_len4": {
          "variant": "copy_trace",
          "n": 8.0,
          "direct_accuracy": NaN,
          "direct_target_mass": NaN,
          "executor_accuracy": 0.0,
          "executor_target_mass": 0.05713027901947498,
          "init_accuracy": 0.375,
          "init_pos_accuracy": 0.0,
          "op_accuracy": 0.875,
          "arg_accuracy": 0.46875,
          "op_pos_accuracy": 0.09375,
          "arg_pos_accuracy": 0.03125,
          "program_exact": 0.0
        }
      }
    }
  }
}