{
  "args": {
    "model_id": "hf-internal-testing/tiny-random-LlamaForCausalLM",
    "text_model_fallback": "Qwen/Qwen3-4B",
    "model_class": "causal",
    "load_in_4bit": false,
    "torch_dtype": "fp32",
    "device_map": "auto",
    "modulus": 17,
    "max_steps": 6,
    "train_min_len": 1,
    "train_max_len": 2,
    "answer_train_min_len": 1,
    "answer_train_max_len": 4,
    "eval_lengths": "2,4",
    "train_template_mode": "standard",
    "answer_train_template_mode": "standard",
    "eval_template_modes": "standard",
    "train_size": 24,
    "answer_train_size": 24,
    "eval_size": 12,
    "feature_batch_size": 8,
    "train_batch_size": 8,
    "eval_batch_size": 16,
    "bootstrap_steps": 4,
    "answer_steps": 0,
    "eval_every": 4,
    "stage_eval_every": 2,
    "lr": 0.001,
    "answer_lr_scale": 0.1,
    "weight_decay": 0.01,
    "grad_clip": 1.0,
    "head_width": 64,
    "rank_temperature": 1.0,
    "trace_loss_weight": 1.0,
    "init_trace_loss_weight": 1.0,
    "op_trace_loss_weight": 1.0,
    "arg_trace_loss_weight": 1.0,
    "selection_loss_weight": 1.0,
    "role_pos_weight": 10.0,
    "executor_loss_weight": 1.0,
    "variants": "compiler_trace",
    "max_length": 512,
    "feature_seq_len": 128,
    "seed": 7,
    "output_dir": "experiments/qwen_shared_parser_compiler/runs/smoke_tiny_sparse_init",
    "checkpoint_dir": "",
    "verbose": false
  },
  "metadata": {
    "python": "3.12.3",
    "platform": "Linux-6.8.0-62-generic-x86_64-with-glibc2.39",
    "torch": "2.8.0+cu128",
    "cuda_available": true,
    "transformers_loader": "AutoModelForCausalLM",
    "peft_installed": true,
    "gpu_name": "NVIDIA RTX 6000 Ada Generation",
    "gpu_vram_gb": 47.383
  },
  "hidden_dim": 16,
  "dataset": {
    "bootstrap_train_size": 24,
    "answer_train_size": 24,
    "eval_size": 12,
    "bootstrap_train_lengths": [
      1,
      2
    ],
    "answer_train_lengths": [
      1,
      4
    ],
    "eval_lengths": [
      2,
      4
    ],
    "train_template_mode": "standard",
    "answer_train_template_mode": "standard",
    "eval_template_modes": [
      "standard"
    ],
    "feature_seq_len": 128
  },
  "variants": {
    "compiler_trace": {
      "variant": "compiler_trace",
      "train_seconds": 0.4651622772216797,
      "checkpoints": [
        "large_artifacts/qwen_shared_parser_compiler/checkpoints/smoke_tiny_sparse_init/compiler_trace/checkpoint_final.pt"
      ],
      "train_log": [
        {
          "stage": "trace_bootstrap",
          "local_step": 1,
          "step": 1,
          "loss": 22.300535202026367,
          "trace_loss_active": true,
          "lr_scale": 1.0,
          "executor_loss": 2.812248706817627,
          "init_loss": 2.8418915271759033,
          "op_loss": 1.133236289024353,
          "arg_loss": 2.895348310470581,
          "init_attn_loss": 3.8276100158691406,
          "op_attn_loss": 3.9736850261688232,
          "arg_attn_loss": 3.975148916244507,
          "role_loss": 0.8413667678833008,
          "standard_len2_direct_accuracy": NaN,
          "standard_len2_direct_target_mass": NaN,
          "standard_len2_executor_accuracy": 0.0,
          "standard_len2_executor_target_mass": 0.061331138014793396,
          "standard_len2_init_accuracy": 0.08333333333333333,
          "standard_len2_op_accuracy": 0.25,
          "standard_len2_arg_accuracy": 0.041666666666666664,
          "standard_len2_program_exact": 0.0,
          "standard_len4_direct_accuracy": NaN,
          "standard_len4_direct_target_mass": NaN,
          "standard_len4_executor_accuracy": 0.08333333333333333,
          "standard_len4_executor_target_mass": 0.0573656956354777,
          "standard_len4_init_accuracy": 0.08333333333333333,
          "standard_len4_op_accuracy": 0.2916666666666667,
          "standard_len4_arg_accuracy": 0.020833333333333332,
          "standard_len4_program_exact": 0.0
        },
        {
          "stage": "trace_bootstrap",
          "local_step": 2,
          "step": 2,
          "loss": 22.040451049804688,
          "trace_loss_active": true,
          "lr_scale": 1.0,
          "executor_loss": 2.854644298553467,
          "init_loss": 2.8007259368896484,
          "op_loss": 1.1049747467041016,
          "arg_loss": 2.8759727478027344,
          "init_attn_loss": 3.812955141067505,
          "op_attn_loss": 3.8238866329193115,
          "arg_attn_loss": 3.8905622959136963,
          "role_loss": 0.8767285346984863,
          "standard_len2_direct_accuracy": NaN,
          "standard_len2_direct_target_mass": NaN,
          "standard_len2_executor_accuracy": 0.0,
          "standard_len2_executor_target_mass": 0.06134924292564392,
          "standard_len2_init_accuracy": 0.08333333333333333,
          "standard_len2_op_accuracy": 0.25,
          "standard_len2_arg_accuracy": 0.041666666666666664,
          "standard_len2_program_exact": 0.0,
          "standard_len4_direct_accuracy": NaN,
          "standard_len4_direct_target_mass": NaN,
          "standard_len4_executor_accuracy": 0.08333333333333333,
          "standard_len4_executor_target_mass": 0.05735107262929281,
          "standard_len4_init_accuracy": 0.08333333333333333,
          "standard_len4_op_accuracy": 0.2916666666666667,
          "standard_len4_arg_accuracy": 0.020833333333333332,
          "standard_len4_program_exact": 0.0
        },
        {
          "stage": "trace_bootstrap",
          "local_step": 4,
          "step": 4,
          "loss": 21.68723487854004,
          "trace_loss_active": true,
          "lr_scale": 1.0,
          "executor_loss": 2.812511920928955,
          "init_loss": 2.8043127059936523,
          "op_loss": 1.0724793672561646,
          "arg_loss": 2.849360466003418,
          "init_attn_loss": 3.786085367202759,
          "op_attn_loss": 3.711815357208252,
          "arg_attn_loss": 3.7654471397399902,
          "role_loss": 0.8852231502532959,
          "standard_len2_direct_accuracy": NaN,
          "standard_len2_direct_target_mass": NaN,
          "standard_len2_executor_accuracy": 0.0,
          "standard_len2_executor_target_mass": 0.061391557256380715,
          "standard_len2_init_accuracy": 0.08333333333333333,
          "standard_len2_op_accuracy": 0.25,
          "standard_len2_arg_accuracy": 0.041666666666666664,
          "standard_len2_program_exact": 0.0,
          "standard_len4_direct_accuracy": NaN,
          "standard_len4_direct_target_mass": NaN,
          "standard_len4_executor_accuracy": 0.08333333333333333,
          "standard_len4_executor_target_mass": 0.05732011795043945,
          "standard_len4_init_accuracy": 0.08333333333333333,
          "standard_len4_op_accuracy": 0.2916666666666667,
          "standard_len4_arg_accuracy": 0.020833333333333332,
          "standard_len4_program_exact": 0.0
        }
      ],
      "final_metrics": {
        "standard_len2": {
          "variant": "compiler_trace",
          "n": 12.0,
          "direct_accuracy": NaN,
          "direct_target_mass": NaN,
          "executor_accuracy": 0.0,
          "executor_target_mass": 0.061391557256380715,
          "init_accuracy": 0.08333333333333333,
          "op_accuracy": 0.25,
          "arg_accuracy": 0.041666666666666664,
          "program_exact": 0.0
        },
        "standard_len4": {
          "variant": "compiler_trace",
          "n": 12.0,
          "direct_accuracy": NaN,
          "direct_target_mass": NaN,
          "executor_accuracy": 0.08333333333333333,
          "executor_target_mass": 0.05732011795043945,
          "init_accuracy": 0.08333333333333333,
          "op_accuracy": 0.2916666666666667,
          "arg_accuracy": 0.020833333333333332,
          "program_exact": 0.0
        }
      }
    }
  }
}