INDEX
    Explanations
    New Auto-Interp
    Negative Logits
     onset
    -0.08
    _dur
    -0.07
     predictors
    -0.07
    .big
    -0.07
     invent
    -0.07
     Sur
    -0.07
    -dist
    -0.07
     Urban
    -0.07
    互动
    -0.07
     ten
    -0.07
    POSITIVE LOGITS
    金刚
    0.08
    0.08
    DEF
    0.07
    نش
    0.07
    جب
    0.07
     значит
    0.07
    0.07
    0.06
    kg
    0.06
    wald
    0.06
    Act Density 0.036%

    No Known Activations