INDEX
    Explanations
    New Auto-Interp
    Negative Logits
    ota
    -0.07
    100
    -0.07
     aiming
    -0.07
     visando
    -0.07
    's
    -0.07
     elke
    -0.07
     -
    -0.07
    ][
    -0.07
    ++)
    -0.07
     seal
    -0.07
    POSITIVE LOGITS
     gag
    0.08
    Fri
    0.08
     pista
    0.08
     boycott
    0.08
     haus
    0.08
     thorn
    0.08
     blaming
    0.08
    actualité
    0.08
     frivol
    0.08
     मुद्द
    0.07
    Act Density 0.015%

    No Known Activations