INDEX
    Explanations
    New Auto-Interp
    Negative Logits
    -0.07
     unfold
    -0.07
    eenth
    -0.07
    ↵    ↵
    -0.07
    -0.07
    ifies
    -0.07
     Boo
    -0.07
    深夜
    -0.07
    nb
    -0.07
    -0.06
    POSITIVE LOGITS
     capital
    0.11
     Capital
    0.09
    capital
    0.09
    资本
    0.08
    Capital
    0.08
     finite
    0.07
     أغ
    0.07
    Clark
    0.07
     путешеств
    0.07
     mata
    0.07
    Act Density 0.012%

    No Known Activations