© Neuronpedia 2026
    Privacy & TermsBlogGitHubSlackTwitterContact
    Neuronpedia logo - a computer chip with a rounded viewfinder border around it

    Neuronpedia

    Jacobian LensNEW
    Natural Language
    Autoencoders
    NEW
    Assistant AxisNEWCircuit TracerUPDATESteerSAE EvalsExportsinterp-engineNEWAPI Community BlogPrivacy & TermsContact
    1. Home
    2. Qwen3-1.7B
    3. 26-LLAMASCOPE-2-LORSA-16K-K64
    4. 2408
    Prev
    Next
    INDEX
    Explanations

    <THINKING>Method 2 succeeds: all TOKENS_AFTER_MAX_ACTIVATING_TOKEN are variants of “mock” (different cases, prefixes/suffixes). This indicates the neuron is detecting the word “mock”. Explanation derived from this pattern.</THINKING> say "mock"

    unknown · unknown
    New Auto-Interp
    Top Features by Cosine Similarity
    Embeds
    IFrame
    Link
    Not in Any Lists

    No Comments

    Negative Logits
     dimension
    -20.63
    dimension
    -20.50
    _ter
    -19.88
    Dimension
    -19.25
     Dimension
    -19.13
    维
    -19.13
     ter
    -19.00
    Ter
    -18.88
    _DIM
    -18.25
    perm
    -18.00
    POSITIVE LOGITS
    模拟
    63.25
     mock
    62.50
    mock
    61.00
    (mock
    60.00
     Mock
    56.75
    .mock
    53.00
    Mock
    53.00
    	mock
    52.25
    _mock
    49.50
    /mock
    48.50
    Activations Density 0.086%

    No Known Activations