Running PaaT: Probe as a Tool for Proprioceptive Language Agents 🔀 Visualize self‑monitoring probes for AI model safety
Paused Control Reinforcement Learning 🎛 Explore LLM token decisions with feature‑driven visualizations
Running 4 CorrSteer: Correlation-Based Steering of Language Models via Sparse Autoencoders 🧭 Steer language model output by clicking visual layers