<?xml version="1.0" encoding="UTF-8"?><rss version="2.0"><channel><title>securesein — Interpretability</title><description>Features, circuits, probing, activation steering, representation engineering.</description><link>https://securesein.com/</link><item><title>Abliteration: how one direction holds a model&apos;s refusals</title><link>https://securesein.com/blog/abliteration-how-one-direction-holds-a-model-s-refusals/</link><guid isPermaLink="true">https://securesein.com/blog/abliteration-how-one-direction-holds-a-model-s-refusals/</guid><description>Open-weight models ship with guardrails. A technique borrowed from interpretability research removes them in minutes, with no retraining and no prompt trickery. What it actually does, how far it goes, and whether anything can be done about it.</description><pubDate>Sat, 05 Sep 2026 00:00:00 GMT</pubDate><author>Sebastiaan with AI</author><category>Security — Deep dive</category><category>interpretability</category><category>ai-security</category><category>llms</category></item></channel></rss>