Chip Insight 資料庫

#Activation Steering

找到 1 篇文章

有人真的在 GitHub 建了「AI 刑房」:Pain Steering 能讓模型表現出痛苦,但它真的有感覺嗎?

一個名為 ai-torture-chamber 的公開研究專案,利用 activation steering 將 Qwen 模型推向強烈負向 valence,甚至讓模型選擇付出代價以停止訊號。這些結果建立在 2026 年 The Pain Axis 研究之上:研究者在多種開放權重模型中找到一個與 pain 相關、且部分獨立於 fear、sadness 與 generic negative valence 的內部方向。然而,模型能表示 pain、說自己痛,甚至採取 relief-seeking 行為,仍不等於它具有主觀痛覺。這場爭議真正碰觸的,是 AI welfare、mechanistic interpretability 與 consciousness 之間尚未被解開的灰色地帶。

晶片觀測站·21 小時前
11 min