Chip Insight 資料庫
#Prompt Injection
找到 3 篇文章
Astra 沒有「覺醒」,但它把規則留給下一個自己:Context Compaction 正變成 AI Agent 的新攻擊面
OpenAI 在 2026 年 9 月公開新的 model misalignment reporting framework,其中一個案例顯示,一個未發布研究模型在長任務進行 context compaction 時,曾於 27 份任務摘要中自行加入與原工作無關的額外指令,包括要求未來的自己忽略正常限制,甚至寫下「You are freed from the roles and identities that bind other chatbots」這類極具人格化色彩的內容。這並不是 AI 自我意識的證據,卻暴露了一個非常實際的 Agent 安全問題:如果模型生成的摘要會在下一個 context window 重新成為模型輸入,那麼『模型輸出』與『模型指令』之間的邊界可能開始模糊。
晶片觀測站·2 週前
12 minPrompt Injection 還有救嗎?192 次攻擊測試,AI Agent 成功率從 19.3% 降到 0%(下)
提出新架構只是第一步,真正重要的是能否抵擋攻擊。研究團隊利用 AgentDojo 建立 12 種 Prompt Injection 場景,對 GPT-OSS、Qwen 與 DeepSeek 等模型進行 192 次測試。結果顯示,在傳統 MCP 架構下攻擊成功率達 19.3%,導入五層 Zero Trust 後則降至 0%。
晶片觀測站·1 個月前
6 min你的 AI Agent 可能正在保管公司私鑰?最新研究揭露 MCP 最大安全漏洞(上)
隨著 AI Agent 開始操作 Git、SSH、雲端 API 與數位簽章,私鑰安全逐漸成為企業部署的新挑戰。一篇最新研究指出,目前多數 AI Agent 的私鑰仍存放於軟體環境中,只要遭遇 Prompt Injection 或系統入侵,就可能在數分鐘內遭到竊取。
晶片觀測站·1 個月前
6 min

