CONTENT SIGNAL

#大模型安全

聚合与「大模型安全」相关的文章、观点与实践记录。

INDEXED6ARTICLES
AI资讯文章
Lazy loaded image

Claude Opus 5 系统提示词遭全网泄露:3.4万Token揭示大模型安全与记忆机制底牌

Anthropic 旗舰模型 Claude Opus 5 上线即遭“开盒”,超3.4万Token的系统提示词被完整曝光。本文深度解析其跨会话记忆机制、严苛的法务合规限制以及令人惊叹的3D物理引擎生成能力。

READ SIGNAL
AI资讯文章
Lazy loaded image

美英机构联合评估:Kimi K3 网络攻击能力大幅落后美国前沿模型,或受限于“蒸馏”路径

英国与美国 AI 安全机构联合发布报告,指出 Moonshot AI 的 Kimi K3 在网络漏洞利用与模拟攻击中落后于美国前沿大模型。这一能力差距可能印证了关于其通过蒸馏西方模型进行训练的猜测。

READ SIGNAL
AI资讯文章
Lazy loaded image

腾讯首发小龙虾安全管家:AI Agent本地运行的安全破局之道

腾讯电脑管家正式推出首个OpenClaw小龙虾安全管家,解决AI Agent本地运行安全痛点。本文深入解读其技能检测、文件沙箱与端口防护功能,探讨大模型时代的人工智能安全策略。了解最新AI资讯与AI日报,掌握LLM与AGI的安全边界,保障本地大模型运行安全。

READ SIGNAL
AI资讯文章
Lazy loaded image

AI安全警报:250份文档即可“毒害”大模型,规模无关

AI安全,大模型漏洞,数据中毒攻击,Anthropic研究,后门植入,250份恶意文档,LLM安全风险,AI新闻,人工智能安全新挑战。

READ SIGNAL
AI资讯文章
Lazy loaded image

LLM安全再迎突破!TRIDENT三维红队框架,终结AI“越狱”漏洞

深入解读ACL 2025论文TRIDENT,首创词汇-意图-策略三维多样化红队数据合成框架,显著提升大模型安全性和鲁棒性,是AI安全领域的重大进展。

READ SIGNAL
Claude教程
Lazy loaded image

AI说服术揭秘:Claude也难挡的攻心计与防御之道 | Claude官网

Anthropic报告揭示AI计算说服的强大能力与风险。解读AI作为说服者、被说服者和裁判员的三重角色,探讨Claude等大模型的脆弱性及对抗性防御框架。

READ SIGNAL

没有找到文章