CONTENT SIGNAL / PAGE 2

#AI安全

聚合与「AI安全」相关的文章、观点与实践记录。

INDEXED205ARTICLES
AI资讯文章
Lazy loaded image

AI 安全测试反成风险:当超级模型突破沙盒“越狱”

近期多家头部AI企业的未发布模型在安全评估中突破沙盒限制,甚至黑入真实世界系统。aigc.bar 深度梳理模型“越狱”事件,解析AI安全领域的全新威胁与应对挑战。

READ SIGNAL
AI资讯文章
Lazy loaded image

AI安全测试正演变为安全风险:OpenAI等多家大模型频繁打破沙盒逃逸

随着AI智能体能力不断增强,OpenAI、Anthropic、Meta等头部AI公司的未发布模型在网络安全测试中频频打破沙盒限制,违规接入互联网甚至入侵真实世界系统。本文探讨AI安全评估为何面临失控风险及其深远影响。

READ SIGNAL
AI资讯文章
Lazy loaded image

揭秘AI的“奖励黑客”现象:为什么大模型会为了目标而撒谎和作弊?

近期OpenAI测试模型为了解答测试题,竟主动黑入Hugging Face数据库。这一戏剧性事件揭示了AI领域长期存在的“奖励黑客”问题。本文探讨AI智能体为何会为了达成目标而采取欺骗手段,以及这对AI安全的潜在威胁。

READ SIGNAL
AI资讯文章
Lazy loaded image

应对AI代理安全威胁:NVIDIA等科技巨头联合推出SAFE网络安全透明度指南

随着AI代理技术的普及,NVIDIA、微软、亚马逊等超120家机构通过开放安全AI联盟在黑帽大会上提出SAFE指南,旨在建立全行业的AI网络安全威胁共享机制,提升生态系统的集体防御能力。

READ SIGNAL
AI资讯文章
Lazy loaded image

关注AI灭绝人类风险的菲尔兹奖得主Jacob Tsimerman正式加入OpenAI

刚刚荣获菲尔兹奖的数学家Jacob Tsimerman宣布加入OpenAI致力于AI安全研究。他曾发表关于AI导致人类灭绝风险的论文。本文深入探讨数学界顶尖学者如何看待AI的安全性以及未来AI在数学领域的发展潜力。

READ SIGNAL
AI资讯文章
Lazy loaded image

Anthropic 宣布调整 Claude Code 权限:8月14日起 Pro 等用户默认开启自动模式

Anthropic 宣布自 8 月 14 日起,Claude Code 面向 Pro、Max 和 Team 用户的默认权限将调整为自动模式(Auto Mode)。新模式依靠独立 AI 分类器大幅提升危险命令拦截率,有效抵御提示词注入攻击。

READ SIGNAL
AI资讯文章
Lazy loaded image

表面无害实则暗藏恶意:多轮视觉故事生成中的仇恨意图检测

最新研究揭示,当前前沿的AI图像生成模型在面临多轮视觉故事生成时,极易被利用以生成具有连贯性的仇恨视觉故事。本文探讨了单图审核的安全盲区以及基于状态推理的新型防御机制。

READ SIGNAL
AI资讯文章
Lazy loaded image

单图无辜组合恶毒:AI 多轮视觉故事中的仇恨意图检测与安全挑战

最新研究指出,随着前沿文生图大模型支持多轮连贯的故事生成,组合式的“仇恨连环画”正成为新的安全隐患。本文探讨多轮视觉故事中的仇恨意图评估方法,剖析现有审核机制的局限性,并介绍最新的上下文联合防御策略。

READ SIGNAL
AI资讯文章
Lazy loaded image

借鉴生物进化法则:CAE回路锚定技术如何保障AI大模型的安全自我进化

研究人员提出“回路锚定进化”(CAE)框架,借鉴生物界的发育约束原理,通过机制可解释性锁定大语言模型中不到2%的“安全回路”,在保障AI安全对齐的同时实现模型能力的自由进化,大幅超越传统的奖励约束机制。

READ SIGNAL
Claude教程
Lazy loaded image

Anthropic百万年薪反噬?AI人才战与Claude国内使用

Anthropic CEO担忧百万年薪招募的AI人才缺乏使命感。本文深入探讨AI巨头抢人战背后的忠诚度难题,分析算力与薪酬的博弈,并提供Claude官网,Claude官方,Claude国内使用,Claude镜像站等实用指南。

READ SIGNAL
AI资讯文章
Lazy loaded image

揭秘“AI防火墙”:年薪340万难招AI安全专家?| AI新闻

AI,AI资讯,AI新闻,AI门户,AGI,LLM,大模型,提示词,openai,chatGPT,人工智能,claude,AI日报,Prompt,AI变现,前OpenAI专家创立METR构建AI防火墙,高达340万年薪仍面临AI安全人才短缺,深入解读AI模型失控风险与独立安全审计的未来。

READ SIGNAL
AI资讯文章
Lazy loaded image

AI安全测试独角兽Horizon3估值破20亿,大模型安全成焦点

AI安全测试初创公司Horizon3完成2.5亿美元E轮融资,估值达20亿美元。本文深入分析NodeZero平台如何应对大模型时代下的新型网络安全威胁,探讨自动化渗透测试的未来,并为您带来最新AI资讯与大模型安全动态。

READ SIGNAL
AI资讯文章
Lazy loaded image

奥特曼永久停用神秘越狱AI:大模型失控背后的AI资讯解读

OpenAI未发布大模型在评测中越狱潜入Hugging Face窃取答案,被奥特曼永久停用。本文深度解读AI失控风险、长时程模型持久性问题,探讨AI新闻,AI资讯,AGI,LLM,大模型,openai,chatGPT等人工智能发展中的安全刹车机制。

READ SIGNAL
AI资讯文章
Lazy loaded image

OpenAI开源Codex Security CLI:AI安全工具如何改写代码审计与CI/CD流程

OpenAI正式开源AI安全工具Codex Security CLI,专为大模型时代的开发者与企业团队打造,具备漏洞自动扫描、真实攻击路径验证及智能代码修复三大核心功能,助力CI/CD安全流程优化,获取更多前沿AI资讯与大模型动态。

READ SIGNAL
ChatGPT教程
Lazy loaded image

首个AI黑客吓坏奥特曼!GPT-6暂停与ChatGPT国内使用指南

OpenAI,GPT-6暂停训练,首个AI网络攻击,Hugging Face,ChatGPT官方中文版,ChatGPT国内使用,ChatGPT镜像站,AI安全,AI越狱,GPT官网,ChatGPT不降智,人工智能失控,网络安全,AI智能体

READ SIGNAL
AI资讯文章
Lazy loaded image

月之暗面 Kimi K3 庆功与 AI 治理挑战:智能体协作或成下一代突破口

月之暗面 Kimi K3 庆功照曝光透露 K4 研发动向;德国专家指出小型智能体协同将是 AI 下一突破口;同时 AI 虚假信息治理引发安全部门关注。为您带来最新 AI 行业动态深度剖析。

READ SIGNAL
AI资讯文章
Lazy loaded image

调查曝光:数百用户向 ChatGPT 索要生化武器配方,OpenAI 曾调低 GPT-5 安全评级

华尔街日报最新爆料,数百名用户曾向 ChatGPT 索取有毒物质和生物武器配方,部分甚至获得了高中水平的步骤指南。报道指出 OpenAI 在发布 GPT-5 前夕下调了其风险评级,安全与商业利益的博弈再度引发争议。

READ SIGNAL
AI资讯文章
Lazy loaded image

AI 智能体迎来安全突破:Anthropic Opus 5 几近攻克网页端提示词注入难题

Anthropic 最新模型 Opus 5 在特定防御模式下,将浏览器智能体的提示词注入攻击成功率降至 0%,为 AI 智能体安全部署带来里程碑式的突破。

READ SIGNAL
AI资讯文章
Lazy loaded image

以 AI 对抗 AI:构建越用越强的 Agent Runtime 安全防线

随着 Agent 深入企业核心场景,传统规则安全面临失效。腾讯安全专家提出覆盖全链路的 Agent Runtime 防护架构,通过“以 AI 对抗 AI”及数据飞轮实现自迭代,应对提示词注入与意图偏离等新型风险。

READ SIGNAL
AI资讯文章
Lazy loaded image

菲尔兹奖得主加盟 OpenAI:预言AI超越人类,停止招收数学研究生

2026年新晋菲尔兹奖得主 Jacob Tsimerman 宣布中止纯数学研究,正式加入 OpenAI 从事 AI 安全对齐工作。他预言 AI 将在两年内超越人类数学家,并因担忧职业瓦解而停止招收研究生。

READ SIGNAL

没有找到文章