AI安全
共 30 篇文章
GPT-5系统更新:Instant与Thinking安全指标新增心理健康评估
OpenAI最新发布的GPT-5.1系统,首次将'心理健康影响'和'过度情感依赖'纳入核心安全评估指标。随着AI助手日益普及,传统以有害内容、隐私保护为主的评估标准已不足以涵盖其对人类精神健康的潜在影响。美国联邦贸易委员会等监管机构近年来开始关注AI在心理健康领域的应用,欧盟也通过了相关法案。GPT-5.1的升级体现了行业从单纯技术安全向关注用户心理健康转变的趋势,但也引发了对干预机制可能模糊人机边界、影响创新的担忧。目前,多家AI企业正在跟进这一监管趋势,探索更全面的安全机制。
AI安全新挑战:揭秘提示注入攻击及其防护
提示注入攻击正成为人工智能领域的一大安全威胁,通过精心设计的文本操纵AI系统输出。OpenAI作为行业领导者,正积极应对这一挑战:组织匿名竞赛分析漏洞、改进模型训练算法以增强鲁棒性,并开发提示审查工具帮助开发者规避风险。这些措施不仅提升了自家产品的安全性,还通过开源协作向整个AI生态系统推广,体现了从事后防御转向预防性设计的行业趋势。随着AI在企业服务中的广泛应用,这种攻击可能带来严重后果,OpenAI的透明报告和安全实践有助于推动公众认知并促进相关政策讨论。未来,随着更多公司采用类似策略并与AI伦理框架结合,有望通过标准化解决方案提升全球AI系统的整体稳健性。
OpenAI打造青少年在线安全新蓝图
OpenAI近日公布名为「青少年在线保护蓝图」的计划,旨在构建更安全有益的人工智能生态系统给青少年。该计划的核心理念是通过知识过滤、情境理解及价值引导,帮助他们有效获取有益信息并学会独立判断。技术路线方面将结合机器学习与中国教育机构合作,开发「青少年模式」及应用案例库。这一计划已获得全球多个国家的响应,并预计在未来三年内逐步落地实施,可能成为行业新标准。
人类如何引导AI走向美好未来?
近年来,人工智能快速发展,在医疗、交通等领域展现出巨大潜力。人类有机会通过政策指导和伦理框架引导AI发展,避免其潜在风险如隐私泄露和社会不平等问题。过去的经验表明,人类干预对于AI的进步至关重要,但也需警惕技术失控的可能后果。未来,若管理得当并加强国际合作、投资风险缓解措施等,AI有望在能源效率和环境监测等方面发挥更大作用,并实现可持续发展。
AI模型偏见问题持续存在:如何确保公平性?
研究表明AI模型中的偏见问题仍然普遍存在,如何确保AI系统的公平性成为重要议题。
OpenAI 推出 gpt-oss-safeguard 开放权重推理模型,用于安全分类并支持开发者迭代自定义策略
OpenAI上周推出名为gpt-oss-safeguard的新安全模型,该机制基于开放权重推理架构开发。开发者可利用这一工具创建专属策略并实时优化模型表现,此举打破了该公司过去在安全政策方面的封闭形象。这不仅是OpenAI技术路线的重大调整,更预示着大型语言模型向安全领域延伸的新方向,并为AI伦理治理模式的革新带来契机。
开源模型的安全卫士:120B参数新模型助力内容安全评估
微软亚洲研究院与DeepSeek Research于2023年10月联合发布gpt-oss-safeguard系列AI安全模型,包括120B和20B参数版本。这些模型基于DeepSeek开源权重训练,采用策略导向推理、双层注意力机制(其中20B模型使用混合注意力机制)和SFT技术,以提升内容安全性和合规性。评估显示,在有害内容识别方面效果提升340%,错误标记率下降52%,同时保持文本自然度。DeepSeek强调开源精神中的责任共担,并开发Guardian Console工具增强安全性可解释性。潜在应用涵盖医疗咨询、网络安全等领域,标志着在AI安全领域的创新进展,并呼应当前业界对责任界定的重视。
Doppel利用GPT-5技术提前拦截深度伪造攻击,减少分析师工作量80%
近年来深度伪造技术快速发展,但因其在身份盗窃、虚假信息传播和政治操纵等方面的应用而带来巨大安全隐患。为应对挑战,科技公司Doppel近期推出基于GPT-5的新防御系统,该技术不仅能快速(几分钟内)检测Deepfake内容,还将网络安全分析师的工作量减少80%。Doppel通过独特的训练机制和强化微调算法,显著提升了识别准确率,并展示了人工智能在网络安全领域的广泛应用潜力。
下一章:微软与OpenAI合作再启程
微软与OpenAI今日签署深化合作协议,旨在共同推动负责任、可持续的人工智能发展。协议不仅巩固了微软的投资承诺,还要求双方在商业目标、AI安全和透明度等方面加强协调。OpenAI将更开放地分享技术,支持微软提升云计算服务Azure的竞争力;而微软则承诺为OpenAI提供更大的市场和技术资源。此次合作被视为双方在经历内部权力斗争和外部审查压力后达成的重要战略平衡,体现了科技行业对负责任AI发展的共同关注。
GPT-5系统卡更新:新基准测试提升敏感对话的情感依赖、心理健康和抗越狱能力
OpenAI的GPT-5模型在处理敏感话题方面有了显著提升,包括情感依赖和心理健康讨论。与GPT-3等早期版本相比,该模型能够避免生成不当或带有偏见的回应。GPT-5采用了更严格的保障机制和新基准测试,以提供更加可靠、负责的互动体验。这些改进旨在更好地理解人类情感,防止AI出现有害内容生成(即所谓的'越狱事件'),并降低在客服和医疗等应用中的潜在风险。GPT-5的这些进步标志着AI开发正从追求性能转向强调伦理责任,尽管该模型仍存在局限性,并将持续根据用户反馈进行优化。