计算机视觉

共 30 篇文章

计算机视觉
三种难度解读:AI代理为何缺乏连续对话记忆

谷歌在其Gemini AI实况室中展示了无状态代理的概念,这是一种创新架构,通过显式参数传递上下文而非依赖历史记忆来处理AI任务。该设计解决了传统大型语言模型在可扩展性、隐私性和性能方面的挑战,并突破了多模态AI的限制,允许单一Gemini实例同时处理文本、图像和视频数据。预计这对客户服务、搜索引擎等行业产生深远影响,未来可能成为下一代AI系统的标准组件,提升整体效率和安全性。

计算机视觉
推出ChatGPT图像功能2.0版

OpenAI于2024年3月19日发布ChatGPT Images 2.0,这是一个将视觉创造能力整合到对话系统中的突破性产品,标志着AI从文本交互向多模态扩展的重大革新。

计算机视觉
AI视频监控系统升级:行为分析能力大幅提升

新一代AI视频监控系统不仅能够识别人脸,还能分析人的行为模式,大幅提升安防效率。

计算机视觉
人工智能基础指南:从原理到ChatGPT应用

人工智能(AI)已从理论概念发展为日常生活中的革新者,通过机器学习技术分析数据来模拟人类决策和提升效率。AI在医疗、金融等领域辅助诊断风险,同时有潜力解决气候变化等复杂问题;ChatGPT等案例展示了其在个性化服务中的应用。然而,它也引发数据隐私泄露和算法偏见等挑战。总体上,AI正在深刻改变生活方式和社会结构,提供巨大机遇但也需警惕潜在风险。

计算机视觉
谷歌Vids新AI革新:免费生成高质量视频

谷歌近日发布了新一代Deepfake视频生成工具,该工具可免费、高质量地创建深度伪造视频。新工具采用最先进的音频口技技术,使AI生成的虚假人像在表情、眼神和说话方式上更加逼真自然。谷歌表示,该工具旨在提升视频生成效率,并拓展创作者的应用场景,而非用于制造虚假信息。这一发布有望重塑内容创作行业格局,推动AI视频生成技术的普及和发展。

计算机视觉
谷歌与巴西政府合作开发新卫星地图,助力森林保护

科技巨头Google与南美国家合作,启动亚马逊卫星地图绘制项目。该项目旨在利用商业遥感公司GeoEye和DigitalGlobe的高分辨率图像,结合美国航天局的数据,创建更精确、高频更新的地图。这对提升巴西政府森林监测能力至关重要,有助于应对非法采伐和人类活动扩张对亚马逊生态系统的威胁。项目还将建立实时在线系统,提高执法响应速度,并促进生态系统保护的创新尝试,尽管面临数据获取、隐私及平衡发展与保护等挑战。

计算机视觉
谷歌2026年3月AI又有新动向?

谷歌于2026年3月发布Gemini 1.5 Advanced系列模型,这是AI战略从追求参数规模转向提升实用性的关键里程碑。该系列包含三个级别:Ultra具备强大的推理和多模态处理能力,Pro优化企业应用效率,Nano适合资源有限的环境。谷歌展示了在视觉推理和多模态对话方面的技术实力,使AI更好地理解和生成多媒体内容,并构建了更灵活的生态系统。

计算机视觉
Google 推出 Veo 3.1 Lite 的付费预览版:通过 Gemini API 和 AI Studio 访问

谷歌推出Veo 3.1 Lite,一款轻量级AI视频生成工具。用户可通过Gemini API的付费预览模式或Google AI Studio进行测试访问。此次升级简化了从文本描述到视频的生成流程,尤其满足教育、数字营销等领域的日益增长的需求。Gemini API与该工具的整合,进一步拓展了AI应用范围,体现了谷歌在当前快速发展的人工智能生态系统中,将高效与易用作为关键考量因素的战略布局。

计算机视觉
Sora模型震撼发布:AI视频生成进入新纪元(更新)

OpenAI发布Sora视频生成模型,能够根据文本描述生成高质量的长视频,标志着AI视频生成技术的重大突破。...

计算机视觉
ChatGPT推出基于Agentic Commerce Protocol的视觉沉浸购物系统

OpenAI的ChatGPT最近更新了代理式电商协议,为用户带来沉浸式的视觉购物体验。该协议结合AI代理与图像识别等多模态功能,使用户能够直观地探索商品,并直接与商家比较选项。此举旨在解决电商中的用户疲劳问题,通过简化决策流程并提供个性化推荐来提升购物效率。同时,它增强了商家的整合能力与库存管理,但也引发了关于隐私保护的新担忧,需要进一步解决。