计算机视觉

共 30 篇文章

计算机视觉
3D视觉感知技术突破:机器人精准操控物体

最新的3D视觉感知技术使机器人能够更精准地识别和操控物体,为工业自动化带来新机遇。

计算机视觉
AI人脸识别技术引发隐私争议:多地立法限制使用

人脸识别技术的广泛应用引发隐私担忧,多个城市和国家开始立法限制其在公共场合的使用。

计算机视觉
ChatGPT商业版2025年4月升级:AI模型o3、图像生成、增强记忆与内部知识演示

OpenAI公司于2023年在美国加州发布最新聊天机器人DeepSeek R1,正处于测试阶段。该系统在文本理解与生成、图像识别和生成功能等方面有显著提升,并优化了知识记忆系统,知识库全面更新。DeepSeek R1采用最新神经网络架构,在推理、代码编写和复杂问题解决等方面表现出色,能够处理多种任务如编程、创意写作等。

计算机视觉
人工智能利用图像改善决策

在AI领域快速发展的背景下,一项名为'Gemini Vision'的新技术突破引发关注。这款模型能够通过图像数据进行智能推理和创意生成,整合了视觉与文本处理能力。它不仅提升了AI在图像分析上的表现,还推动了实时交互功能的发展,并已在在线教育等领域应用。然而,该技术也带来了伦理挑战,如潜在的数字鸿沟和虚假图像生成风险。随着进一步发展,Gemini Vision有望在自动驾驶等更多领域发挥作用,并成为AI未来十年的重要增长引擎之一。

计算机视觉
OpenAI为GPT-4o整合先进图像生成器,提升美观与实用性

OpenAI 正式发布了 GPT-4o,这是首个结合文本、音频和视觉能力的多模态模型,并首次将图像生成整合到语言模型中,标志着公司自2014年创立以来的战略转变。GPT-4o 改进了早期模型如 GPT-3 在视觉处理上的局限性,提升了用户体验,并面对 Google Gemini 等竞争对手的压力。这一发布有望推动 AI 行业向更全面的多模态技术发展,影响深远。

计算机视觉
OpenAI与麻省理工学院联手:ChatGPT上探索早期情感福祉方法

AI研发模式正从封闭转向开放合作。MIT Media Lab与OpenAI启动三年战略计划(2024-2026),在机器人技术、AI伦理等领域深化合作。双方将整合学术视角与工程实践,开发新系统如'Generative Cognitive Architecture',提升模型能力并推动创新。这一合作代表AI技术成熟、负责任创新和产学研深化三大趋势,被视为构建'AI生态系统'的里程碑。

计算机视觉
计算机视觉
ChatGPT如何为美甲设计提供灵感?

随着美容行业数字化转型,美甲师开始应用AI工具提升效率。美国OpenAI开发的ChatGPT结合图像生成模型Midjourney,帮助美甲师快速获取设计灵感并实现可视化。例如,法国首席设计师通过AI生成结合珍珠母贝基底与丝绒质感的方案,并应用Midjourney得到3D效果图,最终设计广受欢迎。这种模式提升了工作效率与设计多样性,但也引发对人类创造力价值的思考。业内观察认为,未来美甲师需在掌握基础设计能力的同时,学会利用AI辅助工具进行美学判断与个性化实现。

计算机视觉
Sora视频生成模型现已上线:用户可创建高清短视频

OpenAI近日发布其视频生成模型Sora的公开测试版,标志着自主AI视频创作领域的重要突破。该工具可直接根据文本指令生成长达20秒的1080p高清视频,输出质量显著优于Runway、Pika等同类服务(通常仅支持较短时长)。Sora还兼容16:9、9:16和1:1等多种屏幕比例,适配不同平台需求。业内普遍认为该技术解决了当前AI视频生成在时长与质量间的矛盾,尽管仍面临推理限制和算力消耗等技术瓶颈。

计算机视觉
电影制作团队Vallée Duhamel分享Sora如何辅助构建新世界

两位来自魁北克蒙特利尔的电影创作者Valérie Vallée与Philippe Duhamel,在2023年发现OpenAI的Sora模型能通过自然语言指令生成高质量电影级视频,彻底改变传统制作流程。他们用Sora重现《盗梦空间》场景时惊讶地发现,模型能精准理解复杂描述并构建出符合导演意图的三维世界。Sora不仅简化了从创意构思到视觉呈现的过程,还提高了效率并维持风格一致性。创作者认为Sora带来的变革类似'从无声片到有声片'的革命,将颠覆整个视觉产业链,并催生'人类创意+AI执行'的新电影制作理念。