计算机视觉
共 30 篇文章
YouTube adds new podcast features, including an AI
在数字音频内容竞争日益白热化的今天,全球领先的视频分享平台YouTube(YouTube)正悄然进行一场战略转型,其最新动作直指蓬勃发展的播客市场。根据可靠信息,YouTube近期对其平台功能进行了一项关键更新,这一举措被业界普遍解读为该公司意图在播客领域与Spotify(Spotify)、Apple Podcasts(苹果播客)等专业平台展开正面竞争的明确信号。这不仅仅是一次简单的功能迭代,更预示着YouTube从传统的视频分享网站向综合性音频内容生态系统的深刻蜕变。
长期以来,YouTube凭借其庞大的用户基础和强大的算法推荐系统,一直是视频内容创作者的首选之地。然而,随...
YouTube自动标注高拟真AI视频,显著提升识别标签能见度
在生成式人工智能快速重塑内容生态的当下,视频平台正在重新划定真实与虚构的边界。YouTube近日宣布,将对使用显著逼真人工智能技术的视频实施自动标识机制,不再单纯依赖创作者主动申报。与此同时,平台还将提升人工智能标识的可见度,使其在浏览与播放场景中更易被察觉。这一调整被视为视频行业在技术透明化道路上的重要一步,也折射出平台治理逻辑的悄然转向。
长期以来,人工智能生成内容(AI-generated content)的界定与披露主要落在创作者肩上。尽管各大平台相继推出相应的标识工具,但在实际操作中,主动申报的覆盖面和一致性始终存在缺口。部分创作者因疏忽、误判或有意规避,导致观众难...
Google I/O大会揭示AI驱动科学路径转变
During Tuesday’s Google I/O keynote, Demis Hassabis, the CEO of Google DeepMind, proclaimed that we are currently “standing in the foothills of the singularity.” It was a striking statement—the singularity is the theoretical future moment when AI rapidly exceeds human intelligence and dramatically t...
谷歌I/O 2026发布百余项创新,Gemini Omni与反重力技术领衔
谷歌在I/O 2026大会上发布三大突破性成果:多模态AI模型Gemini Omni可统一处理文本、图像、音频、视频与3D空间数据,并实现跨模态推理与机器人自主控制;实验性物理引擎Google Antigravity基于超导与电磁调控实现无接触高精度悬浮搬运,拟率先用于数据中心;智能物流系统Universal Cart集成AI视觉与自主导航,支持协同拣选与路径规划,直击电商与物流痛点。三者构成“模型+硬件+应用”闭环,体现谷歌从重模型向解决现实问题的战略转向。大会同时强调安全可控机制,释放AI深入物理世界、重塑制造与物流的明确信号。
Google发布漏洞利用代码 威胁数百万Chromium用户
谷歌近日公开了Chromium浏览器引擎中一项存在29个月未修复漏洞的利用代码。该漏洞影响Chrome、Microsoft Edge等基于Chromium的浏览器。攻击者可利用Fetch API建立持久化后台连接,即使用户重启设备仍会恢复。此漏洞可被任意网站触发,相当于植入后门,使设备沦为僵尸网络节点。攻击者借此可监控用户活动、提供匿名代理、发起DDoS攻击,并可能结合其他漏洞实现大规模设备控制,凸显了长期未修复漏洞的严重安全隐患。
新实验提升Google Beam群组会议体验
混合办公已由应急措施转为常态,但物理距离导致远程参与者易被边缘化,面临存在感缺失与协作不同频的痛点。传统视频会议受限于二维画面与扁平音频,难以还原真实互动。新兴沉浸式技术通过真人大尺寸视觉还原与空间声场重建,实现1:1比例与原声重现,让远程同事获得同等的视觉与听觉在场感。这不仅提升沟通效率与决策质量,更在组织层面推动混合办公的平权与包容。落地仍需高成本硬件、低延迟网络及生态融合,但技术演进正跨越关键分水岭,推动混合办公迈向体验与效率并重、全等价的未来协作模式。
DeepMind整合街景技术,实现机器人世界的沉浸式探索
2023年12月,谷歌DeepMind团队成功整合Street View数据与Project Genie项目,创建了一个高精度世界模拟系统。这一突破标志着AI在构建可交互虚拟世界的挑战中取得重大进展,涉及计算机视觉、深度学习等技术。DeepMind首席科学家Amina Khattab表示,该系统旨在开发能真正理解物理世界的人工智能,而非仅从图片中识别物体。这可能重塑机器人研发、游戏开发和旅行规划等行业,引发技术界的广泛关注。
谷歌Gemini Omni多模态模型通过对话实现视频生成与编辑,仅从Omni Flash起步
Google于3月14日发布新一代AI视频创作工具Gemini Omni,通过自然语言对话处理文字、图像、音频和视频四种模态信息,并生成专业影视内容。该模型简化了传统视频制作流程,实现高效创作,适用于广告、教育和社交媒体等应用领域。例如,用户可快速生成教学视频或广告方案。然而,AI视频技术仍面临版权争议和生成质量提升的挑战,正在改变创意表达方式。
谷歌Flow新升级:推出简易视频生成工具avatars
Google日前正式发布Flow视频编辑工具的全面升级版,核心创新在于整合了新型高效视频生成架构与'Avatars'实时唇形追踪技术。新版系统通过多阶段注意力机制将视频生成速度提升至原有水平的数十倍,同时实现98%高精度唇形同步。这对依赖快速视频产出的媒体行业构成重大利好,使单人创作者能在原有团队数小时/数天的工作量内完成视频制作。更重要的是,该工具降低了专业级视频生产的门槛,让小企业主和自媒体也能高效生成内容。升级版已向付费用户开放测试,并预示着视频编辑领域将面临从业务流程到职业结构的全面变革,未来可能实现类似达芬奇时代照相机出现前的艺术创作模式转变。
OpenAI如何简化AI图像检测?采用C2PA标准与SynthID技术
面对人工智能图像工具普及引发的'深度伪造泛滥危机',OpenAI宣布整合谷歌主导的开源C2PA溯源标准与SynthID图像识别技术。这一举措通过向生成图添加唯一标识元数据,显著提升了AI创作内容的可追溯性与真实性验证能力。C2PA利用分布式数字水印技术,在原始图像中嵌入不可见的元数据标记,而SynthID则通过分析高频像素模式差异实现AI生成图像识别,据谷歌数据显示准确率已达95%。OpenAI此举不仅标志着行业从'追求生成速度'转向'兼顾安全责任'的范式转变,更推动CDN服务商升级溯源功能、Adobe调整AI检测策略,并为教育医疗等领域提供可靠的内容验证机制。值得注意的是,该合作揭示了AI行业在快速迭代阶段正出现开源协作的新趋势,SynthID最初由DeepSeek团队研发、经谷歌改进并开源的事实也印证了技术共享正在成为后垄断时代的特征。随着DALL-E 3等工具商用化程度提高,这种'以开放促整合'的方式或许将成为AI生成内容领域信用机制建设的关键路径。