400 128 6709

行业新闻

开源!超越ZoeDepth! DepthFM:快速且精确的单目深度估计!

发布时间:2024-04-03点击次数:

0. 这篇文章干了啥?

提出了DepthFM:一个多功能且快速的最先进的生成式单目深度估计模型。除了传统的深度估计任务外,DepthFM还展示了在深度修复等下游任务中的最先进能力。DepthFM效率高,可以在少数推理步骤内合成深度图。

下面一起来阅读一下这项工作~

1. 论文信息

标题:DepthFM: Fast Monocular Depth Estimation with Flow Matching

作者:Ming Gui, Johannes S. Fischer, Ulrich Prestel, Pingchuan Ma, Dmytro Kotovenko, Olga Grebenkova, Stefan Andreas Baumann, Vincent Tao Hu, Björn Ommer

机构:MCML

原文链接:https://arxiv.org/abs/2403.13788

代码链接:https://github.com/CompVis/depth-fm

官方主页:https://depthfm.github.io/

2. 摘要

针对许多下游观光任务和应用至关重要。目前针对此问题的判别式方法受到模糊伪影的限制,而最先进的生成方法由于其SDE性质导致训练样本速度缓慢。我们不是从噪声开始,而是寻求从输入图像到深度图像的直接映射。我们观察到这可通过流匹配来有效地构建,因为其在解空间中的直线轨迹提供了效率和高质量。我们的研究表明,预先训练的图像扩散模型可用于作为流匹配深度模型的充分先验知识。在复杂自然场景的基准测试中,尽管仅在少量合成数据上进行训练,我们的轻量级方法以有利的低计算成本表现出最先进的性能。

3. 效果展示

DepthFM是一种具有强零样本泛化能力的快速推理流匹配模型,可利用强大的先验知识,并且很容易地泛化到未知的真实图像中。在合成数据上进行训练后,模型可以很好地泛化到未知的真实图像中,并对深度图像进行精确匹配。

☞☞☞AI 智能聊天, 问答助手, AI 智能搜索, 免费无限量使用 DeepSeek R1 模型☜☜☜

开源!超越ZoeDepth! DepthFM:快速且精确的单目深度估计!

与其他最先进的模型相比,DepthFM仅用一个函数评估就获得了明显更清晰的图像。Marigold的深度估计耗时是DepthFM的两倍,但无法生成相同粒度的深度图。

开源!超越ZoeDepth! DepthFM:快速且精确的单目深度估计!

4. 主要贡献

(1)提出了DepthFM,一种最先进的、多功能的、快速的单目深度估计模型。除了传统的深度估计任务外,DepthFM还展示了在深度修补和深度条件图像合成等下游任务中的最新能力。

(2)展示了将强大的图像先验从扩散模型成功转移到流匹配模型,几乎不依赖于训练数据,也不需要真实世界的图像。

(3)表明,流匹配模型高效,并能在单个推理步骤内合成深度图。

(4)尽管仅在合成数据上进行训练,但DepthFM在基准数据集和自然图像上表现出色。

Machine Translation Machine Translation

聚合多个来源的AI翻译

Machine Translation 49 查看详情 Machine Translation

(5)将表面法线损失作为辅助目标,以获得更准确的深度估计。

(6)除了深度估计,还可可靠地预测其预测的置信度。

5. 具体原理是啥?

训练Pipeline。 训练受到流匹配和表面法向损失的限制:对于流匹配,使用数据依赖的流匹配来回归地面真实深度与对应图像之间的向量场。此外,通过一个表面法向损失来实现几何真实感。

开源!超越ZoeDepth! DepthFM:快速且精确的单目深度估计!

数据相关的流匹配: DepthFM通过利用图像到深度对,回归出图像分布和深度分布之间的直线向量场。这种方法在不牺牲性能的情况下促进了高效的几步推理。

从扩散先验微调: 作者展示了成功将强大的图像先验从基础图像合成扩散模型(Stable Diffusion v2-1)转移到流匹配模型,几乎不依赖训练数据,并且不需要真实世界的图像。

辅助表面法线损失: 考虑到DepthFM只在合成数据上进行训练,大多数合成数据集提供了地面真实表面法线,将表面法线损失作为辅助目标,以增强DepthFM深度估计的准确性。

6. 实验结果

DepthFM通过仅在63k纯合成样本上进行训练展现出了显著的泛化能力,并且能够在室内外数据集上进行零-shot深度估计。表1定性地展示了DepthFM与最先进的对应模型的性能对比。虽然其他模型通常依赖于大量数据集进行训练,但DepthFM利用了基于扩散的基础模型中固有的丰富知识。这种方法不仅节省了计算资源,而且强调了模型的适应性和训练效率。

开源!超越ZoeDepth! DepthFM:快速且精确的单目深度估计!

对基于扩散的Marigold深度估计、流匹配(FM)基准和DepthFM模型进行比较。每种方法仅使用一个集合成员进行评估,并针对两个常见基准数据集进行不同数量的函数评估(NFE)。与FM基准相比,DepthFM集成了训练过程中的法线损失和数据相关的耦合。

开源!超越ZoeDepth! DepthFM:快速且精确的单目深度估计!

对于Marigold和的DepthFM模型在不同数量的功能评估中的定性结果。值得注意的是,通过一步推断,Marigold并没有给出任何有意义的结果,而DepthFM的结果已经显示了真实的深度图。

开源!超越ZoeDepth! DepthFM:快速且精确的单目深度估计!

在Hypersim上进行深度补全。左:给予部分深度。中:深度估计从给定的部分深度。右:真值深度。

开源!超越ZoeDepth! DepthFM:快速且精确的单目深度估计!

7. 总结

DepthFM,一种用于单目深度估计的流匹配方法。通过学习输入图像和深度之间的直接映射,而不是将正态分布去噪为深度图,该方法明显比当前基于扩散的解决方案更高效,同时仍提供细粒度的深度图,而不会出现判别式范式的常见伪影。DepthFM使用预先训练好的图像扩散模型作为先验,有效地转移到了深度流匹配模型中。因此,DepthFM只在合成数据上进行了训练,但在推断期间仍然能很好地推广到自然图像。此外,辅助表面法线损失已被证明能改善深度估计。DepthFM的轻量级方法具有竞争力,速度快,并提供可靠的置信度估计。

对更多实验结果和文章细节感兴趣的读者,可以阅读一下论文原文

以上就是开源!超越ZoeDepth! DepthFM:快速且精确的单目深度估计!的详细内容,更多请关注其它相关文章!


# 只在  # 和田网站推广报价  # 铁岭抖音seo  # 杭州营销推广活动  # seo功能使用教程  # 造纸网站推广哪儿好  # 保定正规企业网站建设  # 云岩网络营销推广软文  # 鞍山搜索seo优化服务  # 典型营销推广案例文案  # 青岛关键词排名专业  # 中国  # 数据  # 有效地  # 多功能  # 提出了  # 很好  # 本田  # 展示了  # 最先进  # 开源  # stable diffusion  # 训练 


相关栏目: 【 行业新闻62819 】 【 科技资讯67470


相关推荐: 周鸿祎参加中美青年科技创新峰会,分享人工智能创新机遇  机构研选 | 虚拟电厂是电力物联网升级版 智能电网望迎来高速发展  OpenAI大神Karpathy最新分享:为什么OpenAI内部对AI Agents最感兴趣  人工智能颠覆软件测试四大方式  大模型的“黄金搭档”来了!腾讯云正式发布AI原生向量数据库,提供10亿级向量检索能力  下一个前沿:量子机器学习和人工智能的未来  Moka AI产品后观察:HR SaaS迈进AGI时代  国内阅读行业首款对话式AI应用“阅爱聊”封闭内测  脑虎科技:奔跑在“脑机接口”最前沿 跨界融合取得阶段性成果  赋能金融新生态,多家银行创新应用成果亮相世界人工智能大会  史玉柱谈AI:国内最缺是计算数学人才,曾给浙大数学系捐五千万  生成式人工智能如何改变云安全的游戏规则  全媒封面丨⑤商汤科技:原创AI算法“发电厂”  谷歌AudioPaLM实现「文本+音频」双模态解决,说听两用大模型  OpenAI宣布组建新团队 以控制“超级智能”人工智能  零数科技CTO兰春嘉:区块链与人工智能的结合点在数据  首个算网生态体!中国移动元宇宙产业联盟正式成立  OpenAI首席执行官引用《道德经》 呼吁就AI安全问题合作  长宁这家企业在世界人工智能大会上荣获“蓝鼎奖”  机智云AI离线语音识别模组,让家电变得更加智能便捷  AI大模型,将为智慧城市带来哪些新变化?  跑不动的元宇宙,虚拟世界比现实更冷酷  ChatGPT大更新!OpenAI奉上程序员大礼包:API新增杀手级能力还降价,新模型、四倍上下文都来了  当人工智能开始写高考作文?作家陈崇正、朱山坡谈文学与未来  报道称亚马逊正在测试AI生成产品评价摘要  组建团队,字节跳动要造机器人?  Win11 的画图应用将包含 Windows Copilot 的 AI 工具整合  IBM 与 NASA 携手开源地理空间 AI 模型,促进气候科学研究进步  美踏控股推出创新人工智能大数据模型“心乐舞河”:虚拟人音舞社交的新体验  挤爆服务器,北大法律大模型ChatLaw火了:直接告诉你张三怎么判  13 个提高生产力的 AI 工具  编程已死,AI 当立?教授公开“唱反调”:AI 还帮不了程序员  值得买科技入选“北京市通用人工智能产业创新伙伴计划”应用伙伴  利用AI探索抗体“钥匙”、加速药物研发——访百图生科团队  中国电信AI能力通过国家级金融领域权威认证并荣膺AI国际头部竞赛冠军  能走、能飞、能游泳,科学家打造全能 M4 机器人  pixivFANBOX 更新运营规则,禁止通过外链绕开 AI 生成禁令  尼康尼克尔Z 180-600mm f/5.6-6.3 VR镜头发布:12499元 拍鸟神器  梦想实现!硬核科幻大片VR智能头盔即将问世  关于开展“与AI共创未来”——2025年全国青少年人工智能创新实践活动的通知  鉴智机器人发布基于地平线征程5的标准视觉感知产品  写出优质文章的妙招:利用"稿见AI助手"的实用指南  WPS AI 官网上线:可申请体验官资格,支持 Windows、安卓端下载  为了避免人工智能可能带来的灾难,我们要向核安全学习  重磅! 捷通华声灵云AICC荣获第二届光合组织AI解决方案大赛二等奖  华为小艺AI助手将实现强大的大模型能力  人工智能自己玩自己  鸿蒙OS 4将实现AI大模型集成,余承东表示坚持AI辅助而非AI取代  脑机接口产业联盟发布十大脑机接口关键技术  Nature封面:量子计算机离实际应用还有两年 

400 128 6709
E-mail

contact@tlftec.cn

扫一扫,添加微信

©  云南淘乐房科技有限公司 版权所有  滇ICP备2025071560号  

云南淘乐房科技有限公司 云南淘乐房科技有限公司 云南淘乐房科技有限公司 云南淘乐房科技有限公司 云南淘乐房科技有限公司 云南淘乐房科技有限公司 云南淘乐房科技有限公司 云南淘乐房科技有限公司 云南淘乐房科技有限公司 云南淘乐房科技有限公司