Orbis团队:用 AI Agent 连接数字世界与现实创造
2026/7/23 2:33:41 网站建设 项目流程

——第二届 DGX Spark 黑客松开发复盘

一、项目背景:从 Agent Anything 到数字资产实体化

随着生成式人工智能的持续发展,AI 的角色已经从单纯生成文本、图像和代码的工具,逐渐演变为能够理解任务、调用工具并组织复杂流程的智能系统。Agent Anything 所代表的,不仅是一种更强的大模型能力,更是一种新的应用设计方式:系统不再只输出结果,而是需要围绕目标去思考该如何行动。正是在这样的背景下,Orbis 团队开始思考一个问题:如果 AI Agent 不只是处理数字内容,而能够理解现实对象、协调不同模型并完成端到端任务,它是否能够帮助数字世界与现实世界建立更直接的连接?这成为本次项目的真正起点。

图1:项目愿景——从现实对象输入,到数字重建与优化,再到纸模实体输出。

在黑客松启动后,Orbis 团队围绕“Agent Anything”进行了多轮方向讨论。最初进入深入分析的方案有两个。第一个方向是基于味觉、视觉和听觉融合的 AI 食物体验系统,希望通过多模态信息构建更丰富的食物评鉴过程;但进一步分析后,团队发现味觉数据高度依赖个体主观感受,不同用户在风味、口感和评价标准上存在较大差异,短时间内很难建立稳定、统一的数据表达体系。第二个方向则是数字资产实体化,即让现实世界中的物体通过图片或视频进入数字空间,再让数字空间中的模型资产重新回到现实,以纸模的形式被创造、被分享、被体验。相比前者,这一方向更适合结合视觉理解、3D 生成、AI Agent 和几何优化等能力,也更容易形成完整闭环,因此最终被确定为项目的核心方向。

项目一旦确定,团队对其目标也进行了重新定义。我们并不希望只做一个“图片转纸模”的工具,而是希望构建一条从现实对象出发,经由数字理解和数字重构,再回到现实创造的完整链路。现实中的物体可以通过图像进入数字空间,数字空间中的资产也可以借助 AI 完成语义理解、结构重构和实体制作。这种“现实 → 数字 → 实体”的流程,正是 Orbis 团队在本次黑客松中希望探索的核心命题。

二、十日开发历程:从 Idea 到 Demo

7 月 12 日,DGX Spark 黑客松训练营正式开始,也成为项目真正进入开发阶段的起点。十天开发并不是一条预先设计好的直线路径,而是在不断学习、实验、修正和重新组织中逐渐成形的过程。回头看,这十天并不是简单地把一个初步想法写成代码,而是把“数字资产实体化”从概念逐渐变成可运行 Demo 的过程。

图2:十日开发时间线——从训练营学习、技术选型、模型实验到最终展示的完整历程。

Day 1:训练营学习与 Agent 思维建立

在第一天的训练营中,团队最重要的收获并不是某个具体模型的参数或某个工具的使用方法,而是对 Agentic AI 的理解发生了变化。在训练营之前,团队更多将 Agent 理解为“让语言模型可以调用工具”;但随着案例学习深入,我们逐渐认识到,一个真正有效的 Agent 系统需要围绕目标进行任务分解、能力调用和结果校验。对于本次项目而言,这种变化直接影响了产品形态:如果系统只是“输入图片,输出结果”,它仍然只是单点模型应用;但如果系统能够理解用户想制作的对象、决定需要哪些模型参与、组织不同模块完成连续任务,那么项目就不再只是纸模生成工具,而是一条由 AI Agent 驱动的智能创作流程。

Day 2:技术路线设计与整体流程确定

在明确 Agent 逻辑之后,团队开始进一步梳理产品路径。最初看起来,问题似乎可以被简化为“用户输入一张图片,系统输出一个纸模”;但真正落到实现上,我们很快发现中间存在许多不可跳过的步骤。系统需要首先理解图片中的对象及其语义,然后提取用户真正关注的目标,再通过三维生成完成数字重构,之后还要面对模型复杂度控制、几何优化和纸模展开等问题。也正是在这一天,项目的整体流程逐渐清晰:输入层支持图片、视频和已有数字资产;前端理解层负责视觉识别和语义分析;三维层负责 3D 生成与重构;几何处理层负责模型抽象与制造适配;输出层负责纸模展开和制作说明生成。项目从这一刻开始,不再是一组离散想法,而是一条具有明确阶段分工的产品链路。

Day 3:模型实验与第一次技术挑战

第三天,团队开始进入模型实验阶段,重点验证视觉理解模型和 3D 生成模型的效果。最初,团队对现有模型能力抱有较高期待,尤其是在三维生成部分,我们一度认为,只要能得到一个视觉上足够真实的 3D 模型,后续就能够自然衔接到纸模制作流程中。实验很快打破了这一假设。以 Segment 类视觉模型为例,它能够帮助系统识别图片中的对象区域,但在真实场景中,系统真正要解决的问题并不是“图像里有什么”,而是“用户真正想制作什么”。当一张图片里出现多个对象、复杂背景或遮挡关系时,仅有分割结果并不足以完成目标理解,语义理解的重要性开始凸显。另一方面,3D生成的实验结果在视觉上令人印象深刻:结构完整、细节丰富、整体效果接近真实。但当团队尝试进一步把这些模型转化为纸模时,问题马上出现了——高密度 Mesh、复杂曲面和不适合展开的拓扑让后续流程寸步难行。第三天最大的结论是:视觉真实性并不等于制造可行性,三维生成模型输出的“好看”结果,并不能直接变成“能做”的纸模。

Day 4-5:Agent 流程整合与混合架构形成

在完成基础模型验证之后,项目开始进入系统整合阶段。此时团队面对的关键问题已经不是“某个模型能不能跑起来”,而是“不同模型如何形成一个完整流程”。与此同时,真实应用中的数据隐私问题也浮出水面。由于系统需要处理用户上传的图片和现实场景信息,如果所有数据直接发送到云端模型,虽然可以利用更强的推理能力,但也会带来数据风险。因此,团队逐步形成了一套混合式 AI 架构:本地 Qwen 模型负责输入理解、信息提取、隐私预处理和初步任务规划;在完成去隐私和结构化处理后,再将必要信息发送给 StepFun API,用于更复杂的语义推理和高级分析。在这一阶段,AI Agent 的角色也变得更加清晰:它不直接代替某个模型工作,而是作为任务协调中心,将视觉理解、3D 生成、几何处理和输出生成组织为连续步骤。项目由此从“模型组合”转变为“工作流系统”。

Day 6-7:模型抽象与纸模生成

第六天到第七天,项目进入最核心也最困难的技术阶段:如何把一个复杂数字模型真正变成用户可以制作的纸模。团队首先尝试通过降低模型面数来简化 3D 结构,但实验很快表明,简单减少 Polygon 数量会直接破坏物体特征。汽车模型会失去车轮和比例,建筑模型会丢掉门窗和空间关系,动物模型则会失去身体轮廓和识别特征。因此,模型抽象不能只是几何上的压缩,而必须结合语义保持,让不同类型对象保留各自最重要的结构信息。随后,项目进一步进入纸模展开阶段。三维模型如何切割、如何展开、哪些边需要折叠、哪些区域需要粘贴,看似是几何操作,实际上直接影响最终用户是否真的能够完成制作。早期结果虽然可以生成展开面,但往往会出现面片过多、拼装关系复杂、制作门槛过高的问题。因此,团队持续在切割策略、折线组织和说明表达方式上进行调整,目标不再是生成一张数学上成立的展开图,而是生成一份用户真正可以理解和制作的纸模方案。

Day 8-9:Demo 优化与体验完善

当基础链路逐渐跑通后,团队进入了最后一轮集中优化。这个阶段最重要的发现是:技术能够运行,并不意味着它已经成为一个好的 Demo。前期开发更多关注模型是否可用、流程是否能够打通,但最终展示要求系统不仅能够完成任务,还要让用户理解它为什么有价值。因此,团队重新审视展示逻辑,不再把 Demo 组织为一系列独立的技术步骤,而是重构为一条清晰的产品故事线:输入一个现实对象,AI 理解对象含义,完成三维重构,对模型进行制造适配,最终生成纸模和制作说明,让数字资产重新回到现实。在这一阶段,产品侧重点转向输入体验、过程展示和输出呈现方式;算法侧则继续优化模型稳定性和结果质量;系统侧进一步梳理 Agent 流程和模块之间的衔接。项目开始从“技术验证”转向“产品表达”。

Day 10:最终展示与完整闭环形成

到第十天,Orbis 团队最终完成了可演示的闭环 Demo。系统支持用户输入图片、视频或已有数字模型,并能够完成对象理解、主体提取、三维生成、模型优化、纸模展开和制作说明生成。更重要的是,Demo 最终展示的不只是一个技术结果,而是一整条“现实对象进入数字空间,再重新回到现实创造”的产品逻辑。回顾这十天,项目最重要的收获并不是完成了某个单点模型或某个单独功能,而是把一个模糊的概念真正组织成了完整可运行的智能创作系统。

三、技术探索:AI Agent、多模态理解与数字资产转换

从技术层面看,项目真正有价值的地方并不在于使用了多少模型,而在于这些能力如何被组织成一个连贯系统。AI Agent 在其中承担的是任务协调中心的角色:它需要理解输入目标,决定调用哪些模型,并在执行过程中管理中间状态和输出结构。多模态理解则是系统能够连接现实对象与数字资产的基础。图片、视频和已有数字资产在表面形式上不同,但在系统内部都需要被转化为可处理的语义对象。3D 生成模块负责数字重构,使对象进入可继续操作的三维空间;几何优化模块则把“适合看”的模型调整为“适合做”的模型;纸模输出模块最终完成现实回归。整个项目的技术思想可以概括为:利用 Agent 组织多模型协作,完成从现实输入到实体输出的完整数字资产转换流程。

图3:DGX Spark + Agent——本地理解、云端推理、任务编排与结果输出的完整工作流程。

四、工程挑战与踩坑复盘

项目开发过程中最具代表性的工程问题主要集中在四个方面。第一,高质量 3D 模型与制造需求之间的冲突。3D 模型生成的结果在视觉上很强,但复杂曲面、高密度网格和缺少制造约束使其无法直接用于纸模制作。第二,视觉分割与用户意图之间的差距。Segment 解决的是“哪里有物体”,但真实产品场景需要解决的是“用户真正希望制作哪个对象”,这迫使系统必须引入更强的语义理解。第三,模型抽象并不能简单等同于降低面数。过度简化会直接损坏关键结构,因此需要围绕物体语义进行有选择的保留。第四,纸模展开不是单纯的几何变换问题。切割位置、折线组织、粘贴区域和说明方式都会影响最终可制作性。也正是在这些问题的推动下,项目从“单次生成结果”逐渐演化为“面向真实制作体验的系统方案”。

五、NVIDIA DGX Spark 开发体验

DGX Spark 对本次项目的价值并不只是提供一个可运行模型的环境,更重要的是,它帮助团队以更贴近真实应用开发的方式组织整个过程。7 月 12 日训练营让项目在一开始就接触到 Agentic AI 的设计方式,团队不再只关注模型能力,而开始关注工作流、任务拆解和工具协同。进入实际开发后,DGX Spark 又成为本地模型实验、多模型验证和 Agent 流程测试的重要支撑环境。围绕本地 Qwen 和 StepFun API 形成的混合架构,也是在这种环境中逐步打磨出来的。对团队而言,这次开发体验最大的启发在于:AI 应用开发的关键不只是选择强模型,而是如何在合适的平台上,把不同模型能力组织成真正可运行的系统。

六、最终成果与未来方向

最终,Orbis 团队完成了一个面向数字资产实体化的 Demo 系统。用户可以输入现实对象图片、视频或已有数字模型,系统通过 AI 理解、三维重构、几何优化和纸模展开,生成可打印、可裁剪、可拼装的纸模方案,并输出制作说明。这一成果证明,数字资产实体化不仅可以作为一个有趣的创作方向存在,也可以成为 AI Agent、多模态理解和数字制造结合的实践入口。未来,团队希望进一步把这一方向扩展为更完整的平台:一方面支持更多数字资产类型,例如游戏角色、AI 生成内容和工业设计模型;另一方面结合 3D 打印、AR/VR 展示和智能制造能力,让“数字内容重新回到现实世界”的过程变得更自然、更高效,也更具创造性。

结语

回顾整个开发过程,Orbis 团队真正完成的并不仅仅是一个纸模生成 Demo,而是一次围绕“数字资产如何回到现实”展开的完整探索。这个过程既包括项目构思、模型实验和工程踩坑,也包括对 AI Agent、数字理解与实体创造之间关系的重新认识。对于我们而言,本次黑客松的意义不只在于完成展示,更在于验证了一条新的创作路径:AI 不仅能够生成数字内容,也可以成为连接数字世界与现实创造的重要桥梁。

需要专业的网站建设服务?

联系我们获取免费的网站建设咨询和方案报价,让我们帮助您实现业务目标

立即咨询