模型跑起来之后:视觉 AI 还需要哪些系统能力?
一套视觉模型训练完成之后,真正的工作可能才刚刚开始。
它要接入不同来源的视频流,要适配摄像头和边缘设备,要在有限的算力条件下保持稳定推理;现场数据发生变化之后,算法还需要重新训练和优化;当越来越多模型同时运行,又会带来调度、路由、计量以及服务治理问题。
对于视觉 AI 来说,模型能不能识别与这套能力能不能长期运行在业务现场之间,隔着一整套系统工程。
这也是近两年 AI 进入产业应用之后越来越明显的变化:模型能力本身在快速普及,但企业真正落地 AI,需要解决的问题开始向模型两侧扩散——一端是数据、训练和迭代,另一端是部署、运行和业务系统。
最近格灵深瞳上线的新官网 Glint AI Studio,提供了一个观察这种变化的样本。
如果不沿着官网的产品目录看,而是从视觉 AI 实际运行的链路倒推,会发现格灵深瞳这次呈现出来的产品关系,核心其实围绕一个问题展开:如何让视觉模型从“训练出来”,真正走到“跑起来”,并持续被运营。
先看最靠近现场的一层
视觉 AI 与大量纯云端应用最大的区别之一,是它最终必须面对物理世界。
摄像头、视频流、银行网点、园区、城市管理现场,大量数据产生在边缘侧,很多推理任务同样需要在边缘完成。
因此,如果从业务现场向上看,最先遇到的并不是模型,而是模型怎么运行。
格灵深瞳的 GBOX 边缘智算盒子承担的就是这一环节:把已经形成的视觉智能能力部署到边缘侧,完成现场感知、推理运行以及相关数据回传。
但边缘设备只解决了“算法在哪里跑”的问题。继续往前追问,就会遇到另外两个问题:算法从哪里来?上线之后又由谁持续管理?
这也解释了为什么 GBOX 并不是独立存在,而是分别与 MENTOR、EXPERT 形成不同组合。
GBOX 之前,还有算法生产和运营
一条路径是 MENTOR 算法训练大师 + GBOX 边缘智算盒子。
MENTOR 面向模型和算法训练,企业可以结合自身业务数据完成算法生产和持续优化,再将形成的能力部署至 GBOX 运行。
这条路径解决的是一套视觉能力从数据进入训练环节,再进入边缘现场的过程。
另一条则是 EXPERT 算法运营专家 + GBOX 边缘智算盒子。
EXPERT 更偏算法运营、业务编排与项目管理,配合 GBOX 的边缘推理和数据回传,可以让模型、算法和相关业务数据更多运行在本地环境中,适用于对数据安全、本地化运行以及自主运营要求更高的场景。
两者解决的问题并不完全相同。
MENTOR+GBOX 更偏向持续训练和服务化交付;EXPERT+GBOX 则更强调本地运营与完整私有化部署。
这也是视觉智能工坊 VE²S 的核心逻辑。
过去,一个视觉算法进入新的应用环境,经常需要重新准备数据、调试模型、适配设备,再完成部署。现场情况变化之后,很多工作还需要再次重复。
当这些环节开始被拆成相对稳定的产品能力之后,视觉 AI 的重点也就从交付某个算法,逐渐转向如何持续生产和运营视觉智能能力。
当多个模型同时运行,问题变成了“怎么管”
如果只运行一个模型,系统复杂度还相对有限。
但当企业同时接入多个模型、多个推理服务和 AI 应用之后,新的问题会很快出现:
一个请求应该发给哪个模型?不同推理能力如何统一接入?资源如何调度?调用如何计量?服务如何保持稳定?
这时候,问题已经不是某一个视觉模型本身,而进入了 AI 服务的运行层。
格灵深瞳此次放出的 Token Fabric,就处在这一位置。
按照目前的产品定义,Token Fabric 围绕模型运行、推理效率、Token 生产,以及统一接入、路由、计量和服务治理等能力展开,为不同模型与推理能力的调用和运营提供支撑。围绕 Token 的生产与运营,格灵深瞳同时将其定义为 TaaS 能力。
从技术栈角度看,它更接近一层 AI Service Operations / Runtime。
它不直接决定模型“会什么”,而是负责模型在真正成为服务之后:怎么被调用、怎么被调度、怎么被计量,以及怎么长期稳定地运行。
这里也需要区分 MaaS 和 TaaS。
MaaS 侧重模型能力本身如何以服务方式提供;TaaS 围绕的则是 Token 生产与运营。
有意思的是,模型反而被放到了后面
从现场往回倒推到这里,再看格灵深瞳这次对模型能力的处理,反而更容易理解。
新版官网中,“灵感实验室”被正式推到前台。
过去更多隐藏在底层技术和产品中的视觉基础模型、多模态模型、人脸识别、三维视觉以及行业模型,被集中呈现,并开放模型体验与模型服务入口。
这意味着模型正在从一项内部技术能力,进一步变成可以直接对外提供的服务。
但模型服务在这里并不是终点。
企业拿到一个模型之后,仍然需要结合自己的数据训练和优化;完成训练之后,还需要进入现场部署;上线之后,又需要持续运营。
所以如果把这几层放在一起:
模型服务解决“能力从哪里来”;
MENTOR 解决“算法怎么持续生产”;
EXPERT 解决“算法怎么持续运营”;
GBOX 解决“能力怎么进入边缘现场”;
Token Fabric 解决“AI 服务怎么运行和被管理”。
这样看,产品之间的关系就不再只是一个“产品矩阵”,而更像一条运行链路。
最后一环:跑起来之后,AI 到底要做什么?
前面的几层主要解决一个问题,就是 AI 如何稳定运行。但企业最终不会为了运行一个模型而运行模型,它还要进入业务流程。
DeepBot 对应的就是这一端。
按照格灵深瞳目前给出的定位,DeepBot 连接模型、企业知识、Skill、工具以及既有系统,使 AI 从知识问答进一步进入任务执行,并围绕具体岗位与业务流程形成 Agent 和 AI 原生应用。
这实际上对应了企业 AI 另外一类工程问题,模型给出了推理能力,但一个真正能工作的 Agent,还需要知道:
可以调用什么工具;
能够访问哪些知识和系统;
任务如何被拆解;
不同环节之间如何协作。
从这个角度看,DeepBot 位于前面整套 AI 能力与企业业务之间。
而再往业务深处,格灵深瞳已经形成的城市管理、金融等行业解决方案,则承担这些能力进入具体场景后的组合和适配。新版官网集中呈现了包括深眸、战狼,以及四方镜、金砖等相关产品与解决方案。
视觉 AI 的下一步,可能不只在模型里
再回到 Glint AI Studio。
如果从官网导航去看,它展示的是模型服务、视觉智能产品、边缘终端、Token Fabric、DeepBot 和行业方案。
但如果从一个视觉 AI 系统实际运行的角度重新排列,它呈现出来的其实是另外一条链路:
模型能力 → 算法生产与运营 → 边缘运行 → AI 服务运营 → Agent 与业务应用。
这可能比产品数量本身更值得关注。
过去十多年,视觉 AI 公司的竞争很大程度上围绕识别准确率、算法数量和行业 Know-how 展开。但当基础模型能力不断提升之后,新的问题开始变成:如何让模型进入现场之后还能持续工作。
这需要的已经不再只是一个更强的模型,而是一套围绕模型建立起来的工程体系:数据能够继续进入,算法能够继续生产和运营,模型能够部署到边缘,服务能够被统一调度,最终还能进入业务工作流。
从这个角度看,格灵深瞳这次通过 Glint AI Studio 集中呈现的,与其说是一组新的 AI 产品,不如说是把过去分布在不同环节的能力,重新组织成一套围绕视觉 AI 持续运行的系统。
当模型越来越容易获得之后,真正拉开企业 AI 差异的,也许恰恰是这些模型之外的能力。
Aitishiku.com