← 返回AI教程
🌐 其他

模型跑起来之后:视觉 AI 还需要哪些系统能力?

来源:InfoQ 中文 · 发布于 2026-08-18 19:17:47
一套视觉模型训练完成之后,真正的工作可能才刚刚开始。它要接入不同来源的视频流,要适配摄像头和边缘设备,要在有限的算力条件下保持稳定推理;现场数据发生变化之后,算法还需要重新训练和优化;当越来越多模型同时运行,又会带来调度、路由、计量以及服务治理问题。对于视觉 AI 来说,模型能不能识别与这套能力能不能长期运行在业务现场…

一套视觉模型训练完成之后,真正的工作可能才刚刚开始。

它要接入不同来源的视频流,要适配摄像头和边缘设备,要在有限的算力条件下保持稳定推理;现场数据发生变化之后,算法还需要重新训练和优化;当越来越多模型同时运行,又会带来调度、路由、计量以及服务治理问题。

对于视觉 AI 来说,模型能不能识别与这套能力能不能长期运行在业务现场之间,隔着一整套系统工程。

这也是近两年 AI 进入产业应用之后越来越明显的变化:模型能力本身在快速普及,但企业真正落地 AI,需要解决的问题开始向模型两侧扩散——一端是数据、训练和迭代,另一端是部署、运行和业务系统。

最近格灵深瞳上线的新官网 Glint AI Studio,提供了一个观察这种变化的样本。

如果不沿着官网的产品目录看,而是从视觉 AI 实际运行的链路倒推,会发现格灵深瞳这次呈现出来的产品关系,核心其实围绕一个问题展开:如何让视觉模型从“训练出来”,真正走到“跑起来”,并持续被运营。

先看最靠近现场的一层

视觉 AI 与大量纯云端应用最大的区别之一,是它最终必须面对物理世界。

摄像头、视频流、银行网点、园区、城市管理现场,大量数据产生在边缘侧,很多推理任务同样需要在边缘完成。

因此,如果从业务现场向上看,最先遇到的并不是模型,而是模型怎么运行。

格灵深瞳的 GBOX 边缘智算盒子承担的就是这一环节:把已经形成的视觉智能能力部署到边缘侧,完成现场感知、推理运行以及相关数据回传。

但边缘设备只解决了“算法在哪里跑”的问题。继续往前追问,就会遇到另外两个问题:算法从哪里来?上线之后又由谁持续管理?

这也解释了为什么 GBOX 并不是独立存在,而是分别与 MENTOR、EXPERT 形成不同组合。

GBOX 之前,还有算法生产和运营

一条路径是 MENTOR 算法训练大师 + GBOX 边缘智算盒子。

MENTOR 面向模型和算法训练,企业可以结合自身业务数据完成算法生产和持续优化,再将形成的能力部署至 GBOX 运行。

这条路径解决的是一套视觉能力从数据进入训练环节,再进入边缘现场的过程。

另一条则是 EXPERT 算法运营专家 + GBOX 边缘智算盒子。

EXPERT 更偏算法运营、业务编排与项目管理,配合 GBOX 的边缘推理和数据回传,可以让模型、算法和相关业务数据更多运行在本地环境中,适用于对数据安全、本地化运行以及自主运营要求更高的场景。

两者解决的问题并不完全相同。

MENTOR+GBOX 更偏向持续训练和服务化交付;EXPERT+GBOX 则更强调本地运营与完整私有化部署。

这也是视觉智能工坊 VE²S 的核心逻辑。

过去,一个视觉算法进入新的应用环境,经常需要重新准备数据、调试模型、适配设备,再完成部署。现场情况变化之后,很多工作还需要再次重复。

当这些环节开始被拆成相对稳定的产品能力之后,视觉 AI 的重点也就从交付某个算法,逐渐转向如何持续生产和运营视觉智能能力。

当多个模型同时运行,问题变成了“怎么管”

如果只运行一个模型,系统复杂度还相对有限。

但当企业同时接入多个模型、多个推理服务和 AI 应用之后,新的问题会很快出现:

一个请求应该发给哪个模型?不同推理能力如何统一接入?资源如何调度?调用如何计量?服务如何保持稳定?

这时候,问题已经不是某一个视觉模型本身,而进入了 AI 服务的运行层。

格灵深瞳此次放出的 Token Fabric,就处在这一位置。

按照目前的产品定义,Token Fabric 围绕模型运行、推理效率、Token 生产,以及统一接入、路由、计量和服务治理等能力展开,为不同模型与推理能力的调用和运营提供支撑。围绕 Token 的生产与运营,格灵深瞳同时将其定义为 TaaS 能力。

从技术栈角度看,它更接近一层 AI Service Operations / Runtime。

它不直接决定模型“会什么”,而是负责模型在真正成为服务之后:怎么被调用、怎么被调度、怎么被计量,以及怎么长期稳定地运行。

这里也需要区分 MaaS 和 TaaS。

MaaS 侧重模型能力本身如何以服务方式提供;TaaS 围绕的则是 Token 生产与运营。

有意思的是,模型反而被放到了后面

从现场往回倒推到这里,再看格灵深瞳这次对模型能力的处理,反而更容易理解。

新版官网中,“灵感实验室”被正式推到前台。

过去更多隐藏在底层技术和产品中的视觉基础模型、多模态模型、人脸识别、三维视觉以及行业模型,被集中呈现,并开放模型体验与模型服务入口。

这意味着模型正在从一项内部技术能力,进一步变成可以直接对外提供的服务。

但模型服务在这里并不是终点。

企业拿到一个模型之后,仍然需要结合自己的数据训练和优化;完成训练之后,还需要进入现场部署;上线之后,又需要持续运营。

所以如果把这几层放在一起:

  • 模型服务解决“能力从哪里来”;

  • MENTOR 解决“算法怎么持续生产”;

  • EXPERT 解决“算法怎么持续运营”;

  • GBOX 解决“能力怎么进入边缘现场”;

  • Token Fabric 解决“AI 服务怎么运行和被管理”。

这样看,产品之间的关系就不再只是一个“产品矩阵”,而更像一条运行链路。

最后一环:跑起来之后,AI 到底要做什么?

前面的几层主要解决一个问题,就是 AI 如何稳定运行。但企业最终不会为了运行一个模型而运行模型,它还要进入业务流程。

DeepBot 对应的就是这一端。

按照格灵深瞳目前给出的定位,DeepBot 连接模型、企业知识、Skill、工具以及既有系统,使 AI 从知识问答进一步进入任务执行,并围绕具体岗位与业务流程形成 Agent 和 AI 原生应用。

这实际上对应了企业 AI 另外一类工程问题,模型给出了推理能力,但一个真正能工作的 Agent,还需要知道:

  • 可以调用什么工具;

  • 能够访问哪些知识和系统;

  • 任务如何被拆解;

  • 不同环节之间如何协作。

从这个角度看,DeepBot 位于前面整套 AI 能力与企业业务之间。

而再往业务深处,格灵深瞳已经形成的城市管理、金融等行业解决方案,则承担这些能力进入具体场景后的组合和适配。新版官网集中呈现了包括深眸、战狼,以及四方镜、金砖等相关产品与解决方案。

视觉 AI 的下一步,可能不只在模型里

再回到 Glint AI Studio。

如果从官网导航去看,它展示的是模型服务、视觉智能产品、边缘终端、Token Fabric、DeepBot 和行业方案。

但如果从一个视觉 AI 系统实际运行的角度重新排列,它呈现出来的其实是另外一条链路:

模型能力 → 算法生产与运营 → 边缘运行 → AI 服务运营 → Agent 与业务应用。

这可能比产品数量本身更值得关注。

过去十多年,视觉 AI 公司的竞争很大程度上围绕识别准确率、算法数量和行业 Know-how 展开。但当基础模型能力不断提升之后,新的问题开始变成:如何让模型进入现场之后还能持续工作。

这需要的已经不再只是一个更强的模型,而是一套围绕模型建立起来的工程体系:数据能够继续进入,算法能够继续生产和运营,模型能够部署到边缘,服务能够被统一调度,最终还能进入业务工作流。

从这个角度看,格灵深瞳这次通过 Glint AI Studio 集中呈现的,与其说是一组新的 AI 产品,不如说是把过去分布在不同环节的能力,重新组织成一套围绕视觉 AI 持续运行的系统。

当模型越来越容易获得之后,真正拉开企业 AI 差异的,也许恰恰是这些模型之外的能力。