产品介绍:Unify 2.0 是什么?
Unify 2.0是润宇科技推出的基于B/S架构、集成多种计算资源和能力的桌面化操作平台。通过多集群模式完成高性能计算与智能计算的资源分配,根据不同任务需求动态分配计算资源,实现更高的性能和计算效率;同时拥有灵活的平台部署能力,适配目前市场主流国产芯片。
平台整体分为五层架构:
展现层(统一门户+API接口)
业务层(平台运营服务、智能算力调度系统、通用算力调度系统、应用分析系统、运维监控系统)
引擎层(Slurm+Kubernetes、容器引擎+Harbor+采集引擎+告警引擎)
系统层(操作系统)
资源层(管理/计算服务器、基础环境、存储、网络)
部署方式支持私有云本地部署、私有云异地部署与公有云云端部署的混合云形态,本地与云端算力可统一纳管。
对用户来说,最直观的体验是:无需感知底层差异,统一门户一键提交HPC作业或AI训练任务,平均节省30%的准备时间。
功能模块总览:五大系统,一次看清
那么,Unify 2.0具体能做什么?答案藏在业务层的五大系统里。它们协同组成,覆盖从平台运营、算力申请、作业调度、模型开发到运维监控的全流程:
平台运营服务:把算力中心“管起来”。重点是多集群统一纳管、调度策略与队列管理,安全合规与资金对账一并内置。
智能算力调度系统:把AI开发“做起来”。训推一体化打通训练到推理全流程,Notebook随开随用,模型训练、部署、微调、管理形成闭环。
通用算力调度系统:把传统HPC应用“用起来”。自定义应用一键上架,远程桌面与可视化让专业软件无需本地安装、浏览器即用。
应用分析系统:把算力效率“看明白”。集群、节点、作业三层分析,细到CPU/GPU/内存/显存/硬盘/网络/进程。
运维监控系统:把机房运维“可视化”。3D机房让资产位置一目了然,自定义告警提前发现风险。
平台运营服务:把算力中心“管起来”
面向算力中心的全生命周期运营。多集群管理统一纳管超算集群与智算集群;调度策略、作业管理、队列管理让资源分配有规则可循;资源共享与资源分配盘活闲置算力;绿色节能降低运营成本。
安全与合规同样内置:审核管理、数据安全、文件管理,权限边界清晰可控;资金对账与充值计费,让算力使用可计量、可结算。
智能算力调度系统:把AI开发“做起来”
覆盖AI开发全链路。训推一体化支持训练与推理在同一平台流转;Notebook提供Jupyter、VSCode开发环境,随开随用;模型训练、模型微调、模型部署、模型管理形成完整闭环;镜像管理、数据集管理、可视化让每个环节都顺手。
通用算力调度系统:把传统HPC应用“用起来”
面向传统HPC应用与专业软件。自定义应用一键封装上架;License管理统一授权;Linux远程桌面、远程可视化让图形界面应用无需本地安装、浏览器远程操作;节点独占满足独占式作业需求;命令行保留用户习惯。
应用分析系统:把算力效率“看明白”
面向算力使用效率的深度洞察。集群分析、节点分析、作业分析覆盖CPU/GPU/内存/显存/硬盘/网络/进程等维度,存储分析、吞吐分析定位瓶颈,让每一分算力用在哪、用得怎么样,都有数据说话。
运维监控系统:把机房运维“可视化”
面向机房与设备的可视化运维。3D机房让资产与位置一目了然,资产生命周期管理覆盖设备全流程;自定义告警与监测点提前发现风险,告警趋势分析与邮箱通知让异常及时触达。
技术底座:Slurm与K8S双引擎,HPC与AI一个都不少
融合计算的技术关键是“让专业的调度器做专业的事”:Slurm针对高性能计算优化作业排队与并行处理,K8S为模型部署提供弹性扩缩容,二者通过统一调度协同,对CPU密集型HPC任务与GPU加速AI任务统一资源分配;HPC与AI在物理、网络、存储层分域运行,避免资源争抢;同时支持传统MPI应用与云原生AI框架无缝集成。
自主可控与落地场景
信创方面:计算、存储、网络、操作系统全面支持国产化,异构资源统一纳管并支持GPU切分,支持单机单卡、单机多卡、多机多卡作业调度。
从申请算力、跑通作业、训练模型,到分析瓶颈、监控机房——Unify 2.0,一个平台全部覆盖。
润宇科技Unify融合计算平台2.0,连接算力新世界。
关于润宇科技
润宇科技专注智能计算与人工智能技术研发,聚焦产业 AI 落地,致力于降低人工智能应用门槛,把技术能力转化为稳定可运营的产业价值,助力各行业智能化转型升级。
预约演示 · 申请PoC · 获取方案
访问官网了解更多
产品咨询
185 7673 1805
业务咨询
132 7033 1670
本文转载自润宇科技微信公众号。点击阅读公众号原文。