感谢亚汇网网友HH_KK、该平台基于龙芯2K3000和9A1000芯片集成的LG200系列通用GPU核心开发。在已有OpenGL、Vulkan图形软件栈的基础上,平台进一步覆盖算力芯片驱动、编译器、运行时环境、算子库、推理引擎、调试工具和性能分析工具等组件。龙芯加速计算平台支持OpenCL3.0和CUDA两类编程模型接口,并集成BLAS、DNN等高性能算子库,可用于AI模型推理。平台面向龙芯全系列算力芯片,支持从系统选型、算力调用、模型优化到应用部署的开发流程。在运行时环境方面,平台提供资源调度管理、内存管理、任务队列调度和事件同步等功能。底层驱动则对不同硬件计算资源进行统一抽象和管理,以支持多进程、多任务并发执行。平台还集成了面向龙芯通用GPU的算力编译器,同时兼容OpenCL3.0和CUDA编程接口。龙芯中科称,编译器针对自研通用GPU的指令集架构和硬件特性进行了优化,并通过API层面的兼容降低开发和迁移适配成本。调试与分析工具支持断点设置、寄存器访问以及张量单元等硬件部件状态检查,可用于定位访存越界、计算异常和同步死锁等算力程序开发问题。算子库目前覆盖基础线性代数和神经网络计算。其中,BLAS相关算子针对FP32、INT8等数据类型的矩阵乘法(GEMM)、矩阵向量乘法和向量运算进行了汇编级优化;DNN算子则覆盖卷积、池化、归一化、全连接和激活函数等常用操作。针对龙芯通用GPU的张量单元及缓存层次结构,龙芯中科还对算子库进行了专门优化,以提高硬件计算资源利用率。在AI推理方面,龙芯中科推出了高性能推理引擎LacInfer,通过算子融合、常量折叠、算子消除和布局转换等方式优化计算图。其中,算子融合支持逐元素算子以及多分支、多输入算子的融合,也支持卷积、偏置和激活算子的深度融合,以减少数据访存。龙芯加速计算平台支持ONNXRuntime,并将LacInfer作为ONNXRuntime的执行后端。基于这一架构,用户可以将由PyTorch、TensorFlow等训练框架导出的ONNX模型直接部署到龙芯通用GPU平台,无需额外转换或重写代码。目前,龙芯中科已在9A1000等芯片上针对目标检测、图像分割、姿态估计、旋转目标检测等计算机视觉模型进行优化。公司称,在提高推理速度的同时,相关量化推理的精度损失也得到了控制。硬件兼容方面,该平台支持龙芯全系列算力芯片和Linux多内核版本系统,并计划随着9A2000、9A3000等后续算力芯片推进同步演进,以实现不同代际算力芯片之间的软件兼容。亚汇网注:CUDA是英伟达推出的通用GPU并行计算平台与编程模型,OpenCL则是一套面向异构计算设备的开放并行编程标准,两者均可用于GPU加速计算。龙芯中科表示,目前相关算力软件已经服务部分早期客户,并基于2K3000、9A1000开展多款具身智能设备的智能体研发。随着龙芯加速计算平台正式发布,公司计划与产业链合作伙伴及开发者共同建设算力和AI软件生态。相关阅读:《《《《
免责声明:本文章仅代表作者个人观点,不代表亚汇网立场,亚汇网仅提供信息展示平台。
更多行情分析及广告投放合作加微信: hollowandy