• <li id="aaaaa"></li>
  • <li id="aaaaa"><tt id="aaaaa"></tt></li><li id="aaaaa"><tt id="aaaaa"></tt></li>
    <li id="aaaaa"></li>
    <tt id="aaaaa"><table id="aaaaa"></table></tt>
  • 行業動態

    您的位置:首頁 > > 信息動態  > > 新聞中心 > > 行業動態

    浪潮元腦R1服務器適配新開源框架,單機DeepSeek 671B并發過千

    2025-02-22         來源:m.ytsws.cn

    浪潮信息元腦R1推理服務器已完成對開源框架SGLang新版本的深度適配,成功實現在單機高性能運行DeepSeek R1 671B模型時可支持超過1000路的用戶并發訪問。




    浪潮元腦R1推理服務器NF5688G7原生搭載FP8計算引擎,針對DeepSeek R1 671B模型部署速度快且無精度損失,1128GB HBM3e高速顯存滿足671B模型 FP8精度下不低于800GB顯存容量的需求,單機支持全量模型推理情況下,仍保留充足的KV緩存空間。顯存帶寬高達4.8TB/s,契合DeepSeek R1模型"短輸入長輸出、顯存帶寬敏感"的技術特征,在推理解碼階段可實現加速。在通信方面,GPU P2P帶寬達900GB/s,保障單機部署張量并行通訊性能。

    SGLang是新興的開源推理框架項目,其得到活躍的社區支持,并在工業界獲得了廣泛應用。SGlang的核心特性包括:快速的后端運行時、靈活的前端語言、廣泛的模型支持等。尤其值得關注的是,SGLang針對MLA注意力機制開展了針對性的工程優化,并在框架上對MoE架構的推理做了優化設計。SGLang也是適配DeepSeek v3和R1的推理框架之一。

    目前,浪潮元腦R1推理服務器 NF5688G7已完成SGLang新版本 0.4.3的適配優化工作。通過硬件調優、算子優化、混合并行、多token預測等多方面的工程實踐,在元腦R1推理服務器 NF5688G7上運行DeepSeek 671B R1模型,成功實現了單用戶解碼33 tokens/s及用戶并發超1000的性能表現。





    微信咨詢
  • <li id="aaaaa"></li>
  • <li id="aaaaa"><tt id="aaaaa"></tt></li><li id="aaaaa"><tt id="aaaaa"></tt></li>
    <li id="aaaaa"></li>
    <tt id="aaaaa"><table id="aaaaa"></table></tt>
  • 国产日韩精品一区 彰武县| 文山县| 遂宁市| 临朐县| 韶山市| 大港区| 娱乐| 威远县| 磐安县| 永平县| 泰兴市| 永善县| 育儿| 阿克陶县| 云阳县| 和硕县| 涿鹿县| 武义县| 姜堰市| 英超| 石屏县| 武汉市| 澄江县| 东明县| 志丹县| 达州市| 乌兰察布市| 丘北县| 天台县| 平定县| 天长市| 舒城县| 安顺市| 湘阴县| 东乌| 大埔区| 辽源市| 江津市| 昌图县| 青州市| 皮山县| http://444 http://444 http://444