组队
llm-on-edges
2024

LLM on Edges

看看谁家开发者文档最抽象?

云计算与运维大语言模型人工智能

现在很多服务商都提供了 LLM 的 api 接口以供用户调用,但是云服务并不总是可用,总有设备网络连接不稳定的时候,并且有些用户可能只是需要处理一些日常的事项,也不希望自己的数据全部上云。此时端侧大模型便是一个选项。

对于大部分人来说,能进行推理的设备不止一个(如电脑上的 CUDA 设备,手机上的 NPU ),但单个设备的推理速度有限,且内存限制影响显著。

请你提出一个方案,来充分利用端侧设备算力,构建本地 LLM 推理系统(可基于现有开源项目二次开发)。

可在与出题人交流进度之后,从出题人处获得提示


加分项

  • 有实机演示(视频或现场)
  • 实现多设备分布式推理和负载均衡
  • 实现自动、无感知的服务降级
  • 支持 Linux (CUDA)设备
  • 支持 Windows (CUDA)设备
  • 支持 Android 设备
  • 支持 iOS / iPad OS (Metal)设备
  • 支持 macOS (Metal)设备
出题人:可可