swarmllm: Peer-to-Peer LLM Inference Across Browser Tabs(浏览器标签页间 P2P 运行 27B 模型)
2026/9/20大约 4 分钟
swarmllm: Peer-to-Peer LLM Inference Across Browser Tabs(浏览器标签页间 P2P 运行 27B 模型)
📅 2026-09-20 | 🏷️ 值得研究的仓库 | ⭐ ⭐414(慢热发现,创建于 2026-09-01)| JavaScript
🔗 仓库:https://github.com/Nehanth/swarmllm
是什么
一个纯浏览器端的 P2P 大模型推理项目:作者从零写了 WebGPU 推理引擎和 WebRTC 运行时,把一个 27B 模型切分后分给"同一房间里的多台设备"协同运行——每台设备(甚至每个浏览器标签页)承载模型的一片,拼起来跑完整个模型,全程不需要中心服务器。
🔍 小白解读
先说几个词
- WebGPU:浏览器里直接调用显卡算力的新标准,让网页获得接近原生程序的 GPU 性能。
- WebRTC:浏览器之间直接建立点对点连接的技术,视频通话就是靠它,不需要数据先绕到服务器。
- P2P(点对点):设备之间直接互传,没有中间商,像邻里之间直接借工具而不是都去超市买。
- 27B 模型:拥有 270 亿参数的大模型,通常被认为必须用数据中心级显卡才能跑。
- 模型切分:把一个大模型按层或按模块拆开,分给多台机器各算一段,像接力赛分工。
这篇到底在说什么
打个比方:以前跑大模型像必须去数据中心租一台超级计算机;这个项目说——把教室里 30 台笔记本的显卡"借"来,每台拿一块拼图,拼起来也能跑 270 亿参数的模型。技术上它做了两件硬核的事:一是从零实现 WebGPU 推理引擎(不是套现成库),二是用 WebRTC 让设备间直接通信、把模型的分片动态分配给房间里的设备。仓库创建约三周收获 414 颗星,作为"慢热发现",它说明浏览器端协同推理的需求真实存在——演示、教学、内网工具这些场景,不花钱租 GPU 也能跑起来给用户看。
这跟普通人有什么关系
对隐私敏感的普通人,数据可以完全不离开自己的设备群;对小团队和学校,用现有电脑就能做大模型演示;对更多人的意义是趋势信号——你口袋里和桌面上的闲置设备,正在变成潜在的推理资源。
为什么值得架构师关注
- 选型:边缘推理路线图新增"多设备协同切分"选项,适合演示、内网工具、离线场景,不适合生产 SLA——浏览器环境的带宽与设备在线率不可控。
- 成本:内网/离线推理可以从云端 GPU 挪到现有终端资产,边际成本接近零;但要评估协调复杂度。
- 风险:27B 切分对网络延迟高度敏感,一台设备掉线即影响整体;工程参考价值大于直接复用价值。
- 信号:WebGPU 生态成熟度在快速上升,端侧推理的浏览器交付形态值得纳入客户端技术雷达。
核心内容
- 从零实现的 WebGPU 推理引擎 + WebRTC 运行时,跨浏览器标签页拆分 27B 模型协同推理。
- 定位一句话:"Every device brings a slice. Together they run the whole model."——每台设备出一块,合起来跑完整模型。
- ⭐414,创建于 2026-09-01(本期慢热发现,30 天窗口入选)。
- 语言 JavaScript,纯浏览器方案,无中心服务器依赖。
行动建议
内网隐私场景或教学演示需求,可克隆跑一遍官方示例评估可行性;生产环境推理仍建议 vLLM 等成熟方案。即使不采用,其分片与 P2P 通信层的设计值得阅读借鉴。