
成立仅两年的初创公司 Mindbeam AI 今日发布了款名为 Litespark-Inference 的开源人工智能理框架。该框架旨在通过优化法,让大型语言模型(LLM)在标准消费中央处理器(CPU)上运行,从而降低 AI 工作负载对昂贵图形处理器(GPU)的依赖。
Litespark-Inference 的核心在于其对"三元模型"的支持。这类经网络将权重限制为 -1、0 和 +1 三个值铜陵泡沫板橡塑板专用胶,大幅减少了理过程中大规模乘法运的开销。尽管这在定程度上牺牲了精度,但换来了显著的能提升和内存节省。据官基准测试数据,与标准的 PyTorch 实现相比,该框架的吞吐量提升了 17 至 96 倍,同时内存需求降低了 80 以上。
重新定义 CPU 在 AI 理中的角
Mindbeam 创始人兼席执行官 Nii Osae 指出,当前 AI 理管道中,用户输入先到达 CPU,随后才转发至 GPU,CPU 往往仅充当"消息传递者"的角。随着 Token 成本上升及 GPU 供应短缺铜陵泡沫板橡塑板专用胶,行业亟需降低部署成本,尤其是在内存受限的边缘应用场景中。Mindbeam 认为,几乎存在于每个 AI 系统中的 CPU 是种被严重低估的资源。
该公司强调,Litespark-Inference 并非意在取代 GPU,而是将其作为互补加速器。通过让 CPU 承担部分理任务,GPU 得以处理多 Token,从而提升整体系统率。软件支持两种部署模式:是允许开发者在本地硬件上 GPU 运行语言模型;二是面向云提供商,万能胶生产厂家实现 CPU 与 GPU 在非聚理架构中的协同工作。
能实测与硬件适配铜陵泡沫板橡塑板专用胶
在具体能表现上,运行该框架的 Apple M5 处理器每秒可处理近 40 个 Token,而使用 PyTorch 时仅为约 2.3 个 Token。在支持英特尔 AVX-512 矢量经网络指令的系统上,吞吐量达到近 34 个 Token/ 秒,较基线提升 96 倍,内存消耗从约 4.6GB 降至不足 800MB。
该框架利用了现代处理器的单指令多数据(SIMD)指令集,包括 Arm 的 NEON SDOT 以及英特尔和 AMD 的矢量经网络指令。Mindbeam 开发的自定义内核能自动检测处理器并优化执行过程。目前,初始版本已支持 Apple Silicon、Intel 和 AMD 处理器,未来将针对 AWS Inferentia 等特定云硬件进行优化。
Mindbeam 已在 GitHub 上公开了 Litespark-Inference 的源代码,并鼓励社区进行立基准测试。Osae 表示,公司计划在今年晚些时候出注于云端的商业化版本,并将技术扩展至功耗敏感的机器人技术和边缘计域,旨在为生态系统提供节能的理模型。
【星途科讯 图文丨伊贝】相关词条:铝皮保温施工 隔热条设备 钢绞线 玻璃棉卷毡 保温护角专用胶
奥力斯 保温护角专用胶批发 联系人:王经理 手机:13903175735(微信同号) 地址:河北省任丘市北辛庄乡南代河工业区
1.本网站以及本平台支持关于《新广告法》实施的“极限词“用语属“违词”的规定,并在网站的各个栏目、产品主图、详情页等描述中规避“违禁词”。
2.本店欢迎所有用户指出有“违禁词”“广告法”出现的地方,并积极配合修改。
3.凡用户访问本网页,均表示默认详情页的描述,不支持任何以极限化“违禁词”“广告法”为借口理由投诉违反《新广告法》,以此来变相勒索商家索要赔偿的违法恶意行为。
