← 返回笔记列表
第8期 · 开源项目
Needle 2|14MB 端侧工具调用模型(纯CPU跑Agent)
开源项目开发者第8期
#open-source#agent#tool-calling#on-device
45M 参数、单文件 14MB、纯 CPU、28MB 内存:树莓派等边缘设备离线跑工具调用,自带语法校验让输出 JSON 几乎零重试。
14MB 的模型怎么在本地调用工具?绝大多数 Agent 模型想实现工具调用,都得几百兆甚至几个 G 的体积,还需要显卡才能跑起来。而这个开源项目 Needle 2 彻底刷新下限。
核心参数
- 参数量仅 45M,模型压缩后单个文件仅 14MB,纯 CPU 运行,完整对话会话只占用 28MB 内存。
- 树莓派、老旧手机、单片机、VR 眼镜都能离线跑 Agent 工具调用。
专一的能力定位
- 不是通用聊天大模型,定位非常专一:只做自然语言转工具调用指令、结构化 JSON 输出、数据提取,不擅长开放式闲聊。
- 底层架构大刀阔斧改造:自研 Simple-Attention-Network,用 Hadamard MLP 替换传统前馈网络,搭配 CQ2-bit 自研量化。
- 内置字节级语法校验,输出的工具调用 JSON 几乎不会格式错乱,不需要反复重试。
- 自带 256 Token 滑动窗口,长时间工具循环调用不会内存溢出。
使用方式
- 只需要把你的 Python 函数加上装饰器,定义好工具、参数、功能描述,丢给 Needle Agent。
- 用户输入自然语言,模型本地直接判断调用哪个工具、填充参数、执行函数、再把结果传回模型,完成闭环,全程不用联网、不用云端大模型。
实测性能
- 树莓派 5:500+ token/s;百元安卓手机:300-700 token/s。
- 支持并行调用多工具、链式多步骤任务、结构化表单提取、智能家居设备控制、机器人指令下发。
开源信息与落地思路
- GitHub 仓库 cactus-compute/needle;代码 MIT 协议、模型权重 Apache-2.0,完全开源免费。
- 适合分层 Agent 架构:简单高频工具路由交给本地 14MB 的 Needle,复杂模糊的难题向上交给云端大模型,大幅降低 Token 成本、提升隐私安全。
- 短板:上下文很短,不适合长文档理解,只适合边缘设备轻量智能体。
📝 我的点评
这条的突破口在『把工具调用做小做专』:45M 参数 + 14MB + 纯 CPU + 28MB 内存,专做 NL→工具调用/JSON/数据提取,不碰聊天。关键工程创新是自研 Simple-Attention-Network + Hadamard MLP + CQ2-bit 量化,用字节级语法校验把『输出合法工具调用』做成几乎零重试。落地思路很对路:分层 Agent——简单高频工具路由交给本地 14MB 的 Needle,复杂问题再上云,省 Token 又保隐私。短板(短上下文、不适合长文档)要记住,别拿它干长文本活。对产业带边缘/隐私敏感场景,是极实用的底座。