一名开发者做出了巧妙的优化改造,将NVIDIA芯片外接至iPhone设备,一夜之间把本地AI运行成本压低了43%。
手机端调出Phone Agent操作面板,本地部署Qwen3.5大模型,推理速度达到每秒421个token,单token耗时仅2.57毫秒。设备全程离线运行,不接入云端,就能自主开启软件、自动执行各类指令。
琐碎的简易任务自动分流给Kimi K2.6处理,单次开销仅0.09美元。高难度复杂工作则交给Opus模型运算,花费为1.41美元,并且模型切换时对话上下文能够完整保留,不会出现信息丢失。
在输出质量完全一致的前提下,单次会话开销从原先的2.07美元缩减至1.62美元,整体成本下降43%。整套方案没有改动模型本身,仅仅依靠任务智能分流就实现了省钱增效。
这套低成本架构十分精简:一块NVIDIA算力芯片、一台固定在支架上的iPhone,再加上一层智能分流策略,就搭建出了性价比更高、处理能力更强的本地AI工作站。
显示更多