Ask HN:有人已经用本地模型替代 Claude/GPT 来日常写代码了吗?

查看原文 HN 讨论

文章摘要

一位用户在 HN 发问:到底有没有人已经把本地运行的开源模型,完全当作日常写代码的主力工具,从而替代了 Claude、GPT 这类云端前沿模型?他希望大家分享具体的硬件与软件配置、实际使用体验,以及性能指标(比如每秒 token 数)。

这个问题引发了热烈讨论。从回帖来看,2026 年本地模型用于编码已经从”玩具”逐渐走向”可用”,但与顶级闭源模型之间仍存在明显的能力差距。多数实践者认为,本地模型更像一个需要细致指导的”初级工程师”,而前沿模型则像是能与你并肩思考架构的”资深工程师”。

讨论中反复出现的几个关注点包括:硬件门槛(大内存的 Mac Studio 或 Strix Halo 等统一内存机器)、量化精度与速度的权衡、提示词的精确度,以及如何评价”真实任务完成时间”而非单纯的吞吐量。隐私、离线可用和企业成本,则是不少人坚持走本地路线的核心动机。

HN 评论精华

Greenpants(约 1303 赞):在 128GB 内存的 Mac Studio 上运行 Qwen 系列(约 35B、3B 激活参数)的模型,容器化并完全离线沙箱运行,已用它完成了一个 Django + Wagtail 的网站改版。他指出本地模型对提示词要求很高、容易陷入循环,把它比作”需要人盯着带的初级工程师”,而 Claude Opus 则像”能和你一起思考的资深同事”。

lambda:采用类似方案,在容器中用 llama.cpp 配合自建 harness,在 128GB 的 Strix Halo 机器上大量测试各种模型。结论是 Qwen 的 35B-A3B 模型最适合编码,而聊天和翻译则偏好 Gemma 系列。

girvo:强调真正重要的是”完成任务的实际墙钟时间”,而不是每秒 token 数;在实际编码评测中,某些更快的中等模型反而能跑赢更大的 Qwen 模型。

electronsoup:分享经验称,更高的量化精度(如 Q8)虽然速度更慢,但准确率的提升足以抵消性能损失,整体更划算。

westoque:持保留意见,认为前沿模型能提供本地”初级”模型给不了的架构层面洞见,复杂设计上仍不可替代。

physix:从企业视角指出,本地模型在合规和长期成本上优势明显,相比昂贵的前沿模型订阅更具吸引力。