DA
DealiAxy
2026年09月15日

本地部署大模型哪个性能好?在 8845HS (780M核显) 上的 LM Studio 基准测试

省流:目前用下来 `google/gemma-4-e4b` 是比较均衡的,在速度和性能方面表现都不错

未分类
11735 字
约 40 分钟阅读
更新于 09-15

以前开源小参数模型基本是玩具,但今年情况有所不同,qwen3.5, gemma4, lfm2.5 这些表现其实都可圈可点了。

我最近在鸡哥无界14x上部署了一些小参数的模型进行测试,主要场景是生成 Git Commit Message,本地模型可以不错的完成这个任务。

我好奇不同模型的速度和效果,目前用下来 google/gemma-4-e4b 是比较均衡的,在速度和性能方面表现都不错,不过由于时间有限,本文先测一下速度。

以下是用工具测试的输出报告,后续我会把用到的工具开源(实际上也是大模型爷爷开发的)

LM Studio 文本生成模型基准报告

测试条件

  • 开始时间:2026-08-18T23:02:40+08:00
  • API:http://localhost:1234(模型列表来源:api_v1)
  • 提示词版本:2026.08.18
  • 采样:temperature=0.0, max_tokens=512, top_p=1.0, seed=42
  • 轮次:每个模型 × 场景预热 1 次,正式 3 次
  • 独占加载:开启(同时只保留当前模型,测完即卸载)
  • 超时:180s
  • 输出目录:C:\code\1\land-go\data\benchmarks\20260818-230240
  • 显存 / 内存:本阶段不测。LM Studio 未提供稳定可读的占用数据时,不做不可靠估算。

场景

  • short_answer(短问答):一两句知识问答,主要观察首字延迟。 主要看 ttft_ms。
  • long_generation(长文本生成):要求约 800 字的说明文,主要观察持续生成速度。 主要看 tokens_per_second。
  • reasoning(推理题):固定难度的算术应用题,主要观察总耗时与稳定性。 主要看 total_ms。
  • code_generation(代码生成):编写带说明的短 Python 函数,观察实用输出速度。 主要看 tokens_per_second。
  • long_context(长上下文问答):先读长文再提问,观察长上下文下的首字延迟和吞吐。 主要看 ttft_ms。

参与测试的模型

  • qwen3.5-4b (Q4_K_M),架构 qwen35
  • lfm2.5-8b-a1b (Q4_K_M),架构 lfm2moe
  • liquidai/lfm2.5-2.6b (Q5_K_M),架构 lfm2
  • lmstudio-community/lfm2.5-2.6b (Q4_K_M),架构 lfm2
  • google/gemma-4-e4b (Q4_K_M),架构 gemma4
  • qwen/qwen3.5-2b (Q4_K_M),架构 qwen35

已跳过模型

模型原因来源
text-embedding-bge-m3type=embeddingapi_v1
text-embedding-qwen3-embedding-0.6btype=embeddingapi_v1
text-embedding-nomic-embed-text-v1.5type=embeddingapi_v1

运行概况

  • 正式请求:90,成功 90,失败 0
  • 预热请求:30

按首字延迟(TTFT)排序

越低越好。日常对话、补全输入更看这项,不要只看 tokens/s。

名次模型场景值成功率
1lmstudio-community/lfm2.5-2.6b (Q4_K_M)long_context2132.39 ms100%
2lmstudio-community/lfm2.5-2.6b (Q4_K_M)reasoning2133.84 ms100%
3liquidai/lfm2.5-2.6b (Q5_K_M)long_generation2136.09 ms100%
4liquidai/lfm2.5-2.6b (Q5_K_M)code_generation2139.84 ms100%
5liquidai/lfm2.5-2.6b (Q5_K_M)short_answer2142.14 ms100%
6lmstudio-community/lfm2.5-2.6b (Q4_K_M)code_generation2144.16 ms100%
7liquidai/lfm2.5-2.6b (Q5_K_M)reasoning2162.66 ms100%
8liquidai/lfm2.5-2.6b (Q5_K_M)long_context2171.90 ms100%
9lfm2.5-8b-a1b (Q4_K_M)long_context2181.84 ms100%
10lmstudio-community/lfm2.5-2.6b (Q4_K_M)long_generation2188.06 ms100%
11lmstudio-community/lfm2.5-2.6b (Q4_K_M)short_answer2194.65 ms100%
12lfm2.5-8b-a1b (Q4_K_M)short_answer2196.51 ms100%
13lfm2.5-8b-a1b (Q4_K_M)long_generation2211.24 ms100%
14lfm2.5-8b-a1b (Q4_K_M)code_generation2222.23 ms100%
15lfm2.5-8b-a1b (Q4_K_M)reasoning2240.66 ms100%
16qwen/qwen3.5-2b (Q4_K_M)code_generation2280.83 ms100%
17qwen/qwen3.5-2b (Q4_K_M)long_generation2335.33 ms100%
18qwen/qwen3.5-2b (Q4_K_M)reasoning2411.94 ms100%
19qwen/qwen3.5-2b (Q4_K_M)short_answer2425.75 ms100%
20google/gemma-4-e4b (Q4_K_M)short_answer2435.16 ms100%
21google/gemma-4-e4b (Q4_K_M)long_context2458.39 ms100%
22qwen3.5-4b (Q4_K_M)short_answer2470.26 ms100%
23qwen/qwen3.5-2b (Q4_K_M)long_context2475.28 ms100%
24google/gemma-4-e4b (Q4_K_M)reasoning2483.72 ms100%
25qwen3.5-4b (Q4_K_M)long_context2495.70 ms100%
26qwen3.5-4b (Q4_K_M)long_generation2500.24 ms100%
27google/gemma-4-e4b (Q4_K_M)code_generation2514.18 ms100%
28qwen3.5-4b (Q4_K_M)reasoning2519.97 ms100%
29qwen3.5-4b (Q4_K_M)code_generation2528.72 ms100%
30google/gemma-4-e4b (Q4_K_M)long_generation2619.88 ms100%

按持续生成速度(tokens/s)排序

越高越好。长文写作更看这项。无法从 API 拿到 completion_tokens 的行不会出现在这里。

名次模型场景值成功率
1lfm2.5-8b-a1b (Q4_K_M)short_answer46.19 tok/s100%
2lfm2.5-8b-a1b (Q4_K_M)code_generation44.96 tok/s100%
3lfm2.5-8b-a1b (Q4_K_M)long_generation44.82 tok/s100%
4lfm2.5-8b-a1b (Q4_K_M)reasoning44.54 tok/s100%
5lfm2.5-8b-a1b (Q4_K_M)long_context44.18 tok/s100%
6lmstudio-community/lfm2.5-2.6b (Q4_K_M)code_generation31.12 tok/s100%
7lmstudio-community/lfm2.5-2.6b (Q4_K_M)short_answer30.92 tok/s100%
8lmstudio-community/lfm2.5-2.6b (Q4_K_M)reasoning30.68 tok/s100%
9lmstudio-community/lfm2.5-2.6b (Q4_K_M)long_generation30.68 tok/s100%
10liquidai/lfm2.5-2.6b (Q5_K_M)long_generation30.23 tok/s100%
11lmstudio-community/lfm2.5-2.6b (Q4_K_M)long_context30.19 tok/s100%
12liquidai/lfm2.5-2.6b (Q5_K_M)reasoning30.17 tok/s100%
13liquidai/lfm2.5-2.6b (Q5_K_M)code_generation30.10 tok/s100%
14liquidai/lfm2.5-2.6b (Q5_K_M)short_answer30.04 tok/s100%
15liquidai/lfm2.5-2.6b (Q5_K_M)long_context29.79 tok/s100%
16qwen/qwen3.5-2b (Q4_K_M)short_answer20.57 tok/s100%
17qwen/qwen3.5-2b (Q4_K_M)long_generation17.25 tok/s100%
18qwen/qwen3.5-2b (Q4_K_M)reasoning17.24 tok/s100%
19qwen/qwen3.5-2b (Q4_K_M)long_context17.24 tok/s100%
20qwen/qwen3.5-2b (Q4_K_M)code_generation17.09 tok/s100%
21qwen3.5-4b (Q4_K_M)short_answer16.56 tok/s100%
22google/gemma-4-e4b (Q4_K_M)short_answer16.54 tok/s100%
23qwen3.5-4b (Q4_K_M)reasoning16.53 tok/s100%
24qwen3.5-4b (Q4_K_M)long_generation16.53 tok/s100%
25qwen3.5-4b (Q4_K_M)code_generation16.48 tok/s100%
26qwen3.5-4b (Q4_K_M)long_context16.36 tok/s100%
27google/gemma-4-e4b (Q4_K_M)long_generation15.83 tok/s100%
28google/gemma-4-e4b (Q4_K_M)reasoning15.83 tok/s100%
29google/gemma-4-e4b (Q4_K_M)code_generation15.66 tok/s100%
30google/gemma-4-e4b (Q4_K_M)long_context15.40 tok/s100%

按稳定性(总耗时变异系数)排序

越低越好。用正式成功轮的总耗时标准差 / 均值;样本少于 2 次的组合不参与。

名次模型场景值成功率
1qwen/qwen3.5-2b (Q4_K_M)reasoning0.00100%
2qwen3.5-4b (Q4_K_M)long_context0.00100%
3lfm2.5-8b-a1b (Q4_K_M)long_generation0.00100%
4liquidai/lfm2.5-2.6b (Q5_K_M)code_generation0.00100%
5qwen/qwen3.5-2b (Q4_K_M)code_generation0.00100%
6lfm2.5-8b-a1b (Q4_K_M)long_context0.00100%
7lmstudio-community/lfm2.5-2.6b (Q4_K_M)short_answer0.00100%
8liquidai/lfm2.5-2.6b (Q5_K_M)reasoning0.00100%
9liquidai/lfm2.5-2.6b (Q5_K_M)long_context0.00100%
10google/gemma-4-e4b (Q4_K_M)long_generation0.00100%
11lfm2.5-8b-a1b (Q4_K_M)reasoning0.00100%
12google/gemma-4-e4b (Q4_K_M)short_answer0.00100%
13lmstudio-community/lfm2.5-2.6b (Q4_K_M)reasoning0.00100%
14liquidai/lfm2.5-2.6b (Q5_K_M)short_answer0.00100%
15lfm2.5-8b-a1b (Q4_K_M)code_generation0.00100%
16google/gemma-4-e4b (Q4_K_M)reasoning0.01100%
17lmstudio-community/lfm2.5-2.6b (Q4_K_M)long_generation0.01100%
18google/gemma-4-e4b (Q4_K_M)long_context0.01100%
19google/gemma-4-e4b (Q4_K_M)code_generation0.01100%
20lfm2.5-8b-a1b (Q4_K_M)short_answer0.01100%
21qwen3.5-4b (Q4_K_M)short_answer0.01100%
22liquidai/lfm2.5-2.6b (Q5_K_M)long_generation0.01100%
23qwen/qwen3.5-2b (Q4_K_M)short_answer0.01100%
24lmstudio-community/lfm2.5-2.6b (Q4_K_M)code_generation0.01100%
25qwen3.5-4b (Q4_K_M)reasoning0.01100%
26qwen3.5-4b (Q4_K_M)long_generation0.01100%
27qwen/qwen3.5-2b (Q4_K_M)long_generation0.01100%
28lmstudio-community/lfm2.5-2.6b (Q4_K_M)long_context0.01100%
29qwen3.5-4b (Q4_K_M)code_generation0.02100%
30qwen/qwen3.5-2b (Q4_K_M)long_context0.02100%

综合推荐

  • 日常交互更看低 TTFT:优先看 lmstudio-community/lfm2.5-2.6b (Q4_K_M)(场景 long_context,中位 TTFT 2132.39 ms)。
  • 长文 / 代码更看持续 tokens/s:优先看 lfm2.5-8b-a1b (Q4_K_M)(场景 code_generation,中位 44.96 tok/s)。
  • 稳定性:qwen/qwen3.5-2b (Q4_K_M)(场景 reasoning,总耗时 CV 0.000)波动较小。

明细摘要

模型场景成功TTFT 中位 (ms)TTFT P95总耗时中位 (ms)tokens/s 中位CV
google/gemma-4-e4b (Q4_K_M)code_generation3/32514.182735.5535199.1515.660.006
google/gemma-4-e4b (Q4_K_M)long_context3/32458.392474.5932838.8315.400.006
google/gemma-4-e4b (Q4_K_M)long_generation3/32619.882666.5134960.4215.830.003
google/gemma-4-e4b (Q4_K_M)reasoning3/32483.722643.8534827.6415.830.005
google/gemma-4-e4b (Q4_K_M)short_answer3/32435.162484.1411666.8916.540.004
lfm2.5-8b-a1b (Q4_K_M)code_generation3/32222.232241.9813610.1344.960.005
lfm2.5-8b-a1b (Q4_K_M)long_context3/32181.842198.2513767.0744.180.001
lfm2.5-8b-a1b (Q4_K_M)long_generation3/32211.242226.7213627.7444.820.001
lfm2.5-8b-a1b (Q4_K_M)reasoning3/32240.662263.0913737.1344.540.003
lfm2.5-8b-a1b (Q4_K_M)short_answer3/32196.512218.516061.2646.190.006
liquidai/lfm2.5-2.6b (Q5_K_M)code_generation3/32139.842167.2619167.4630.100.001
liquidai/lfm2.5-2.6b (Q5_K_M)long_context3/32171.902182.6319369.2029.790.003
liquidai/lfm2.5-2.6b (Q5_K_M)long_generation3/32136.092183.3519122.9330.230.007
liquidai/lfm2.5-2.6b (Q5_K_M)reasoning3/32162.662205.0519115.5930.170.003
liquidai/lfm2.5-2.6b (Q5_K_M)short_answer3/32142.142160.609458.9230.040.004
lmstudio-community/lfm2.5-2.6b (Q4_K_M)code_generation3/32144.162207.6818585.2731.120.008
lmstudio-community/lfm2.5-2.6b (Q4_K_M)long_context3/32132.392189.6019156.4930.190.012
lmstudio-community/lfm2.5-2.6b (Q4_K_M)long_generation3/32188.062233.7618926.1630.680.005
lmstudio-community/lfm2.5-2.6b (Q4_K_M)reasoning3/32133.842199.5818837.6730.680.004
lmstudio-community/lfm2.5-2.6b (Q4_K_M)short_answer3/32194.652202.206819.3830.920.003
qwen/qwen3.5-2b (Q4_K_M)code_generation3/32280.832439.1632249.3717.090.001
qwen/qwen3.5-2b (Q4_K_M)long_context3/32475.282588.007100.6417.240.022
qwen/qwen3.5-2b (Q4_K_M)long_generation3/32335.332398.0932080.6917.250.010
qwen/qwen3.5-2b (Q4_K_M)reasoning3/32411.942472.1527465.5717.240.000
qwen/qwen3.5-2b (Q4_K_M)short_answer3/32425.752445.082863.1820.570.007
qwen3.5-4b (Q4_K_M)code_generation3/32528.722834.6233741.6116.480.016
qwen3.5-4b (Q4_K_M)long_context3/32495.702536.3733783.6916.360.000
qwen3.5-4b (Q4_K_M)long_generation3/32500.242869.2733473.3116.530.008
qwen3.5-4b (Q4_K_M)reasoning3/32519.972883.5933488.8016.530.008
qwen3.5-4b (Q4_K_M)short_answer3/32470.262858.0933390.1216.560.006

如何读结论

  • 不要只按单一 tokens/s 决定「最快」。
  • 实际选型还要看生成质量、显存占用和失败率,这些不在本报告的速度排名里。
  • 修改提示词后应提升 PROMPT_VERSION,把新结果当成新的基准版本。