Ollama 本地运行大模型,如果 CPU 占用在 50% 以上,又占用了很多内存,GPU 占用却在 20% 左右,可以用命令
ollama ps验证模型的处理器,如下图:

qwen3:8b 的 PROCESSOR 是 48%/52% CPU/GPU
可以尝试打开 Ollama 的 Settings,修改 Context Length 到合适的大小:

再看看 ollama ps 结果:

显示 100% GPU 就正常啦。
当然,你的输入输出的 token 不会超过该长度才行,不然可能会截断或报错,导致回答的准确率下降或执行失败。
Ollama 跑大模型生成太慢,未使用独立显卡 GPU 0 NVIDIA GPU,而 GPU 1 Intel Graphics 使用率 100%,内存几乎占满,CPU 使用率也异常高,怎么办?如何改为用英伟达独立显卡来跑?
打开 NVIDIA 控制面板(NVIDIA Control Panel),展开左侧菜单中的“3D 设置”,点击“管理 3D 设置”,切到“程序设置”选项卡,在下拉框中选择 llama-server.exe 这个程序,为此程序选择首选图形处理器改为“高性能 NVIDIA 处理器”,点击右下角的“应用”保存设置。

重启 Ollama。
使用 Ollama,即可在“NVIDIA GPU 活动”中看到 llama-server.exe。

| 小米电视 5 | 小米电视 5 Pro | |
| 亮点 | 全面屏、超薄金属机身、小爱同学、远场语音、PatchWall、4K、四单元喇叭、3GB+32GB | 量子点、MEMC运动补偿、4K+HDR10+、全面屏、小爱同学、远场语音、PatchWall、4GB+64GB |
| 分辨率 | 3840x2160(4K) | |
| 背光 | 侧入式 | |
| 可视角度 | 178° | |
| 刷新率 | 60Hz | |
| 广色域 | NTSC 85% | NTSC 108% |
| CPU | Cortex A55 | |
| GPU | Mali-G31 MP2 | |
| 内存 | 3GB | 4GB |
| 闪存 | 32GB | 64GB |
| 解码能力 | 8K 视频解码 | |
| 无线 | 2.4GHz/5GHz、蓝牙、红外 | |
| 尺寸 | 55 英寸 长 1227mm 高 717.8mm 含脚架高 773.2mm 65 英寸 长 1445.9mm 高 831.4mm 含脚架高 898mm 75 英寸 长 1676.5mm 宽 973.3mm 含脚架高 1037.7mm | |
| 首发价格 | 55" ¥2999 65" ¥3999 75" ¥7999 | 55" ¥3699 65" ¥4999 75" ¥9999 |
| 首发价格(舍入) | 55" ¥3000 65" ¥4000 75" ¥8000 | 55" ¥3700 65" ¥5000 75" ¥10000 |