RTX 3060 Ti 是老一代甜品卡(8 GB 显存 / 4864 CUDA 核心),本地跑 AI 到底能到什么程度?这里按类型拆开说,方便对号入座。
LLM 大语言模型
流畅运行(4bit 量化)
| 模型 | 4bit 显存 | 3060 Ti 体验 |
|---|---|---|
| Qwen3 4B / Gemma 3 4B | 2–3 GB | 极快,长上下文也稳 |
| Llama 3.2 3B | 2 GB | 极快 |
| Qwen3 8B / Llama 3.1 8B | 4–5 GB | 舒服,20+ tok/s |
跑 8B 级别是最好的性价比——推理速度快、显存留够上下文、日常问答 / 代码补全都能用。
勉强能跑
- Qwen3 14B(4bit):显存刚好 8 GB 附近,需要部分层卸载到 CPU
- Llama 3.1 8B + 长上下文(32K+):KV cache 会顶到 6 GB+
工具用 Ollama / LM Studio 会自动做 CPU 卸载,速度下降到 5-8 tok/s。
别指望
- Qwen3 32B、DeepSeek-R1 原版、Llama 3 70B
- 这些至少要 24 GB 显存 + 大量系统内存,多卡才舒服
代码模型
3060 Ti 本地跑:
- Qwen3-Coder-8B(4bit)
- DeepSeek-Coder-V2-Lite(16B MoE 但激活参数少)
Python / JS / Vue / PHP 补全够用,但和 Claude / GPT-4 差距还是明显。作为离线补全 + 隐私备份合适,做核心开发工具不推荐。
多模态(VL)模型
看图说话、OCR、UI 截图分析:
- Qwen2.5-VL 3B / 7B:3060 Ti 主力选择
- MiniCPM-V 4.5:中文 OCR 强,端侧优化好
- InternVL 2.5 4B
用途:
- 图片问答
- 表格图 → 结构化数据
- UI 截图定位元素(配合自动化)
- PDF / 扫描件 OCR
YOLO 训练
完全无压力
- YOLOv8n / YOLOv8s
- YOLO11n / YOLO11s
- YOLOv5s
640×640 输入 + batch 16-32,一张 3060 Ti 单卡跑几千张数据集,几个小时收敛。
可以训练
- YOLOv8m / YOLO11m
要压 batch 到 8 或者降图片尺寸。
吃力
- YOLOv8l / YOLOv8x:batch 1-2、图片 640 以下,能训但很慢
- SAM / DINO 类分割模型:训练基本没戏,推理够呛
Stable Diffusion / 文生图
- SD 1.5(512×512):几秒一张,舒服
- SDXL / SDXL Turbo(1024×1024):能跑,但慢,需要开
--medvram - Flux 1:显存不够,直接放弃
配合 ControlNet、LoRA 会显著吃显存,SDXL + ControlNet 已经很紧。
OCR
跑 OCR 反而对显存要求低:
- PaddleOCR PP-OCRv5:中文强、CPU 也能跑,GPU 加速几百 QPS
- RapidOCR:更轻量,ONNX 部署
- DocOwl / MinerU:文档结构化,需要 4-6 GB
推荐的实用组合
一台 3060 Ti + 32 GB 内存的机器,日常跑这套刚刚好:
| 用途 | 模型 | 工具 |
|---|---|---|
| 日常聊天 / 代码 | Qwen3-8B-Instruct (Q4) | Ollama / LM Studio |
| 看图 / OCR | Qwen2.5-VL 7B | vLLM / LM Studio |
| 目标检测训练 | YOLO11s | Ultralytics |
| 出图 | SD 1.5 + ControlNet | ComfyUI / A1111 |
| 转写字幕 | Whisper Small / Medium | faster-whisper |
八九不离十能覆盖个人开发者需求。
Ollama 一键跑
# 装 Ollama
curl -fsSL https://ollama.com/install.sh | sh
# 拉模型
ollama pull qwen3:8b
ollama pull qwen2.5-vl:7b
# 跑
ollama run qwen3:8b
Ollama 会自动挑合适量化、自动 GPU/CPU 分配、不用你操心。
一句话总结
3060 Ti 8GB 甜蜜点是 7B~8B 量化 LLM + 中等 YOLO 训练 + SD 1.5。想跑 14B+ 或 SDXL 就得砍上下文 / 出图速度。真要玩大模型,二手 3090 / 4090 才是更好投资。
