当前位置：首页 > article >正文

大模型部署：在Windows电脑上快速运行AI大模型-Llama3

article 2025/3/11 15:48:58

概述

近期 Meta 发布了最新的 Llama3 模型，并开源了开源代码。Meta Llama 3 现已推出 8B 和 70B 预训练和指令调整版本，可支持广泛的应用程序。

并且 Llama 3 在语言细微差别、上下文理解和翻译和对话生成等复杂任务方面表现出色。

我们可以在 Windows 上快速运行 Llama3 8B 模型。

📝Notes

郑重声明: 本文几乎没有任何原创内容, 主要资料都来自于网上, 笔者只是总结自己实际可以运行起来的详细步骤, 供各位读者参考.
另外, 笔者的水平有限, 欢迎大家提出改进意见. 目前可以快速在 Windows 上运行 AI 模型的方法还有几个, 包括不限于:

Llmafile
Chat With RTX | Nvidia
WSL2 + WASMEdge

受限于个人经验, 提供提供使用: WSL+ WASMEdge 的实战方案.

📚️参考资料

Llama3
有人说开源模型会越来越落后，来试试 Llama 3 吧 | LlamaEdge | Second State
How to install Linux on Windows with WSL
CUDA on WSL User Guide

技术栈

Llama3
LlamaEdge + WASMEdge
NVIDIA 显卡驱动 + CUDA
WSL2

前提条件

Windows 10/11 系统
硬件: NVIDIA 显卡(具体型号要求不确定, 应该是可以运行 CUDA 的都可以; 我的 2060 实战没有问题)

具体步骤

1. 安装 NVIDIA Windows 最新版本显卡驱动

步骤略.

2. 安装 WSL

📚️Reference

How to install Linux on Windows with WSL

前提

您必须运行Windows 10版本2004和更高版本（Build 19041和更高版本）或Windows 11才能使用下面的命令。

启动您喜欢的Windows终端/命令提示符/ Powershell并安装WSL：
```
wsl.exe --install
```
确保你有最新的WSL内核：
```
wsl.exe --update
```

3. WSL Ubuntu 安装 CUDA Toolkit

📚️Reference

CUDA Toolkit 12.4 Update 1 Downloads

进入 WSL Ubuntu, 使用如下命令安装 CUDA Toolkit

wget https://developer.download.nvidia.com/compute/cuda/repos/wsl-ubuntu/x86_64/cuda-wsl-ubuntu.pin
sudo mv cuda-wsl-ubuntu.pin /etc/apt/preferences.d/cuda-repository-pin-600
wget https://developer.download.nvidia.com/compute/cuda/12.4.1/local_installers/cuda-repo-wsl-ubuntu-12-4-local_12.4.1-1_amd64.deb
sudo dpkg -i cuda-repo-wsl-ubuntu-12-4-local_12.4.1-1_amd64.deb
sudo cp /var/cuda-repo-wsl-ubuntu-12-4-local/cuda-*-keyring.gpg /usr/share/keyrings/
sudo apt-get update
sudo apt-get -y install cuda-toolkit-12-4

4. 使用 LlamaEdge + WasmEdge 运行本地 AI 大语言模型 - Llama3

📚️References

有人说开源模型会越来越落后，来试试 Llama 3 吧 | LlamaEdge | Second State

以下为原文摘录:
通过这篇文章，你将能够在自己的电脑上使用 LlamaEdge[2]（Rust + Wasm 堆栈）开发和部署 Llama-3-8B 的应用程序。无需安装复杂的 Python 包或 C++ 工具链！查看为什么选择这个技术栈。

如果你想要快速开始，只需要在终端运行下面的命令行，这个命令行工具会帮你自动下载所需的软件：LLM runtime, Llama-3-8B 模型，以及 LLM 推理程序。

bash <(curl -sSfL 'https://raw.githubusercontent.com/LlamaEdge/LlamaEdge/main/run-llm.sh') --model llama-3-8b-instruct

🐾Warning

友情提示, 执行这一步之前请确保网络畅通.

执行结果如下:

[+] Downloading the selected model from https://huggingface.co/second-state/Llama-3-8B-Instruct-GGUF/resolve/main/Meta-Llama-3-8B-Instruct.Q5_K_M.gguf
######################################################################################################### 100.0%
[+] Extracting prompt type: llama-3-chat
[+] No reverse prompt required
[+] Install WasmEdge with wasi-nn_ggml plugin ...

Using Python: /home/casey/.pyenv/shims/python3
INFO    - CUDA detected via nvcc
WARNING - Experimental Option Selected: plugins
WARNING - plugins option may change later
INFO    - Compatible with current configuration
INFO    - Running Uninstaller
WARNING - Uninstaller did not find previous installation
WARNING - SHELL variable not found. Using zsh as SHELL
INFO    - shell configuration updated
INFO    - Downloading WasmEdge
|============================================================|100.00 %INFO    - Downloaded
INFO    - Installing WasmEdge
INFO    - WasmEdge Successfully installed
INFO    - Downloading Plugin: wasi_nn-ggml-cuda
|============================================================|100.00 %INFO    - Downloaded
INFO    - Downloading Plugin: wasmedge_rustls
|============================================================|100.00 %INFO    - Downloaded
INFO    - Run:
source /home/casey/.zshrc

    The WasmEdge Runtime is installed in /home/casey/.wasmedge/bin/wasmedge.


[+] Downloading the latest llama-api-server.wasm ...
  % Total    % Received % Xferd  Average Speed   Time    Time     Time  Current
                                 Dload  Upload   Total   Spent    Left  Speed
  0     0    0     0    0     0      0      0 --:--:-- --:--:-- --:--:--     0
  0     0    0     0    0     0      0      0 --:--:-- --:--:-- --:--:--     0
100 8070k  100 8070k    0     0  2575k      0  0:00:03  0:00:03 --:--:-- 7030k

[+] Downloading Chatbot web app ...
  % Total    % Received % Xferd  Average Speed   Time    Time     Time  Current
                                 Dload  Upload   Total   Spent    Left  Speed
  0     0    0     0    0     0      0      0 --:--:-- --:--:-- --:--:--     0
  0     0    0     0    0     0      0      0 --:--:--  0:00:01 --:--:--     0
  0     0    0     0    0     0      0      0 --:--:--  0:00:01 --:--:--     0
100 1721k  100 1721k    0     0   703k      0  0:00:02  0:00:02 --:--:-- 10.2M


[+] Will run the following command to start the server:

    wasmedge --dir .:. --nn-preload default:GGML:AUTO:Meta-Llama-3-8B-Instruct.Q5_K_M.gguf llama-api-server.wasm --prompt-template llama-3-chat --model-name Meta-Llama-3-8B-Instruct.Q5_K_M.gguf --socket-addr 0.0.0.0:8080 --log-prompts --log-stat

    Chatbot web app can be accessed at http://0.0.0.0:8080 after the server is started


*********************************** LlamaEdge API Server ********************************

[2024-04-19 23:54:06.043] [error] instantiation failed: module name conflict, Code: 0x60
[2024-04-19 23:54:06.043] [error]     At AST node: module

[INFO] LlamaEdge version: 0.8.3
[INFO] Model name: Llama-3-8B
[INFO] Model alias: default
[INFO] Context size: 4096
[INFO] Prompt template: llama-3-chat
[INFO] Number of tokens to predict: 1024
[INFO] Number of layers to run on the GPU: 100
[INFO] Batch size for prompt processing: 512
[INFO] Temperature for sampling: 1
[INFO] Top-p sampling (1.0 = disabled): 1
[INFO] Penalize repeat sequence of tokens: 1.1
[INFO] Presence penalty (0.0 = disabled): 0
[INFO] Frequency penalty (0.0 = disabled): 0
[INFO] Enable prompt log: false
[INFO] Enable plugin log: false
[INFO] Socket address: 0.0.0.0:8080
ggml_cuda_init: GGML_CUDA_FORCE_MMQ:   no
ggml_cuda_init: CUDA_USE_TENSOR_CORES: yes
ggml_cuda_init: found 1 CUDA devices:
  Device 0: NVIDIA GeForce RTX 2060, compute capability 7.5, VMM: yes
[INFO] Wasi-nn-ggml plugin: b2636 (commit 5dc9dd71)
[INFO] LlamaEdge API server listening on http://0.0.0.0:8080

如果一键执行报错, 也可以分步执行, 具体见原文.

🎉🎉🎉至此, Llama3 已经成功在本地运行.🎉🎉🎉

我们可以通过: http://localhost:8080 进行访问.

效果

Llama3 通过 API Server 访问

从上图可以看到, Llama3 已经成功在本地运行. 使用上和在线的 ChatGPT 一样.

另外, 在运行过程中, 通过 Windows 上的 Task Manager 可以看到, GPU 的负载已经达到 100%:

"一句话, 让GPU跑满100%" 😂😂😂

另外, 我们可以结合其提供的兼容 OpenAI 的 API, 实现更多丰富场景:

直接调用 API

curl -X POST http://localhost:8080/v1/chat/completions \
  -H 'accept:application/json' \
  -H 'Content-Type: application/json' \
  -d '{"messages":[{"role":"system", "content": "You are a sentient, superintelligent artificial general intelligence, here to teach and assist me."}, {"role":"user", "content": "Write a short story about Goku discovering kirby has teamed up with Majin Buu to destroy the world."}], "model":"Llama-3-8B"}'

和各类支持设置 AI API Server 地址的客户端联动, 如:
- Obsidian Text Generator Plugin
- 沉浸式翻译
- 各类 ChatGPT 相关的浏览器插件等
- 各类 ChatGPT 桌面应用等

实现丰富的 AI 场景应用.

总结

本文介绍了在 Windows 上快速运行本地 AI 大语言模型 - Llama3 的实战步骤, 通过利用: WSL + WasmEdge + LlamaEdge 快速实现.
易上手, 门槛低.

如何系统的去学习大模型LLM ？

大模型时代，火爆出圈的LLM大模型让程序员们开始重新评估自己的本领。 “AI会取代那些行业？”“谁的饭碗又将不保了？”等问题热议不断。

事实上，抢你饭碗的不是AI，而是会利用AI的人。

继科大讯飞、阿里、华为等巨头公司发布AI产品后，很多中小企业也陆续进场！超高年薪，挖掘AI大模型人才！ 如今大厂老板们，也更倾向于会AI的人，普通程序员，还有应对的机会吗？

与其焦虑……

不如成为「掌握AI工具的技术人」，毕竟AI时代，谁先尝试，谁就能占得先机！

但是LLM相关的内容很多，现在网上的老课程老教材关于LLM又太少。所以现在小白入门就只能靠自学，学习成本和门槛很高。

针对所有自学遇到困难的同学们，我帮大家系统梳理大模型学习脉络，将这份 LLM大模型资料 分享出来：包括LLM大模型书籍、640套大模型行业报告、LLM大模型学习视频、LLM大模型学习路线、开源大模型学习教程等, 😝有需要的小伙伴，可以 扫描下方二维码领取🆓↓↓↓

👉CSDN大礼包🎁：全网最全《LLM大模型入门+进阶学习资源包》免费分享（安全链接，放心点击）👈

一、LLM大模型经典书籍

AI大模型已经成为了当今科技领域的一大热点，那以下这些大模型书籍就是非常不错的学习资源。

在这里插入图片描述

二、640套LLM大模型报告合集

这套包含640份报告的合集，涵盖了大模型的理论研究、技术实现、行业应用等多个方面。无论您是科研人员、工程师，还是对AI大模型感兴趣的爱好者，这套报告合集都将为您提供宝贵的信息和启示。(几乎涵盖所有行业)

在这里插入图片描述

三、LLM大模型系列视频教程

在这里插入图片描述

四、LLM大模型开源教程（LLaLA/Meta/chatglm/chatgpt）

在这里插入图片描述

LLM大模型学习路线 ↓

阶段1：AI大模型时代的基础理解

目标：了解AI大模型的基本概念、发展历程和核心原理。
内容：
- L1.1 人工智能简述与大模型起源
- L1.2 大模型与通用人工智能
- L1.3 GPT模型的发展历程
- L1.4 模型工程
- L1.4.1 知识大模型
- L1.4.2 生产大模型
- L1.4.3 模型工程方法论
- L1.4.4 模型工程实践
- L1.5 GPT应用案例

阶段2：AI大模型API应用开发工程

目标：掌握AI大模型API的使用和开发，以及相关的编程技能。
内容：
- L2.1 API接口
- L2.1.1 OpenAI API接口
- L2.1.2 Python接口接入
- L2.1.3 BOT工具类框架
- L2.1.4 代码示例
- L2.2 Prompt框架
- L2.3 流水线工程
- L2.4 总结与展望

阶段3：AI大模型应用架构实践

目标：深入理解AI大模型的应用架构，并能够进行私有化部署。
内容：
- L3.1 Agent模型框架
- L3.2 MetaGPT
- L3.3 ChatGLM
- L3.4 LLAMA
- L3.5 其他大模型介绍

阶段4：AI大模型私有化部署

目标：掌握多种AI大模型的私有化部署，包括多模态和特定领域模型。
内容：
- L4.1 模型私有化部署概述
- L4.2 模型私有化部署的关键技术
- L4.3 模型私有化部署的实施步骤
- L4.4 模型私有化部署的应用场景

这份 LLM大模型资料 包括LLM大模型书籍、640套大模型行业报告、LLM大模型学习视频、LLM大模型学习路线、开源大模型学习教程等, 😝有需要的小伙伴，可以 扫描下方二维码领取🆓↓↓↓

👉CSDN大礼包🎁：全网最全《LLM大模型入门+进阶学习资源包》免费分享（安全链接，放心点击）👈

查看全文

http://www.kler.cn/a/394385.html

推荐一款好用的ios传输设备管理工具：AnyTrans for iOS

SpringBoot之AOP 的使用

oracle查询字段类型长度等字段信息

Unity音频导入设置

TensorFlow_T7 咖啡豆识别

JavaEE-多线程初阶(5)

自定义反序列化过程

【金猿人物展】罗格科技CTO崔鹏——数据驱动未来：从2024看2025大数据行业的变革与挑战...

shell 100例

STM32中断系统

库存管理高效秘籍

ubuntu的dns设置问题

从ROS Bag文件提取点云数据并保存为PCD格式进行处理 ros ubuntu

15分钟学 Go 第 52 天：发布与版本控制

如何将Edge标签页设置得干净好用

Docker部署Nginx

【C语言】计算3x3矩阵每行的最大值并存入第四列

解密复杂系统：理论、模型与案例(3)

Fantasy中玩家断线的检测

C语言的内存函数

大模型部署：在Windows电脑上快速运行AI大模型-Llama3

概述

📚️参考资料

技术栈

前提条件

相关概念

Llama 3

LlamaEdge

WASMEdge

NVIDIA CUDA

WSL(Windows Subsystem for Linux)

具体步骤

1. 安装 NVIDIA Windows 最新版本显卡驱动

2. 安装 WSL

3. WSL Ubuntu 安装 CUDA Toolkit

4. 使用 LlamaEdge + WasmEdge 运行本地 AI 大语言模型 - Llama3

效果

总结

如何系统的去学习大模型LLM ？

与其焦虑……

一、LLM大模型经典书籍

二、640套LLM大模型报告合集

三、LLM大模型系列视频教程

四、LLM大模型开源教程（LLaLA/Meta/chatglm/chatgpt）

LLM大模型学习路线 ↓

阶段1：AI大模型时代的基础理解

阶段2：AI大模型API应用开发工程

阶段3：AI大模型应用架构实践

阶段4：AI大模型私有化部署

相关文章：