TopGit
Đánh giá repo GitHub

LLMs-from-scratch: Build LLM PyTorch Từng Bước

rasbt/LLMs-from-scratch
LTopGit review image for rasbt/LLMs-from-scratch
Review by Topgit.dev for rasbt/LLMs-from-scratch, with GitHub repository stats and README context.
Nhận định nhanh

Build a Large Language Model (From Scratch) là repo mã nguồn đi kèm sách cùng tên của Sebastian Raschka, hướng dẫn huấn luyện trước và tinh chỉnh một mô hình kiểu GPT theo từng chương bằng PyTorch. Hãy chọn nó nếu bạn muốn tự viết từng lớp transformer và hiểu vì sao nó hoạt động. Bỏ qua nếu bạn cần một hệ thống LLM sẵn sàng chạy sản phẩm, vì repo này được xây cho việc học, không phải để triển khai.

Sao
★ 105.3k
Fork
⑂ 16.1k
Người đóng góp
👥 68
Ngôn ngữ
Jupyter Notebook
Giấy phép
Xem trong repo
Chủ đề
AI Tools
Cập nhật
Sep 2026
Trang chủ
GitHub

Đây là gì?

Build a Large Language Model (From Scratch) là repository mã nguồn chính thức trên GitHub cho cuốn sách cùng tên của Sebastian Raschka do Manning xuất bản, ISBN 9781633437166. Repo chứa các notebook Jupyter và script Python xây dựng một mô hình kiểu GPT, đi từ xử lý văn bản thô qua huấn luyện trước và hai kiểu tinh chỉnh, chia thành bảy chương đánh số cùng năm phụ lục.

Ai Được Lợi Từ Tài Nguyên Học Tập Này

Những nhà phát triển đã vững Python và muốn hiểu cơ chế bên trong của transformer thay vì chỉ import một thư viện sẽ khai thác được nhiều nhất từ repo này, vì README liệt kê nền tảng Python vững chắc là điều kiện tiên quyết chính, còn kinh nghiệm về mạng nơ-ron sâu chỉ là điểm cộng chứ không bắt buộc. Phụ lục A cung cấp một bài nhập môn PyTorch xây từ đầu cho người mới với framework này, nên bạn không cần biết PyTorch trước, chỉ cần kiên nhẫn đọc code tensor từng dòng. Bỏ qua nếu bạn muốn một API mô hình dựng sẵn thay vì tự xây theo từng chương.

Các Chủ Đề Triển Khai LLM Toàn Diện

  • Chương 2 xử lý dữ liệu văn bản: tokenization, byte pair encoding, và xây dựng data loader cho huấn luyện.
  • Chương 3 tự viết cơ chế attention từ đầu, bao gồm một cài đặt multi-head attention.
  • Chương 4 xây dựng đầy đủ kiến trúc mô hình kiểu GPT bằng PyTorch, kèm một script gpt.py độc lập.
  • Chương 5 huấn luyện trước mô hình trên văn bản không gán nhãn, kèm tài liệu bổ sung về cách nạp trọng số mô hình đã huấn luyện sẵn và chuyển mô hình GPT sang kiến trúc Llama.
  • Chương 6 tinh chỉnh mô hình cho phân loại văn bản; Chương 7 tinh chỉnh để mô hình làm theo hướng dẫn, kèm một notebook DPO (Direct Preference Optimization) để căn chỉnh mô hình.
  • Phụ lục E trình bày LoRA, một phương pháp tinh chỉnh tiết kiệm tham số, còn Phụ lục D bổ sung các kỹ thuật như lịch trình learning rate cho vòng lặp huấn luyện.
  • Các notebook bổ sung nằm ngoài các chương đánh số cũng xây lại những kiến trúc mới hơn từ đầu, gồm Qwen3, Gemma 3, Olmo 3, và các biến thể Llama 3.2, cùng các cơ chế như KV caching và grouped-query attention.
Số sao GitHub của repo này thay đổi thế nào theo thời gian. Nguồn: star-history.com.Xem lịch sử sao

Điểm mạnh

  • Cấu trúc theo từng chương gắn liền với một cuốn sách đã xuất bản qua Manning, nên đoạn code có một tài liệu tham chiếu cố định và một khoá video đi kèm, chứ không phải một mớ script rời rạc.
  • Tự xây dựng attention, kiến trúc GPT, huấn luyện trước, và hai cách tinh chỉnh từ đầu buộc người học hiểu những gì các thư viện có sẵn thường che giấu.
  • Các chương chính chạy được trên máy tính xách tay thông thường và tự động dùng GPU nếu có, nên không cần một cụm máy chủ mới theo học được.
  • Tài liệu bổ sung cập nhật các kiến trúc mở mới hơn: các bản dựng lại Qwen3, Gemma 3, Olmo 3, và Llama 3.2 nằm cạnh bảy chương chính.
  • Mỗi chương có bài tập kèm lời giải tóm tắt trong Phụ lục C ngay trong repo, cộng thêm một tài liệu PDF tự kiểm tra 170 trang tuỳ chọn có thể tải từ Manning để luyện thêm.

Phạm Vi Và Quy Định Đóng Góp

  • Sebastian Raschka nói rõ đoạn code tồn tại để dạy cơ chế hoạt động của LLM, tạo ra một mô hình gọn nhẹ phục vụ mục đích học tập, không phải mô hình được tối ưu cho việc chạy sản phẩm.
  • Người duy trì dự án không nhận pull request mở rộng hay thay đổi code của các chương chính, vì lệch khỏi nội dung sách in sẽ phá vỡ mối liên kết một-một mà độc giả dựa vào.
  • Giấy phép không được nêu rõ ở đây. Hãy kiểm tra điều khoản chính xác trên trang repository GitHub trước khi tái sử dụng bất kỳ đoạn code nào.
  • Một phần tài liệu học nằm ngoài repo: tài liệu PDF tự kiểm tra 170 trang và một phần nội dung sách được phân phối qua Manning, không đi kèm trong code.

Tài Nguyên Học Tập Liên Quan

transformers — thư viện của Hugging Face nếu bạn muốn dùng mô hình đã huấn luyện sẵn và pipeline dựng sẵn thay vì tự xây lớp attention.AI-For-Beginners — chương trình học AI tổng quát hơn của Microsoft nếu bạn muốn bắt đầu trước khi đi sâu vào transformer và LLM.reasoning-from-scratch — repo tiếp nối của chính Raschka, được README mô tả là một cuốn sách độc lập nhưng đóng vai trò phần tiếp theo, xây dựng các kỹ thuật suy luận như inference-time scaling và reinforcement learning trên nền một mô hình đã huấn luyện sẵn.nanoGPT — script huấn luyện GPT tối giản của Andrej Karpathy, một lựa chọn ngắn gọn và ít cấu trúc hơn cho ai không cần hướng dẫn theo từng chương.

Câu Hỏi Thường Gặp

Điều kiện cần có để dùng repository LLMs-from-scratch là gì?

Build a Large Language Model (From Scratch) yêu cầu nền tảng Python vững chắc làm điều kiện tiên quyết chính. README nói kinh nghiệm với mạng nơ-ron sâu sẽ có ích nhưng không bắt buộc, và việc quen thuộc với PyTorch cũng chỉ là điểm cộng vì Phụ lục A đã giới thiệu các kiến thức PyTorch cơ bản.

Nên chạy code LLMs-from-scratch trên phần cứng nào?

Các chương chính của Build a Large Language Model (From Scratch) được thiết kế để chạy trên máy tính xách tay thông thường trong thời gian hợp lý, không cần phần cứng chuyên dụng. Theo README, code tự động dùng GPU nếu máy có sẵn.

Code của LLMs-from-scratch có phù hợp để xây LLM chạy sản phẩm không?

Build a Large Language Model (From Scratch) được xây để dạy cơ chế hoạt động của một mô hình kiểu GPT, không phải để đưa cho bạn một hệ thống sẵn sàng chạy sản phẩm. README mô tả mô hình tạo ra là gọn nhẹ, phục vụ mục đích học tập, nên hãy xem đây là một dự án học tập chứ không phải một hệ thống LLM sẵn sàng triển khai.

Repository này liên quan thế nào đến cuốn sách 'Build a Large Language Model (From Scratch)'?

Repository rasbt/LLMs-from-scratch là mã nguồn chính thức đi kèm cuốn sách Build a Large Language Model (From Scratch) của Sebastian Raschka do Manning xuất bản, ISBN 9781633437166. Mỗi notebook và script tương ứng với một chương hoặc phụ lục trong sách in, và một khoá video riêng dài 17 giờ 15 phút bám theo đúng cấu trúc đó.

Tôi có thể đóng góp code hoặc gửi pull request cho các chương chính không?

Pull request mở rộng hay thay đổi code của các chương chính không được chấp nhận cho Build a Large Language Model (From Scratch), vì lệch khỏi nội dung sách in sẽ phá vỡ mối liên kết giữa hai bên. README vẫn hoan nghênh góp ý và câu hỏi chung qua GitHub Discussions hoặc Manning Forum.

Giấy phép của code trong repository này là gì?

Giấy phép không được nêu rõ trong các dữ kiện có sẵn cho Build a Large Language Model (From Scratch), nên hãy kiểm tra điều khoản chính xác trên trang repository GitHub trước khi tái sử dụng code ở nơi khác.

Trường hợp sử dụng tốt nhất

  • Học Build a Large Language Model (From Scratch) theo từng chương song song với sách hoặc khoá video đi kèm, chạy từng notebook khi đọc.
  • Dùng repo như một cách ôn lại PyTorch thực hành: code tensor và vòng lặp huấn luyện tự viết ở Phụ lục A cũng đóng vai trò một bài nhập môn PyTorch độc lập.
  • Mở rộng các notebook bổ sung để thử nghiệm những kiến trúc mới hơn mà README liệt kê để so sánh trực tiếp, như Qwen3, Gemma 3, và Llama 3.2 được xây lại từ đầu.
  • Tự kiểm tra mức hiểu bài bằng khoảng 30 câu hỏi mỗi chương trong tài liệu PDF tự kiểm tra dài 170 trang mà Manning phát hành miễn phí kèm sách.

Repo liên quan

Nguồn & ghi công

Thông tin và trích dẫn lấy từ repository GitHub rasbt/LLMs-from-scratch và README của nó.

Dữ liệu GitHub · đồng bộ lần cuối 14 thg 8, 2026Đánh giá bởi Henry
Về TopGit

Muốn nghe thêm một ý kiến về LLMs-from-scratch?

Hỏi một AI đọc được trang này — một cú bấm là có ngay nhận định về LLMs-from-scratch.

GitHub