MiniMax M3
Tiên phong về Lập trình & Tác tử. Ngữ cảnh 1M MSA. Đa phương thức bản địa
Mô hình mã nguồn mở đầu tiên với ba khả năng tiên phong.
Điểm chuẩn Hiệu suất
M3 đạt hiệu suất hàng đầu trên các điểm chuẩn về lập trình và tác tử, với khả năng phân rã nhiệm vụ tự động, gọi công cụ và suy luận đa bước — cung cấp nền tảng đáng tin cậy cho các trợ lý lập trình AI và quy trình làm việc tự động.
Được hỗ trợ bởi kiến trúc MiniMax Sparse Attention (MSA) độc quyền, M3 API hỗ trợ cửa sổ ngữ cảnh lên đến 1M token với mức tối thiểu được đảm bảo là 512K token. Ngữ cảnh 1M là nền tảng hạ tầng cho các tác vụ Agent tầm xa, lập trình tầm xa và hiểu video dài.
Một mô hình đa phương thức vốn có. Toàn bộ pipeline dữ liệu đã được xây dựng lại để mở rộng quy mô dữ liệu tiền huấn luyện, với việc huấn luyện đa phương thức từ bước số không, đạt được sự liên kết sâu giữa các không gian ngữ nghĩa văn bản và hình ảnh. Đa phương thức là năng lực cốt lõi vốn có, không phải tính năng bổ sung hời hợt.
Trên BrowseComp, M3 đạt 83.5, vượt qua Opus 4.7 (79.3), thể hiện khả năng duyệt web và truy xuất thông tin tự động mạnh mẽ.
Cho đến nay, chỉ một số ít mô hình mã nguồn đóng có thể đồng thời đạt được năng lực lập trình tiên tiến, ngữ cảnh hàng triệu token và đa phương thức. M3 là mô hình đầu tiên mang lại năng lực tiên tiến toàn diện đến thế giới mã nguồn mở.
Tiêu chuẩn đánh giá
Khả năng về Lập trình và Agent là những cải tiến then chốt trong M3. Trong các bài benchmark quốc tế uy tín trải rộng từ kỹ thuật phần mềm, thực thi terminal và nhiều hơn nữa, M3 đạt được hiệu năng dẫn đầu thế giới.

Biểu tượng Giá trị

Tái tạo Bài báo: Tự chủ tái tạo bài báo ICLR trong 12 giờ
Tái tạo Bài báo: Tự chủ tái tạo bài báo ICLR trong 12 giờ
Chúng tôi đã giao cho M3 nhiệm vụ tự tái tạo một bài báo Xuất sắc của ICLR 2025 — Learning Dynamics of LLM Finetuning. M3 đã chạy liên tục trong gần 12 giờ, tự chủ tạo ra 18 commit và 23 hình thí nghiệm, tái tạo thành công các thí nghiệm cốt lõi. Khả năng đa phương thức đã phân tích các biểu đồ và công thức từ bài báo, ngữ cảnh dài vừa vặn bài báo + mã nguồn + nhật ký thí nghiệm trong một cửa sổ duy nhất, và khả năng về lập trình + tác nhân thúc đẩy việc thực thi trong phạm vi dài.
Tối ưu hóa Kernel CUDA: 147 lần lặp, tăng tốc 9,4×
FP8 GEMM là một trong những phép toán đòi hỏi nhiều tính toán nhất và khó tối ưu nhất trong suy luận LLM. Chúng tôi đã yêu cầu M3 tối ưu kernel này trên GPU NVIDIA Hopper, chỉ bắt đầu với một mô tả nhiệm vụ và một khung Triton không thể chạy được. Trong khoảng 24 giờ, M3 đã hoàn thành 147 lần nộp benchmark và 1.959 lượt gọi công cụ, đẩy mức sử dụng đỉnh phần cứng từ 7,6% lên 71,3% — tăng tốc 9,4× mà không có sự can thiệp của con người.

Tối ưu hóa Kernel CUDA: 147 lần lặp, tăng tốc 9,4×

PostTrainBench: M3 Tự Huấn Luyện Mô Hình
PostTrainBench: M3 Tự Huấn Luyện Mô Hình
Chúng tôi đã cung cấp cho M3 bốn mô hình nền tảng chỉ dành cho tiền huấn luyện và yêu cầu nó tự động hoàn thành toàn bộ quy trình — tổng hợp dữ liệu, huấn luyện, đánh giá và lặp lại — trong vòng 12 giờ, giúp các mô hình có thể thực hiện suy luận toán học, tạo mã và hỏi đáp kiến thức. Toàn bộ quá trình diễn ra mà không có sự can thiệp của con người. M3 đạt 37.1 điểm, xếp hạng #3 tổng thể, chỉ sau Opus 4.7 (42.4) và GPT-5.5 (39.3), vượt xa đáng kể so với tất cả các mô hình khác.

