Claude

Claude API tiếng Việt: lấy API key, bảng giá token & gọi API cơ bản

H Hoàng Trọng Thuật 18 phút đọc

Claude API là cách gọi thẳng model Claude từ code của bạn qua HTTP, thay vì ngồi chat trong app. Bạn tạo tài khoản ở Claude Console, sinh một API key, gửi request tới https://api.anthropic.com/v1/messages và trả tiền theo số token thực dùng. Không có phí thuê bao, không có gói tối thiểu — dùng bao nhiêu trả bấy nhiêu.

TL;DR — những con số cần nhớ

  • Endpoint chính: POST https://api.anthropic.com/v1/messages, bắt buộc có header anthropic-version và content-type: application/json.
  • Giá token (mỗi 1 triệu token, input/output): Claude Haiku 4.5 là 1/5 USD · Claude Sonnet 5 là 2/10 USD · Claude Opus 5 là 5/25 USD (bảng giá chính thức của Anthropic, truy cập 10/09/2026).
  • Batch API giảm 50% cả input lẫn output — hợp với việc chạy hàng loạt không cần trả lời ngay.
  • Prompt caching đọc lại cache chỉ tốn 0,1 lần giá input gốc, và không tính vào hạn mức token/phút.
  • Trần chi tiêu theo bậc: Start 500 USD/tháng · Build 1.000 USD · Scale 200.000 USD.
  • Web search trong API tính riêng 10 USD cho 1.000 lượt tìm; web fetch không tính phí thêm.

Claude API là gì và khác gì với gói Claude Pro?

Đây là chỗ nhiều người mới nhầm nhất. Gói Claude Pro (20 USD/tháng) và Claude API là hai đường tiền hoàn toàn tách biệt:

  • Gói thuê bao (Free / Pro / Max / Team) cho bạn dùng app Claude, Claude Code, Cowork, Design — trả tiền theo tháng, hạn mức tính theo phiên 5 giờ.
  • API cho bạn gọi model từ code của bạn — trả theo token, hạn mức tính theo request và token mỗi phút.

Trả tiền gói Pro không cho bạn quota API, và ngược lại. Nếu bạn đang định nối Claude vào một workflow tự động, một chatbot hay một script xử lý dữ liệu thì thứ bạn cần là API, không phải gói thuê bao.

Theo tài liệu chính thức, Claude API là một REST API tại https://api.anthropic.com, gồm các nhóm: Messages API (hội thoại), Message Batches API (chạy hàng loạt, rẻ hơn 50%), Token Counting API (đếm token trước khi gửi), Models API (liệt kê model), Files API (tải file lên dùng lại nhiều lần) và Skills API.

Cách tạo tài khoản và lấy Claude API key

Quy trình 5 bước, làm một lần là xong:

  1. Tạo tài khoản Claude Console tại platform.claude.com. Đây là tài khoản riêng cho lập trình viên, khác với tài khoản claude.ai bạn dùng để chat.
  2. Nạp một khoản credit nhỏ trước. API tính theo dùng thực nên không cần nạp nhiều; theo tài liệu, người dùng mới còn được một lượng credit miễn phí nhỏ để thử.
  3. Thử ở Playground trước khi viết code. Console có sẵn playground ngay trên trình duyệt — gõ prompt, xem kết quả, xem luôn số token tiêu tốn. Bước này tiết kiệm rất nhiều thời gian debug về sau.
  4. Sinh API key ở mục Account Settings → API keys. Khi tạo, bạn chọn loại key và hạn dùng của key — nên đặt hạn thay vì để vĩnh viễn.
  5. Tách môi trường bằng Workspace. Console cho phép tạo nhiều workspace để tách dev / staging / production, và đặt trần chi tiêu riêng cho từng workspace. Đây là cách chặn tai nạn “một script lỗi ngốn hết ngân sách tháng”.

Về xác thực, tài liệu liệt kê hai cách gửi key:

  • Authorization: Bearer <api-key> — cách khuyến nghị hiện tại.
  • x-api-key: <api-key> — cách cũ, vẫn được hỗ trợ như phương án dự phòng.

Nếu bạn dùng SDK chính thức (Python, TypeScript, C#, Go, Java, PHP, Ruby) thì SDK tự gắn header xác thực, header phiên bản và content-type giúp bạn.

Bảng giá token Claude API 2026

Giá tính theo triệu token (MTok), input và output tính riêng — output luôn đắt gấp 5 lần input trên mọi model dòng chính:

Model Input (1M token) Output (1M token) Ghi cache 5 phút Đọc cache Hợp với việc gì
Claude Haiku 4.5 1 USD 5 USD 1,25 USD 0,10 USD Phân loại, trích xuất, tác vụ số lượng lớn
Claude Sonnet 5 2 USD 10 USD 2,50 USD 0,20 USD Phần lớn workload chạy thật
Claude Sonnet 4.6 3 USD 15 USD 3,75 USD 0,30 USD Bản cũ hơn, chỉ dùng nếu đã gắn chặt
Claude Opus 5 5 USD 25 USD 6,25 USD 0,50 USD Suy luận phức tạp, agent nhiều bước
Claude Fable 5.1 10 USD 50 USD 12,50 USD 0,25 USD Nhóm model chuyên biệt, giá cao nhất

Ba chi tiết trong bảng giá dễ bị bỏ sót nhưng ảnh hưởng thẳng tới hóa đơn:

  • Sonnet 5 giữ giá 2/10 USD vĩnh viễn. Mức này ban đầu công bố là giá giới thiệu đến 31/08/2026, nhưng Anthropic đã xác nhận đợt tăng lên 3/15 USD dự kiến ngày 01/09/2026 không diễn ra. Nếu bạn đang tính chi phí theo con số 3/15 USD thì bạn đang tính dư 50%.
  • Model từ Claude 4.7 trở lên dùng tokenizer mới sinh ra nhiều hơn khoảng 30% token cho cùng một đoạn văn bản. Cùng một prompt, chạy trên model mới sẽ đếm ra nhiều token hơn model cũ — mức tăng cụ thể tùy nội dung.
  • Cửa sổ ngữ cảnh 1 triệu token tính giá chuẩn với Claude 4.6 trở lên. Một request 900k token có đơn giá mỗi token bằng đúng request 9k token, không có phụ phí ngữ cảnh dài.

Chi phí của công cụ đi kèm

Ngoài token, một số công cụ phía server tính tiền riêng:

  • Web search: 10 USD cho mỗi 1.000 lượt tìm, cộng thêm token của nội dung tìm được. Mỗi lượt tìm tính là một lần dùng bất kể trả về bao nhiêu kết quả; nếu lỗi thì không bị tính.
  • Web fetch: không có phụ phí, chỉ trả token của nội dung tải về. Tài liệu ước lượng một trang web 10 kB tốn khoảng 2.500 token, một trang tài liệu lớn 100 kB khoảng 25.000 token.
  • Code execution: mỗi tổ chức có 1.550 giờ miễn phí mỗi tháng, vượt thì 0,05 USD/giờ/container. Nếu dùng kèm web search hoặc web fetch thì code execution miễn phí hoàn toàn.

Gọi Claude API lần đầu bằng curl và Python

Đây là request tối thiểu chạy được, không cần cài gì ngoài curl:

curl https://api.anthropic.com/v1/messages \
  -H "Authorization: Bearer $ANTHROPIC_API_KEY" \
  -H "anthropic-version: 2023-06-01" \
  -H "content-type: application/json" \
  -d '{
    "model": "claude-sonnet-5",
    "max_tokens": 512,
    "messages": [
      {"role": "user", "content": "Tom tat doan van sau trong 3 gach dau dong."}
    ]
  }'

Bản Python dùng SDK chính thức:

import os
from anthropic import Anthropic

client = Anthropic(api_key=os.environ["ANTHROPIC_API_KEY"])

resp = client.messages.create(
    model="claude-sonnet-5",
    max_tokens=512,
    system="Bạn là biên tập viên tiếng Việt. Trả lời ngắn gọn, không mở bài.",
    messages=[{"role": "user", "content": "Tóm tắt đoạn văn sau trong 3 gạch đầu dòng."}],
)

print(resp.content[0].text)
print(resp.usage)  # số token input/output thực dùng

Ba lưu ý khi chạy lần đầu:

  • Đừng nhét API key vào code. Đọc từ biến môi trường. Key lộ trong repo là lỗi tốn tiền phổ biến nhất.
  • max_tokens không ảnh hưởng tới hạn mức OTPM. Tài liệu nói rõ hạn mức output token/phút được tính theo số token thực sinh ra, nên đặt max_tokens cao không bị phạt gì về rate limit. Nó vẫn là trần an toàn để tránh câu trả lời dài bất thường.
  • Luôn đọc resp.usage. Đây là nguồn sự thật duy nhất về số token bạn vừa tiêu — quan trọng hơn mọi ước lượng.

Kiểm soát chi phí: 5 đòn bẩy theo thứ tự hiệu quả

  1. Chọn đúng model. Đòn bẩy lớn nhất và rẻ nhất để làm. Haiku 4.5 rẻ hơn Opus 5 đúng 5 lần ở cả input lẫn output. Rất nhiều bước trong một pipeline (phân loại, tách trường, kiểm tra định dạng) không cần model mạnh nhất. Anthropic khuyến nghị thẳng: Haiku cho việc đơn giản, Sonnet cho phần lớn workload chạy thật, Opus cho suy luận phức tạp nhất.
  2. Bật prompt caching cho phần lặp lại. Đọc cache tốn 0,1 lần giá input gốc. Với cache 5 phút (ghi 1,25 lần giá), bạn hoà vốn ngay sau một lần đọc lại; với cache 1 giờ (ghi 2 lần giá) thì hoà sau hai lần. Cache những thứ không đổi: system prompt, định nghĩa tool, tài liệu ngữ cảnh lớn, lịch sử hội thoại.
  3. Đẩy việc không gấp sang Batch API. Giảm 50% cả input lẫn output. Sonnet 5 chạy batch còn 1/5 USD mỗi triệu token. Ưu đãi batch và prompt caching cộng dồn được với nhau.
  4. Đếm token trước khi gửi. Dùng POST /v1/messages/count_tokens để biết chính xác chi phí trước khi bấm nút — đặc biệt cần khi bạn gửi tài liệu dài do người dùng tải lên.
  5. Đặt trần chi tiêu thủ công. Trong Console, mục Billing cho bạn tự đặt mức trần thấp hơn trần của bậc. Chạm trần tự đặt sẽ trả về lỗi 400 chứ không âm thầm tiêu tiếp.

Góc riêng cho tiếng Việt: đừng ước lượng token bằng công thức tiếng Anh

Tài liệu Anthropic đưa ước lượng “1 token ≈ 4 ký tự ≈ 0,75 từ” nhưng ghi rõ ngay sau đó: số đếm chính xác thay đổi theo ngôn ngữ và loại nội dung. Tiếng Việt có dấu, và ký tự có dấu thường tốn nhiều byte hơn ký tự Latin không dấu — nên áp thẳng công thức tiếng Anh vào một pipeline xử lý nội dung tiếng Việt là cách chắc chắn để dự toán sai.

Cách làm đúng: lấy 20-30 mẫu nội dung thật của bạn (bài viết, email khách hàng, mô tả sản phẩm — tùy bài toán), chạy qua Token Counting API, tính trung bình token mỗi mẫu. Con số đó mới là cơ sở để nhân lên thành dự toán tháng. Mất 10 phút, và nó chặn được sai số hàng chục phần trăm trong bảng dự toán.

Rate limit và bậc sử dụng: khi nào bạn bị chặn

Có hai loại giới hạn khác nhau, đừng nhầm:

  • Trần chi tiêu (spend limit) — tổng tiền tối đa mỗi tháng theo lịch. Start 500 USD, Build 1.000 USD, Scale 200.000 USD. Chạm trần thì API dừng đến 00:00 UTC ngày đầu tháng sau, trừ khi bạn xin nâng bậc sớm hơn.
  • Rate limit — đo bằng request/phút (RPM), input token/phút (ITPM) và output token/phút (OTPM), tính riêng cho từng model.
Bậc Trần chi/tháng RPM (Sonnet 5 / Opus 5) ITPM OTPM
Start 500 USD 1.000 2.000.000 400.000
Build 1.000 USD 5.000 5.000.000 1.000.000
Scale 200.000 USD 10.000 10.000.000 2.000.000

Điểm hay nhất trong cơ chế rate limit, và cũng là điểm ít người khai thác: token đọc từ cache không tính vào ITPM (trừ Claude Haiku 3.5 đã ngừng phát hành). Tài liệu đưa ví dụ cụ thể: với hạn mức 2 triệu ITPM và tỷ lệ trúng cache 80%, bạn xử lý được tới 10 triệu token input mỗi phút. Nghĩa là prompt caching vừa cắt tiền vừa nới thông lượng — làm một lần được hai lợi ích.

Vài chi tiết kỹ thuật đáng ghi lại:

  • Hệ thống dùng thuật toán token bucket — hạn mức được bồi liên tục chứ không reset theo mốc cố định. Vì thế một burst ngắn vẫn có thể vượt hạn mức dù trung bình phút vẫn dưới ngưỡng.
  • Lỗi 429 do rate limit có header retry-after. Lỗi 429 do chạm trần chi tiêu thì không có header đó, và trường error.details.error_code trả về enforced_spend_limit_reached — dùng dấu hiệu này để phân biệt hai trường hợp trong code retry của bạn.
  • Giới hạn kích thước request: Messages và Token Counting 32 MB, Message Batches 256 MB, Files 500 MB. Vượt thì nhận lỗi 413 request_too_large.

Câu hỏi thường gặp

Claude API có bản miễn phí không?
Không có gói miễn phí thường trực. Tài liệu cho biết tài khoản mới nhận một lượng credit miễn phí nhỏ để thử API; hết credit thì phải nạp.

Mình đã trả tiền Claude Pro, có được dùng API không?
Không. Gói thuê bao và API là hai hệ thống tính tiền tách biệt. Muốn gọi API thì tạo tài khoản Console và nạp credit riêng.

Model nào rẻ nhất?
Trong các model đang phát hành, Claude Haiku 4.5 rẻ nhất: 1 USD input và 5 USD output mỗi triệu token. Chạy qua Batch API còn 0,50 và 2,50 USD.

Nên dùng x-api-key hay Authorization: Bearer?
Dùng Authorization: Bearer. Tài liệu ghi x-api-key là phương án dự phòng cũ, vẫn hoạt động nhưng không còn là cách khuyến nghị.

Nối Claude API vào n8n được không?
Được, qua node HTTP Request gọi thẳng endpoint Messages. Bài tích hợp Claude API vào n8n đi sâu phần parse JSON bằng structured outputs, retry lỗi 429/529 và tính chi phí token từng execution; phần nối cơ bản xem cách nối OpenAI và Claude vào n8n. Còn muốn so gói thuê bao với API, đọc Claude Code có miễn phí không? Các gói giá.

Làm sao biết mình sắp chạm rate limit?
Mỗi response đều trả về nhóm header anthropic-ratelimit-* cho biết hạn mức, phần còn lại và thời điểm được bồi đầy. Console cũng có biểu đồ rate limit riêng cho input và output token, kèm tỷ lệ trúng cache.

Bậc Start có đủ cho một sản phẩm nhỏ không?
Với phần lớn ứng dụng giai đoạn đầu thì đủ: 1.000 request/phút và 2 triệu token input/phút là rất nhiều. Ràng buộc thực tế thường là trần chi 500 USD/tháng chứ không phải rate limit.

Có cần đặt anthropic-version không?
Có, đây là header bắt buộc (ví dụ 2023-06-01). Nếu dùng SDK chính thức thì SDK tự gắn.

Kết luận

Bắt đầu với Claude API chỉ mất khoảng 15 phút: tạo tài khoản Console, thử ở playground, sinh key có hạn dùng, chạy một request curl. Phần khó nằm ở sau đó — kiểm soát chi phí. Ba việc đáng làm ngay từ ngày đầu: chọn model theo độ khó của từng bước thay vì dùng model mạnh nhất cho mọi thứ, bật prompt caching cho phần ngữ cảnh lặp lại, và đo token trên chính nội dung tiếng Việt của bạn thay vì tin vào công thức ước lượng tiếng Anh.

Nếu bạn muốn dùng Claude để lập trình mà không phải tự viết vòng lặp agent, đọc bài trụ Claude Code là gì — hướng dẫn A–Z; còn nếu đang phân vân giữa các công cụ thì bài Claude Code vs Cursor vs GitHub Copilot so sánh cả ba mô hình tính tiền. Muốn nối Claude vào hệ thống ngoài mà không viết code, xem thêm cách kết nối Claude qua MCP.

Nguồn tham khảo

H

Hoàng Trọng Thuật

Nhà sáng tạo nội dung về AI, YouTube Automation và Affiliate Marketing. Chia sẻ kiến thức thực chiến từ kinh nghiệm vận hành thật.