Claude

Dùng Claude phân tích tài liệu dài 2026: đọc PDF, hợp đồng, báo cáo đúng cách (giới hạn + quy trình + chi phí)

H Hoàng Trọng Thuật 22 phút đọc

Claude phân tích tài liệu dài bằng cách biến mỗi trang PDF thành ảnh kèm văn bản trích xuất, rồi đọc cả hai để hiểu chữ, bảng và biểu đồ. Trên claude.ai bạn tải được file tới 500 MB, 20 file mỗi chat, PDF tối đa 1.000 trang; qua API là 32 MB và 600 trang mỗi yêu cầu với cửa sổ ngữ cảnh 1 triệu token. Điều kiện để kết quả dùng được: chọn đúng kênh, tách file hợp lý và luôn bắt Claude chỉ ra trang gốc cho từng kết luận.

TL;DR

  • Claude đọc PDF theo kiểu “nhìn + đọc”: mỗi trang được chuyển thành ảnh và văn bản, nên hiểu được bảng số, biểu đồ, con dấu, chữ ký (tài liệu Claude Platform, 16/09/2026).
  • Giới hạn trên claude.ai: 500 MB/file, 20 file/chat, PDF ≤ 1.000 trang; chỉ 100 trang đầu được phân tích hình ảnh, từ trang 101 chỉ đọc chữ. Projects nhận 30 MB/file, không giới hạn số file miễn vừa cửa sổ ngữ cảnh.
  • Qua API: 32 MB và 600 trang mỗi yêu cầu (100 trang nếu model chỉ có 200.000 token), mỗi trang tốn khoảng 1.500–3.000 token văn bản cộng token ảnh.
  • Claude Opus 5, Sonnet 5, Fable 5.1 và các model 4.6 trở lên có cửa sổ 1 triệu token mặc định, tính giá chuẩn; nhưng Anthropic cảnh báo độ chính xác giảm khi ngữ cảnh phình to (“context rot”).
  • Tính năng Citations trả về đúng đoạn văn gốc làm căn cứ cho từng câu trả lời — đây là công cụ chống bịa quan trọng nhất khi soát hợp đồng.
  • Chi phí API cho một hợp đồng 60 trang bằng Sonnet 5 chỉ khoảng 0,3–0,5 USD; bằng Opus 5 khoảng 0,7–1,2 USD. Gói Pro 20 USD/tháng (17 USD trả năm) đủ cho người dùng tay.

Claude đọc tài liệu dài bằng cách nào?

Không giống phần mềm OCR truyền thống chỉ bóc chữ, Claude xử lý PDF theo hai lớp song song. Theo tài liệu PDF support của Anthropic (16/09/2026), hệ thống chuyển từng trang thành một ảnh, đồng thời trích văn bản của trang đó và đưa cả hai vào cho model. Nhờ vậy Claude trả lời được những câu như “biểu đồ trang 12 nói gì”, “bảng công nợ có cột nào bất thường”, hay “hợp đồng có đóng dấu ở trang cuối không” — những thứ mà cách copy-paste text thô sẽ đánh rơi.

Với tài liệu Việt Nam, lớp “nhìn” này quan trọng hơn bạn tưởng. Hợp đồng ký tay rồi scan, báo cáo tài chính niêm yết dày đặc bảng, công văn có dấu đỏ — tất cả đều là PDF dạng ảnh hoặc bố cục phức tạp. Nhưng lớp nhìn cũng có giới hạn rõ ràng: trên claude.ai, chỉ 100 trang đầu được phân tích hình ảnh; từ trang 101 đến 1.000, Claude chỉ làm việc với văn bản trích được. Nếu file scan không có lớp text, phần sau trang 100 gần như trống với Claude.

Giới hạn file trên claude.ai, Projects và API khác nhau ra sao?

Ba kênh, ba bộ giới hạn. Bảng dưới gộp số liệu từ trung tâm trợ giúp Claude và tài liệu nền tảng, cùng ngày 16/09/2026:

Tiêu chí Chat trên claude.ai Projects (kho kiến thức) Claude API
Dung lượng tối đa 500 MB/file 30 MB/file 32 MB cho toàn bộ yêu cầu (gồm cả prompt)
Số file 20 file/chat Không giới hạn, miễn tổng nội dung vừa cửa sổ ngữ cảnh Tùy dung lượng; nên tải qua Files API và tham chiếu bằng file_id
Số trang PDF Tối đa 1.000; ≤100 trang đọc cả hình, 101–1.000 chỉ đọc chữ Chỉ trích văn bản (trừ PDF đa phương thức) 600 trang/yêu cầu; 100 trang nếu cửa sổ dưới 1 triệu token
Định dạng PDF, DOCX, CSV, TXT, HTML, ODT, RTF, EPUB, JSON, XLSX (cần bật code execution), ảnh JPEG/PNG/GIF/WebP tới 8.000×8.000 Như chat, thiên về văn bản Khối document nhận PDF và text thuần (.txt/.csv/.md); .xlsx/.docx phải đổi sang text hoặc PDF trước
Ai dùng được Mọi gói, kể cả Free Mọi gói; Free tối đa 5 project Trả theo token
Hợp với Hỏi nhanh 1–3 tài liệu Bộ tài liệu dùng đi dùng lại (quy chế, mẫu hợp đồng, báo cáo nhiều kỳ) Xử lý hàng loạt, tự động hóa, cần trích dẫn có cấu trúc

Một chi tiết hữu ích cho người dùng gói trả phí: khi kho kiến thức của Project tiến gần giới hạn cửa sổ ngữ cảnh, Claude tự bật chế độ RAG để mở rộng sức chứa — tức là chỉ lấy đoạn liên quan thay vì nhét toàn bộ vào mỗi lượt hỏi. Cách tổ chức Project và Skills để tận dụng điều này mình đã viết trong bài Claude Projects và Skills.

Cửa sổ 1 triệu token nghĩa là gì với hợp đồng và báo cáo?

Nghĩa là về lý thuyết, Claude Opus 5, Sonnet 5, Fable 5.1, Opus 4.6 hay Sonnet 4.6 có thể “cầm” cùng lúc khoảng 300–600 trang tài liệu trong một cuộc hội thoại, và 1 triệu token là mặc định — không cần bật gì, giá tính chuẩn như yêu cầu ngắn (tài liệu context windows và pricing của Anthropic, 16/09/2026). Model thế hệ cũ hơn như Sonnet 4.5 dừng ở 200.000 token, tương ứng giới hạn 100 trang mỗi yêu cầu.

Nhưng chính Anthropic viết trong tài liệu: “nhiều ngữ cảnh hơn không tự động tốt hơn”, vì khi số token tăng thì độ chính xác và khả năng nhớ lại suy giảm — hiện tượng họ gọi là context rot. Với việc soát hợp đồng, bài học thực tế là: đừng dồn 15 phụ lục vào một chat rồi hỏi một câu tổng quát. Hãy tách theo chủ đề (giá – thanh toán – phạt – chấm dứt), hỏi từng cụm, và tận dụng Projects để Claude chỉ kéo đoạn liên quan. Anthropic còn lưu ý PDF dày chữ nhỏ, nhiều bảng, nhiều hình có thể làm đầy cửa sổ trước khi chạm mốc trang; cách xử lý là chia nhỏ tài liệu và giảm độ phân giải ảnh nhúng.

Dùng Claude soát hợp đồng thế nào cho an toàn?

An toàn ở đây có hai nghĩa: không bỏ sót điều khoản và không tin nhầm câu Claude bịa. Quy trình 6 bước dưới đây mình xây từ giới hạn kỹ thuật ở trên cộng với cách hợp đồng Việt Nam thường được soạn (nhiều phụ lục, điều khoản dẫn chiếu chéo, bản scan có chữ ký):

  1. Chuẩn bị file đúng chuẩn. Gỡ mật khẩu PDF (API từ chối file mã hóa), gộp phụ lục vào cùng file hoặc đặt tên rõ ràng, giữ mỗi file dưới 100 trang nếu cần Claude đọc chữ ký, con dấu, bảng giá dạng ảnh. Bản scan không có lớp text thì chạy OCR trước rồi mới tải.
  2. Tạo Project cho từng đối tác hoặc từng loại hợp đồng. Đưa mẫu hợp đồng chuẩn của công ty, checklist điều khoản bắt buộc và chính sách nội bộ vào kho kiến thức; ghi hướng dẫn: “Luôn trích số điều, số trang; không suy đoán khi tài liệu không nói”.
  3. Trích xuất có cấu trúc trước, đánh giá sau. Yêu cầu Claude lập bảng: các bên, thời hạn, giá và lịch thanh toán, phạt vi phạm, điều kiện chấm dứt, luật áp dụng, cơ quan giải quyết tranh chấp — mỗi ô kèm số điều và trang. Bảng này là “bản đồ” để bạn tự kiểm.
  4. Hỏi rủi ro theo checklist, từng cụm một. Ví dụ: “So điều khoản phạt chậm thanh toán với mẫu chuẩn trong Project, chỉ ra khác biệt và trích nguyên văn hai bên”. Tách cụm giúp tránh context rot và cho câu trả lời sâu hơn.
  5. Đối chiếu ngược bằng trích dẫn. Qua API, bật Citations để mọi kết luận đính kèm đúng đoạn văn gốc; trên claude.ai, yêu cầu “quote nguyên văn, ghi trang” rồi mở PDF kiểm tra ít nhất các điểm ảnh hưởng tới tiền và trách nhiệm.
  6. Chuyển cho người có thẩm quyền. Xuất bảng và danh sách rủi ro cho luật sư hoặc kế toán trưởng duyệt. Claude rút thời gian đọc từ vài giờ xuống vài chục phút, nhưng chữ ký cuối cùng vẫn là của người.

Nếu bạn chưa quen viết yêu cầu nhiều lớp như bước 3 và 4, khung trong bài cấu trúc prompt 6 lớp áp dụng trực tiếp được cho việc đọc tài liệu.

Prompt nào giúp Claude tóm tắt báo cáo dài mà không bịa?

Prompt tốt cho tài liệu dài có ba thành phần: phạm vi rõ, định dạng đầu ra cố định và luật “không có thì nói không có”. Anthropic khuyến nghị đặt tài liệu trước câu hỏi trong yêu cầu; trên claude.ai điều này tương đương tải file lên rồi mới gõ prompt. Mẫu mình dùng cho báo cáo tài chính niêm yết 200–300 trang:

“Đây là báo cáo thường niên 2025 của công ty X (file đính kèm). Chỉ dựa vào file này. Lập bảng 5 chỉ số: doanh thu, lợi nhuận sau thuế, nợ vay, dòng tiền hoạt động, cổ tức — mỗi dòng ghi giá trị, đơn vị, số trang. Sau bảng, liệt kê 3 rủi ro ban lãnh đạo tự nêu, trích nguyên văn mỗi rủi ro không quá 40 từ kèm trang. Nếu chỉ số nào không xuất hiện trong file, ghi ‘không có trong tài liệu’, không ước tính.”

Hai lỗi thường gặp với tài liệu tiếng Việt: Claude gộp số của kỳ trước và kỳ này khi bảng có nhiều cột năm, và đọc nhầm dấu chấm/phẩy phân cách hàng nghìn. Cách chữa: yêu cầu ghi rõ cột năm được lấy và giữ nguyên định dạng số như trong file, rồi kiểm lại các con số đầu vào cho quyết định. Với báo cáo trên 100 trang, hãy nhớ phần bảng dạng ảnh sau trang 100 không được “nhìn” trên claude.ai — tách file hoặc dùng API nếu bảng quan trọng nằm ở cuối.

Khi nào dùng chat, Projects, Cowork hay API?

Chọn theo tần suất và khối lượng. Chat lẻ cho việc một lần với 1–3 file. Projects khi cùng bộ tài liệu được hỏi đi hỏi lại bởi nhiều người trong đội — mẫu hợp đồng, sổ tay nhân sự, báo cáo theo quý. Cowork khi tài liệu nằm rải rác trong thư mục máy tính và bạn muốn Claude tự mở, đọc, gom kết quả thành file mà không phải tải lên từng cái; cách giao việc kiểu này mình đã mô tả trong bài Claude Cowork là gì. API khi bạn xử lý hàng trăm hồ sơ mỗi tháng — hóa đơn, hợp đồng thuê, đơn bảo hiểm — và cần đầu ra JSON để đổ vào phần mềm khác.

Với API, ba tính năng làm chi phí và độ tin cậy khác hẳn: Files API để tải file một lần rồi tham chiếu bằng file_id, giữ yêu cầu nhẹ; prompt caching để lần hỏi thứ hai trở đi trên cùng tài liệu chỉ trả 10% giá đầu vào; Batch API giảm 50% cả đầu vào lẫn đầu ra cho việc không cần trả lời ngay. Hướng dẫn lấy key và gọi thử có trong bài Claude API tiếng Việt; muốn nối vào quy trình tự động, xem tích hợp Claude API vào n8n.

Phân tích tài liệu bằng Claude tốn bao nhiêu tiền?

Với người dùng tay, câu trả lời là giá gói: Free dùng được nhưng giới hạn, Pro 20 USD/tháng hoặc 17 USD nếu trả năm (200 USD trả trước), Max từ 100 USD, Team 20 USD/ghế Standard và 100 USD/ghế Premium (claude.com/pricing, 16/09/2026). Mình đã so gói Pro với hai đối thủ cùng giá trong bài Claude Pro vs ChatGPT Plus vs Google AI Pro.

Với API, hãy tính theo trang. Anthropic ước mỗi trang PDF tốn 1.500–3.000 token văn bản cộng token ảnh (tính như ảnh thường), không có phụ phí PDF. Giá mỗi triệu token (16/09/2026): Sonnet 5 là 2 USD vào / 10 USD ra; Opus 5 là 5 / 25 USD; Haiku 4.5 là 1 / 5 USD; Fable 5.1 là 10 / 50 USD. Lấy mức 2.500 token/trang cộng khoảng 1.000 token ảnh mỗi trang cho ước tính thận trọng:

Tài liệu Token đầu vào ước tính Sonnet 5 (mỗi lần hỏi, chưa cache) Opus 5 Haiku 4.5
Hợp đồng 60 trang ≈ 210.000 ≈ 0,42 USD + đầu ra ≈ 1,05 USD + đầu ra ≈ 0,21 USD + đầu ra
Báo cáo thường niên 300 trang ≈ 1.050.000 (vượt 1M — phải tách 2 phần) ≈ 2,1 USD ≈ 5,25 USD ≈ 1,05 USD
Cùng hợp đồng 60 trang, hỏi lần 2 có cache 210.000 (đọc cache) ≈ 0,04 USD ≈ 0,11 USD ≈ 0,02 USD

Đầu ra thường chỉ vài nghìn token (bảng tóm tắt 2.000 token bằng Sonnet 5 ≈ 0,02 USD) nên phần lớn chi phí nằm ở đầu vào; cache và Batch vì thế là hai đòn bẩy lớn nhất. Lưu ý thêm từ Anthropic: các model từ 4.7 trở lên dùng tokenizer mới, sinh ra nhiều hơn khoảng 30% token cho cùng một văn bản — ước tính trên nên cộng thêm biên độ đó.

Làm sao để Claude không bịa khi đọc tài liệu?

Bốn lớp phòng vệ, xếp theo mức độ chắc chắn tăng dần. Thứ nhất, ràng buộc trong prompt: “chỉ dựa vào file”, “không có thì nói không có”, “trích nguyên văn kèm trang”. Thứ hai, tách câu hỏi theo cụm để tránh ngữ cảnh quá dài — Anthropic đã nói rõ độ chính xác giảm khi token tăng. Thứ ba, hỏi ngược: sau khi Claude kết luận “hợp đồng không có điều khoản bảo mật”, yêu cầu nó tìm mọi đoạn chứa “bảo mật”, “thông tin mật”, “không tiết lộ” — nếu ra kết quả thì kết luận trước đó sai. Thứ tư, với API, bật Citations: tài liệu Anthropic mô tả tính năng này “trả về đúng đoạn văn hỗ trợ cho mỗi tuyên bố để bạn xác minh câu trả lời”, hoạt động trên mọi model đang hoạt động, dùng được với PDF và text thuần.

Và một nguyên tắc không kỹ thuật: Claude làm tốt việc tìm và so sánh, còn việc đánh giá hậu quả pháp lý ở Việt Nam — điều khoản có trái luật lao động, luật thương mại hay không — vẫn cần người có chuyên môn. Dùng AI để đọc nhanh, không dùng AI để ký thay.

Câu hỏi thường gặp

Claude đọc được file PDF bao nhiêu trang?

Trên claude.ai tối đa 1.000 trang mỗi file (100 trang đầu phân tích cả hình ảnh); qua API tối đa 600 trang mỗi yêu cầu với model 1 triệu token, 100 trang với model 200.000 token.

Claude có đọc được file Word, Excel không?

Trên claude.ai có: DOCX, XLSX (cần bật code execution), CSV, TXT, HTML, ODT, RTF, EPUB, JSON. Qua API, khối document chỉ nhận PDF và text thuần; .docx/.xlsx phải chuyển sang text hoặc PDF trước.

Bản scan hợp đồng không có chữ, Claude có đọc được không?

Được trong 100 trang đầu trên claude.ai (hoặc 600 trang qua API) vì mỗi trang được xử lý như ảnh. Ngoài phạm vi đó Claude chỉ dùng văn bản trích được, nên file scan dài cần OCR trước.

Gói Free có dùng Projects và tải PDF không?

Có. Projects mở cho mọi người dùng, Free tối đa 5 project; tải file dùng chung giới hạn 500 MB/file và 20 file/chat, chỉ khác hạn mức tin nhắn.

Nên chọn Sonnet 5 hay Opus 5 để soát hợp đồng?

Sonnet 5 (2/10 USD mỗi triệu token) đủ cho trích xuất và so sánh điều khoản; Opus 5 (5/25 USD) đáng tiền khi cần suy luận nhiều lớp trên hợp đồng phức tạp hoặc đa ngôn ngữ. Cả hai đều có cửa sổ 1 triệu token.

Tính năng Citations có trên claude.ai không?

Tài liệu Anthropic mô tả Citations ở cấp API (Messages API). Trên claude.ai, cách tương đương là yêu cầu Claude trích nguyên văn kèm số trang rồi tự đối chiếu.

Có nên đưa hợp đồng có thông tin nhạy cảm lên Claude?

Hãy che số tài khoản, CCCD, thông tin cá nhân không cần cho việc phân tích, ưu tiên gói Team/Enterprise cho dữ liệu công ty và xem lại cài đặt quyền riêng tư của tài khoản trước khi tải. Với dữ liệu buộc phải ở trong nước, API kết hợp quy trình ẩn danh hóa là lựa chọn an toàn hơn chat.

Kết luận

Claude là công cụ đọc tài liệu dài tốt nhất trong tầm giá 20 USD hiện nay nhờ cách xử lý “ảnh + chữ”, cửa sổ 1 triệu token và Citations qua API — miễn là bạn tôn trọng ba giới hạn: 100 trang đầu mới được “nhìn” trên claude.ai, ngữ cảnh càng dài càng dễ sai, và kết luận pháp lý vẫn thuộc về người. Bắt đầu với một hợp đồng thật, quy trình 6 bước ở trên và một Project riêng cho đối tác đó. Nếu bạn muốn đi xa hơn — để Claude tự đọc cả thư mục hoặc chạy hàng loạt — hãy tiếp tục với Claude Cowork và bài trụ Claude Code là gì, nơi mình gom toàn bộ cụm nội dung Claude trên VIGO Media; còn góc dùng Claude cho công việc sáng tạo có trong bài Claude cho creator.

Nguồn tham khảo

H

Hoàng Trọng Thuật

Nhà sáng tạo nội dung về AI, YouTube Automation và Affiliate Marketing. Chia sẻ kiến thức thực chiến từ kinh nghiệm vận hành thật.