ChatGPT token và prompt cơ bản | Checklist trước khi gọi API cho freelancer【2026】

(Cập nhật: 19 tháng 7, 2026 ) ChatGPT token prompt OpenAI API freelancer LLM ước tính chi phí
Kết luận

Trước khi gọi OpenAI API, freelancer cần nắm ba thứ: token là gì, prompt của mình dài bao nhiêu, và bill tuần khoảng bao nhiêu. ChatGPT trên web giúp brainstorm; API thì tính tiền theo input + output token. Đo prompt bằng token counter (chạy local, không upload) rồi mới viết loop — rẻ hơn học bằng hóa đơn.

Bạn nhận job: “Tích hợp ChatGPT để tóm tắt ticket hỗ trợ khách.” Client hỏi “API khoảng bao nhiêu một tháng?” — và bạn chưa biết một prompt tiếng Việt dài 800 chữ tiêu bao nhiêu token. Đây là bài dành cho freelancer / outsourcer Việt Nam lần đầu đưa LLM vào deliverable, không phải bài triết lý về AI.

Ai nên đọc

  • Freelancer nhận scope “gắn GPT vào app” nhưng chưa từng xem usage dashboard OpenAI
  • Sinh viên / junior đang prototype chatbot hỗ trợ tiếng Việt
  • Agency cần báo giá nhanh cho client trước khi ký milestone API
  • Ai hay copy cả email lịch sự vào prompt rồi bất ngờ hết context window

Token là gì — và vì sao bạn phải quan tâm trước API

Token là đơn vị nhỏ nhất mà model dùng để đọc/ghi văn bản. Không phải “một từ = một token”. Ví dụ gần đúng:

Văn bảnƯớc token
Hello~1
xin chào~3–4
Tôi cần bạn tóm tắt ticket này bằng tiếng Việt, ngắn gọn.~20–30

API OpenAI (và hầu hết LLM thương mại) tính:

  • Input tokens — system + user + tool result + lịch sử bạn gửi lại
  • Output tokens — câu trả lời model sinh ra (max_tokens chỉ là trần, không phải số cố định)

Giới hạn context window cũng tính bằng token. Prompt dài + few-shot + 20 lượt chat cũ = dễ cắt mất phần đầu hội thoại hoặc lỗi 400 context length.

Ước lượng theo ngôn ngữ (heuristic)

Cùng ~100 ký tự — token khác nhau
Ngôn ngữ / kiểu chữ Token ước tính
Tiếng Anh (ASCII) ~25–35 token
Tiếng Việt có dấu ~50–80 token (thường cao hơn Anh)
Code / JSON dày ký tự đặc biệt Dao động mạnh — luôn đo lại

Con số trên không thay tokenizer chính thức. Mục đích: bạn cảm nhận được vì sao prompt lịch sự dài bằng tiếng Việt đắt hơn bullet tiếng Anh cùng ý.


Prompt cơ bản cho freelancer (trước khi đụng SDK)

1. Tách vai trò rõ

SYSTEM:
You are a support triage assistant. Reply in Vietnamese.
Output JSON only: { "priority": "low|mid|high", "summary": "..." }

USER:
Ticket: Khách báo không nhận được OTP sau 5 phút. App Android 3.2.1. Mạng Viettel.

System = luật cố định (ngắn). User = dữ liệu thay đổi mỗi request. Đừng nhét cả luật vào mỗi user message nếu bạn sẽ gọi API hàng nghìn lần — nhân đôi token vô ích.

2. Cắt phần “lịch sự” không tạo giá trị

Xin chào anh/chị. Em là freelancer đang làm dự án. Mong anh/chị giải thích thật chi tiết
và đầy đủ mọi khía cạnh về việc tóm tắt ticket sau đây giúp em với ạ:

Summarize the ticket in ≤40 Vietnamese words. Priority: low|mid|high.
Ticket: ...

Cùng ý — token input giảm rõ. Client không trả tiền cho lời chào trong system prompt.

3. Giới hạn output

Thêm ràng buộc: JSON only, ≤3 bullets, max 80 words. Output dài = output token tăng = bill tăng, và đôi khi chậm hơn.

4. Few-shot: ít nhưng đúng

Hai ví dụ ngắn tốt hơn năm đoạn văn. Mỗi ví dụ là input token cố định bạn trả mọi request.


Checklist trước khi gọi API (in ra dán cạnh màn hình)

  1. Đã đo token của system + user mẫu + (nếu có) few-shot bằng tool ước tính
  2. Biết model sẽ dùng (gpt-5.6-luna vs gpt-5.6 khác giá một bậc)
  3. max_tokens hợp lý — không để mặc định “thoải mái” trên batch
  4. Lịch sử chat: chỉ gửi N turn gần nhất hoặc tóm tắt, không dump cả session
  5. PII: che SĐT, email, CCCD trước khi gửi nhà cung cấp API
  6. Retry / rate limit: có backoff khi 429 — tránh vòng lặp spam token
  7. Staging 10–50 request thật rồi mới scale

Mở LLM Token Counter:

  1. Dán nguyên chuỗi sẽ đưa vào messages
  2. Xem ký tự / từ / token ước tính theo model
  3. Nhân với số request/ngày × 30 để ra trần tháng (cộng ~20–30% buffer vì output)

Tool chạy trên trình duyệt, phù hợp khi prompt còn chứa dữ liệu khách chưa được phép upload lên dịch vụ lạ. Lưu ý: đây là ước tính theo ký tự — khi chốt model production, đối chiếu thêm tokenizer chính thức (ví dụ tiktoken) cho số chính xác trên hóa đơn.


Case study ngắn

Case A — Chatbot FAQ tiếng Việt cháy budget tuần đầu

Freelancer gắn GPT-5.6, system prompt 900 từ tiếng Việt + paste toàn bộ knowledge base vào mỗi request. 200 ticket/ngày → bill gấp 4 lần báo giá.

Sửa: system tiếng Anh 120 từ; knowledge đưa vào retrieval (chỉ top 3 đoạn); user giữ tiếng Việt; đo lại token ~ còn 1/5.

Case B — Prototype ChatGPT web → API “không giống”

Trên chat.openai.com câu trả lời ổn. Sang API thiếu system message và không giới hạn output → JSON dài, parse fail, gọi lại 3 lần = gấp 3 token.

Sửa: cùng một file prompt.md cho web thử và cho API; luôn đo token trước khi đổi model.


ChatGPT web vs API — chọn khi nào

Web ChatGPT vs API
Tiêu chí ChatGPT (web/app) OpenAI API
Thanh toán Gói đăng ký / free tier Theo token input+output
Tích hợp app khách Không (thủ công) Có — SDK, webhook, batch
Đo token trước Khó thấy từng request Bắt buộc nếu báo giá client
Phù hợp freelancer Nghiên cứu, viết đề xuất Deliverable trong sản phẩm

Quy tắc thực dụng: nghĩ ý trên web, ship trên API đã đo token.


Lỗi thường gặp

  • Coi 1 ký tự tiếng Việt = 1 token → ước thấp → hết context giữa chừng
  • Copy log server cả stack trace vào prompt “cho AI tự debug” → PII + token phình
  • Đổi model sang bản mạnh hơn mà không đo lại (tokenizer và giá cùng đổi)
  • Không tách system/user → khó cache / khó tối ưu sau này
  • Tin tuyệt đối heuristic trên web tool khi đối soát hóa đơn cent — cần tokenizer chính thức ở bước cuối

Tóm tắt thao tác 5 phút

  1. Viết prompt mẫu thật (đúng ngôn ngữ client sẽ dùng)
  2. Dán vào /vi/tools/token-counter/
  3. Ước chi phí tuần + thêm buffer output
  4. Rút gọn system, giới hạn output, bỏ few-shot thừa
  5. Đo lại → mới viết code gọi API

Liên kết liên quan

  • LLM Token Counter — ước token và chi phí đầu vào trên trình duyệt
  • Danh sách công cụ
  • Bài liên quan góc brand/HEX màu: chỉ mở khi làm UI — đừng trộn với tối ưu prompt