0

RLCD là gì: phương pháp training đứng sau Jev, khác RLHF và RLVR ở đâu

Vấn đề: làm sao biết một mô hình "tự tin 64%" có thực sự đúng 64% số lần?

Hầu hết LLM, kể cả khi được prompt để trả lời kèm confidence score, đều overconfident và không nhất quán — vì không có cơ chế training nào thưởng riêng cho việc đưa ra đúng con số confidence. Đây là bài toán RLCD (Reinforcement Learning for Calibrated Decisions) được TypeSafe AI thiết kế để giải quyết cho Jev, ra mắt 15/09/2026.

Lưu ý quan trọng trước khi đọc tiếp: RLCD không phải một kỹ thuật academic đã chuẩn hóa. Đây là thuật ngữ TypeSafe tự đặt ra, mới 8 ngày tuổi tính đến thời điểm bài viết. Forbes đã chỉ ra điều này: RLCD thuộc sở hữu riêng của TypeSafe, khác với RLCR (reinforcement learning with calibration rewards) và RLVR (reinforcement learning with verifiable rewards) dù có liên quan về khái niệm.

So sánh 3 phương pháp training

Tối ưu cho Output Kiểu lỗi
RLHF Câu trả lời con người thích Text tự do Đúng ý người chấm, chưa chắc đúng thực tế
RLVR Output kiểm chứng được bằng code Text, thường ràng buộc JSON Chỉ dùng được khi "đúng" kiểm tra được bằng máy
RLCD (TypeSafe) Xác suất khớp kết quả thực tế Typed value + confidence score Có thể chọn sai một cách tự tin, trong phạm vi hợp lệ

Calibration nghĩa là gì, cụ thể

Ví dụ: đưa Jev một tin nhắn hỗ trợ, hỏi team nào nên xử lý:

Technical:    64%
Sales:        23%
Billing:      13%
Cancellation:  0%
-----------------
Confidence:   53%

Confidence 53% là tín hiệu tách biệt với phân phối xác suất phía trên — dùng để quyết định có nên tự động hành động theo kết quả này hay không. Một mô hình calibrated tốt: confidence 53% thì phải sai gần một nửa số lần ở mức đó. Một mô hình calibrated kém: trông tự tin dù không đáng tin, và không cách nào biết được chỉ từ output.

Tốc độ đến từ RLCD hay từ kiến trúc?

Đây là điểm gây tranh cãi thật sự, không phải marketing của TypeSafe. openjev — bản tái tạo mở của interface Jev, đọc thẳng logit từ Qwen3.5-4B, không hề train bằng RLCD — đo được trên một RTX 3090: 21 câu hỏi mất 1.02s khi đọc logit trực tiếp, so với 5.33s khi sinh JSON array. Tức là khoảng 5x tốc độ chỉ từ pattern interface typed-song song, không liên quan gì đến RLCD.

Trên cùng 102 test case đối chiếu với eval công bố của TypeSafe, openjev đạt 0.845 modal agreement so với 0.883 của Jev — gần nhưng không bằng.

Kết luận thực tế: kiến trúc (parallel sampling) chịu trách nhiệm chính cho tốc độ. RLCD chịu trách nhiệm cho calibration — phần "64%" thực sự nghĩa là 64%.

Những gì chưa biết

  • Kiến trúc, số tham số, dữ liệu training: chưa công bố.
  • RLCD là thuật toán mới hay biến thể của RLCR áp trên kiến trúc mới: chưa có câu trả lời công khai.
  • Diogo Almeida (founder, đồng tác giả paper InstructGPT) nói nút thắt là dữ liệu training, không phải kiến trúc — nhưng đây là tuyên bố chưa kiểm chứng độc lập.

Checklist khi đánh giá RLCD

  • RLCD không phải kỹ thuật academic chuẩn hóa — đây là thuật ngữ riêng của TypeSafe.
  • Đo lường được calibration đòi hỏi output có kiểu, có giới hạn — không áp dụng được cho text tự do.
  • Tốc độ và calibration là hai đóng góp tách biệt: đừng gộp chung khi đánh giá "RLCD có tốt không."
  • Không đưa ra kết luận chắc chắn về kiến trúc/nguyên nhân tốc độ khi chưa có thông tin chính thức.

All rights reserved

Viblo
Hãy đăng ký một tài khoản Viblo để nhận được nhiều bài viết thú vị hơn.
Đăng kí