// BLOG — 2026-09-23

Dữ liệu miễn phí thì ai cũng tải được: chỗ thật sự ra tiền nằm ở phía sau nó

Dữ liệu công khai miễn phí thì ai cũng tải được, nên giá trị của bản thân dữ liệu đã về gần 0: chỗ thật sự ra tiền nằm ở ba tầng phía sau — độ trễ, cổng quyết định và vận hành. Vì sao độ chính xác 91,67% vẫn có thể là chưa đủ, và người làm automation thật ra bán cái gì.

# Dữ liệu miễn phí thì ai cũng tải được: chỗ thật sự ra tiền nằm ở phía sau nó

Sáng nay mình đọc được một mẩu tin nhỏ: có người vừa ghép dữ liệu công bố công khai của giới lập pháp Mỹ với một con bot giao dịch tự động. Nghe phát là mình thấy hấp dẫn ngay — kiểu ý tưởng mà ai làm tự động hoá cũng từng nghĩ tới: lấy dữ liệu miễn phí, đút vào một cái máy, để cái máy làm phần khó.

Rồi khoảng ba giây sau, phản xạ thứ hai tới: miễn phí thì ai cũng tải được.

Câu đó không phải để dội nước lạnh. Nó là chỗ mình mất khá nhiều thời gian mới hiểu hết, và nó giải thích vì sao rất nhiều dự án tự động hoá đọc đúng dữ liệu, chạy đúng logic, mà vẫn không ra tiền.


Dữ liệu công khai không phải lợi thế. Nó là một cái lịch.

Chuyện các nghị sĩ Mỹ phải công bố giao dịch chứng khoán của mình là có thật, và dữ liệu đó công khai thật — ai có mạng cũng tải được, không cần trả một đồng. Nghe như mỏ vàng. Nhưng đọc kỹ cơ chế thì nó là thứ khác hẳn.

Luật yêu cầu công bố trong một khung thời hạn vài chục ngày sau khi giao dịch xảy ra, và trên thực tế không ít hồ sơ còn trễ hơn thế — có hồ sơ nộp giấy, có hồ sơ sửa lại, có hồ sơ nộp muộn và bị phạt. Nghĩa là: cái mình đọc được hôm nay là chuyện đã xảy ra từ một đến hai tháng trước.

Đây là điều mà dân làm tự động hoá hay quên, vì mình quen nhìn dữ liệu như một thứ trung tính. Nhưng mỗi bộ dữ liệu đều có một đường cong giá trị theo thời gian. Cùng một dòng dữ liệu:

  • lúc nó vừa thành sự thật → có thể đáng tiền rất nhiều;
  • lúc nó được nộp lên → đáng tiền ít hơn;
  • lúc nó được mình tải về → thường là đã muộn;
  • lúc nó nằm trong bài ai cũng đọc → không còn đáng gì.

Vậy nên khi một thứ trở thành "dữ liệu công khai, free, tải được bằng một API", giá trị của bản thân dữ liệu đã rơi về gần 0. Cái còn lại — và cái người ta trả tiền — là toàn bộ phần phía sau.

Mình nhận ra điều này từ một công việc tưởng như chẳng liên quan: cái máy gom tin của mình. Nguồn tin thì ai cũng đọc được, miễn phí, công khai. Nhưng mình không kiếm được gì từ việc đọc tin. Mình chỉ bắt đầu có giá trị khi có một tầng lọc biến hàng trăm thứ hỗn độn thành một danh sách ngắn, có lý do, có hành động kèm theo. Nguồn tin là nguyên liệu. Cái máy lọc mới là sản phẩm.


91,67% nghe rất cao — cho tới khi hỏi: sai 8,33% thì mất bao nhiêu?

Tuần này mình cũng đọc một case study khác, và nó khớp với chuyện trên một cách khó chịu. Một nhóm dựng pipeline review bằng LLM, đo được 91,67% chính xác — và kết luận là chưa đủ. Họ không đuổi tiếp lên 95% rồi 98%; họ dừng lại để nhìn vào phần sai.

Đó là chỗ mình thấy đáng học nhất, và cũng là chỗ hầu hết dự án tự động hoá đi sai.

Con số "độ chính xác" là chỉ số dễ khoe nhất và vô dụng nhất. Vì nó giả định rằng mọi lần đúng đều lời như nhau, và mọi lần sai đều lỗ như nhau. Trong thực tế thì gần như không bao giờ như vậy.

Lấy ví dụ chính chuyện giao dịch ở trên: một tín hiệu đúng 9 lần, mỗi lần ăn một chút; sai 1 lần, mất một cục. Độ chính xác 90% nghe rất đẹp trên slide, nhưng kỳ vọng toán học có thể vẫn âm. Cái giết người ta không phải tỷ lệ sai — mà là hình dạng của phần sai: sai to hay sai nhỏ, sai liên tiếp hay rải rác, và mình có bị buộc phải giữ vị thế đến lúc nhận ra mình sai hay không.

Nên bộ ba câu hỏi mình dùng bây giờ không còn là "máy đúng bao nhiêu phần trăm", mà là:

  1. 1.Khi sai, thiệt hại lớn nhất là bao nhiêu? (không phải trung bình — mà là trường hợp xấu nhất mình chịu nổi)
  2. 2.Mình phát hiện ra nó sai mất bao lâu, và bằng cách nào? (có tín hiệu nhận biết, hay phải chờ hậu quả?)
  3. 3.Có ai/cái gì chặn được trước khi sai thành thiệt hại thật không?

Với người bán dịch vụ tự động hoá, ngưỡng "đủ tốt để thu tiền" cũng không phải một con số chính xác. Nó là một chỉ số khác hẳn, và mình thấy thực dụng hơn nhiều: số lần khách phải tự sửa tay trên mỗi 1000 lần hệ chạy. Con số đó mà thấp và ổn định thì 91% hay 98% không còn quan trọng bằng việc khách biết chắc là nó sẽ không nổ lúc 2 giờ sáng.


Phía sau dữ liệu có ba tầng, và không tầng nào là "AI"

Tầng một: độ trễ

Mình vẽ lại chuỗi thời gian của một sự kiện, để thấy mình đang đứng ở đâu:

| Mốc | Chuyện gì xảy ra | Ai biết |

|---|---|---|

| T0 | Sự việc thật xảy ra | người trong cuộc |

| T0 + vài ngày | Tin bắt đầu rò ra, phỏng đoán | một nhóm nhỏ |

| T0 + vài chục ngày | Hồ sơ công bố theo luật | ai chịu khó đọc |

| T0 + vài chục ngày + vài giờ | Bot của mình đọc được | mình, và mọi người khác có bot |

| T0 + vài ngày sau nữa | Lên bài, thành "câu chuyện" | tất cả |

Cả hai dòng cuối của bảng này đều là điểm hẹn mà ai cũng tới được cùng lúc. Đó không phải là chỗ để xây lợi thế. Việc duy nhất mình kiểm soát được là khoảng cách từ "mình biết" tới "mình làm gì đó" — và khoảng cách đó sống bằng kỹ thuật vận hành, không phải bằng model thông minh hơn.

Tầng hai: cổng quyết định

Đây là tầng mình thấy bị bỏ trống nhiều nhất trong các hệ tự động hoá. Người ta dồn hết công sức vào phần sinh ra tín hiệu, rồi để tín hiệu đi thẳng ra hành động, mặc định mỗi lần là một lần như nhau. Trong khi giá trị thật nằm ở cái cổng ở giữa:

# PSEUDO-CODE minh hoạ — KHÔNG phải nguồn triển khai
def qua_cong(tin_hieu, trang_thai):
    if tin_hieu.tu_luc_su_kien > NGUONG_TRE:
        return BO_QUA            # dữ liệu đã hết giá trị, đọc cho biết thì được
    if trang_thai.dang_qua_tai:
        return BO_QUA            # đang có vấn đề chưa xử lý xong thì không mở thêm
    if not con_ngan_sach_rui_ro(trang_thai):   # trần lỗ trên 1 lần + trần lỗ trong ngày
        return DUNG_LAI          # hết ngân sách sai thì dừng, không "cố thêm một lần"
    return LENH_NHO(tin_hieu)    # vào nhỏ, xác định điểm thoát TRƯỚC khi vào
python

Không có dòng nào ở đây là AI. Tất cả đều là luật cứng. Và mình tin đây mới là phần đáng tiền: một cái máy giỏi sinh tín hiệu nhưng không biết tự hãm thì lỗ nhanh hơn người không có máy, chỉ vì nó nhanh hơn.

Tầng ba: vận hành — chỗ mình đã trả giá vài lần

Mấy bài trước mình kể kỹ phần này rồi, nên ở đây chỉ nhắc lại đúng cái cốt lõi: độ tin cậy của một chuỗi là tích, không phải trung bình. Năm mắt xích, mỗi mắt 95% ổn, không cho ra hệ 95% — nó cho ra khoảng 77%. Thêm mắt xích là nhân thêm phần rủi ro, kể cả khi mắt xích đó nghe rất hay.

Ba thứ thuộc tầng vận hành mà mình không bao giờ bỏ lại phía sau nữa:

  • Lỗi im lặng. Hệ chạy êm, trả kết quả, chỉ là kết quả thiếu đúng một thứ mà không ai biết là nó từng tồn tại. Cách chống duy nhất mình biết: ghi lại phần bị bỏ, và có một cửa để nói "không đủ dữ liệu" thay vì cố trả lời.
  • Chuyện làm hai lần. Thử lại là tính năng, làm-hai-lần là hoá đơn. Mọi hành động ra bên ngoài đều phải có khoá định danh, để chạy lại không tạo ra hậu quả thứ hai.
  • Cái cổng người quyết. Ở những điểm đắt giá nhất — nơi sai một lần là mất nhiều hơn cả tháng lời — mình vẫn để một người bấm nút. Không phải vì máy kém, mà vì đó là chỗ rẻ nhất để mua sự yên tâm.

Vậy người làm automation bán cái gì?

Sau mẩu tin sáng nay, mình viết lại câu trả lời của mình cho gọn:

Đừng bán dữ liệu. Đừng bán model.

Cả hai đều đang trên đường về 0: dữ liệu công khai thì miễn phí, model thì mạnh lên và rẻ đi mỗi quý. Nếu sản phẩm của mình chỉ là "AI đọc dữ liệu cho anh", mình đang bán đúng thứ đang mất giá nhanh nhất.

Bán phần sau:

  • "Anh không phải mở dashboard nữa." Tầng lọc + tầng giao việc, gói lại thành một thứ chạy đều mỗi ngày.
  • "Nếu máy sai, có người chịu." Cam kết vận hành, có hậu kiểm, có tín hiệu báo khi lệch — đây là thứ khách trả tiền mà không thương lượng nhiều.
  • "Anh không cần hiểu bên trong." Không phải giấu nghề, mà là đóng gói: khách quan tâm đầu ra ổn định, không quan tâm mình dùng gì.

Và phần mình từng coi là gánh nặng nhưng giờ coi là một phần của sản phẩm: tuân thủ. Công bố đúng, minh bạch chỗ dùng AI, giới hạn quyền của cái máy, không để nó tự chạm vào những thứ không thể hoàn tác. Với khách, "cái này không làm được gì sai trái" nghe chán hơn "cái này dùng AI mới nhất" — nhưng nó là lý do họ ký hợp đồng tháng thứ hai.


Cái mình giữ lại

Dữ liệu miễn phí là một cái bẫy dễ thương. Nó cho mình cảm giác đang có lợi thế, trong khi thật ra nó chỉ đang đưa mình tới cùng một điểm hẹn với tất cả những người chịu bỏ công tải file.

Giá trị không nằm ở chỗ mình biết cái gì. Nó nằm ở chỗ mình làm gì với cái đã biết, nhanh và an toàn tới mức nào — và cái đó là kỹ thuật vận hành thuần tuý, không hào nhoáng, không lên bảng xếp hạng.

Nên câu hỏi mình để lại cho anh em, cũng là câu mình tự hỏi sau mẩu tin sáng nay: nếu ngày mai nguồn dữ liệu anh em đang dùng trở thành miễn phí và ai cũng có, cái gì trong hệ của anh em còn lại là lợi thế? Nếu câu trả lời là "không còn gì", thì đó là điều đáng sửa — và sửa được, trước khi có người khác sửa hộ.

Một phần của chuỗi mổ xẻ kỹ thuật tại zeodavu.com/blog. Nếu thấy hữu ích, theo dõi [zeodavu.com](/blog) — mỗi bài là một thứ mình thật sự dùng, vấp, và sửa lại.