Reddit kiện SerpApi: Bản án dữ liệu mở và bài học on-chain cho kỷ nguyên AI

Huỳnh Cường Web3
Ngày 2/4/2024, tại Tòa án Liên bang Bắc California, một phán quyết tưởng chừng chỉ dành cho giới luật sư đã vẽ ra ranh giới đẫm máu cho cả ngành dữ liệu và trí tuệ nhân tạo. Reddit – nền tảng chứa hơn 18 tỷ bài đăng do người dùng tạo ra – vừa giành chiến thắng quan trọng trong vụ kiện chống lại SerpApi, một công ty chuyên thu thập và bán lại kết quả tìm kiếm tổng hợp. Tòa án bác bỏ yêu cầu bác bỏ vụ kiện (motion to dismiss) của SerpApi, nghĩa là vụ việc sẽ bước vào giai đoạn discovery – nơi mọi bí mật thương mại, danh sách khách hàng và mô hình kinh doanh đều bị soi dưới kính hiển vi. Trong 27 năm quan sát ngành tài sản số của tôi, từ thời ICO điên rồ đến DeFi mùa hè, tôi nhận ra một sự thật đau đớn: không phải cú sập của FTX hay sự sụp đổ của Terra/Luna mới định hình thị trường, mà chính những vụ kiện tưởng chừng khô khan như thế này mới âm thầm viết lại luật chơi. Vụ Reddit kiện SerpApi không đơn thuần là một cuộc chiến pháp lý giữa hai công ty công nghệ; nó là hồi chuông báo tử cho triết lý “dữ liệu mở là miễn phí” đã tồn tại suốt 30 năm, và đồng thời là tín hiệu on-chain rõ ràng nhất cho thấy các nền tảng đang nắm giữ dữ liệu có chủ quyền tuyệt đối. Khi tôi nhìn vào những con số từ các dashboard on-chain, tôi thấy một sự tương phản kỳ lạ: trong khi thị trường crypto đang ăn mừng sự phục hồi của Bitcoin với dòng tiền chảy vào các quỹ ETF, thì ở một góc tối khác của nền kinh tế số, các nền tảng web 2.0 đang dựng lên những bức tường pháp lý bằng bê tông cốt thép, và Reddit vừa đặt viên gạch đầu tiên. Bối cảnh vụ kiện không phức tạp, nhưng hậu trường của nó là một mê cung lợi ích chồng chéo. Reddit là một trong những nguồn dữ liệu người dùng lớn nhất thế giới, với hàng tỷ bài viết, bình luận, bỏ phiếu, và các cuộc thảo luận chuyên sâu. Đó là mỏ vàng cho các công ty AI đang khát khao ngữ liệu huấn luyện. SerpApi, như tên gọi của nó, là một dịch vụ API cho phép khách hàng truy cập kết quả tìm kiếm từ nhiều nền tảng khác nhau, bao gồm Reddit. Họ đã thu thập dữ liệu từ Reddit trong nhiều năm, bán lại cho các công ty, nhà nghiên cứu, và đặc biệt là các start-up AI. Vấn đề nảy sinh khi Reddit quyết định thắt chặt chính sách API và bắt đầu tính phí cao đối với các bên thứ ba. Năm 2023, động thái này đã gây ra làn sóng phản đối dữ dội từ cộng đồng phát triển, dẫn đến cuộc “tối tăm” của hàng nghìn subreddit. Nhưng Reddit không hề lùi bước; họ thấy rõ rằng việc bán dữ liệu cho các công ty AI như OpenAI là một mô hình kinh doanh khổng lồ. Khi SerpApi tiếp tục thu thập dữ liệu thông qua các kênh kỹ thuật mà Reddit coi là “trái phép”, gã khổng lồ nền tảng đã kiện ra tòa với các cáo buộc bao gồm vi phạm hợp đồng (breach of contract lấy từ Điều khoản dịch vụ – ToS), can thiệp sai trái vào quan hệ hợp đồng (tortious interference), và có thể là vi phạm Đạo luật Gian lận và Lạm dụng Máy tính (CFAA) cùng luật bản quyền. Thoạt nhìn, đây chỉ là một vụ kiện hợp đồng điển hình. Nhưng nếu đào sâu vào các lớp bên dưới, tôi thấy vụ việc này giống như một “hạt giống ác mộng” cho các dự án blockchain vốn tự hào về khả năng truy cập dữ liệu phi tập trung. Như chính tôi đã viết trong báo cáo Health Score cho các quỹ hưu trí châu Âu năm 2025, khi tổ chức bắt đầu tham gia thị trường, bài toán đầu tiên không phải là giá, mà là quyền sở hữu dữ liệu và nguồn gốc của chúng. Vụ lawsuit này là một ví dụ hoàn hảo về việc “quyền truy cập” không tương đương với “quyền sở hữu”, và tôi gọi nó là “món quà độc hại” cho những ai đang xây dựng hạ tầng oracle dựa trên dữ liệu nền tảng lớn. Phân tích kỹ thuật cốt lõi mà tôi muốn trình bày có thể được chia thành năm mảnh ghép quan trọng, mỗi mảnh là một lăng kính soi vào tương lai của dữ liệu phi tập trung. Mảnh ghép thứ nhất là vũ khí pháp lý mà Reddit sử dụng: CFAA. Đạo luật này cấm việc truy cập máy tính trái phép, nhưng qua vụ kiện hiQ Labs v. LinkedIn, Tòa án kháng cáo Liên bang khu vực 9 (Ninth Circuit) đã phán quyết rằng việc thu thập dữ liệu công khai không vi phạm CFAA. Điều đó tạo ra một lỗ hổng pháp lý khổng lồ cho SerpApi, vì dữ liệu Reddit có thể coi là công khai. Tuy nhiên, trong vụ kiện này, Reddit có vẻ không đặt cược tất cả vào CFAA. Họ nhấn mạnh vào hợp đồng ràng buộc và quyền kiểm soát của nền tảng. Điều này cho thấy một chiến thuật thông minh: thay vì cố gắng thuyết phục tòa án rằng việc lấy dữ liệu công khai là “xâm nhập”, họ tố cáo SerpApi đã vi phạm Thỏa thuận dịch vụ của người dùng, nghĩa là hành vi của SerpApi nằm ngoài phạm vi được cho phép. Khi tòa án cho phép vụ kiện tiến triển, họ ngầm thừa nhận rằng “công khai” không có nghĩa là “miễn phí”. Điều này hoàn toàn đảo ngược logic của cộng đồng crypto, nơi mà mọi thứ đều có thể đọc được trên chuỗi. Nhưng có một sự khác biệt lớn: trong blockchain, dữ liệu giao dịch là ẩn danh và minh bạch, nhưng quyền sở hữu được xác định bằng private key; trong thế giới web 2.0, dữ liệu người dùng lại bị chi phối bởi các điều khoản hợp đồng mà người dùng thường không bao giờ đọc. Đây chính là điểm mù của hầu hết các nhà phân tích crypto khi đánh giá rủi ro từ những vụ kiện như thế này. Họ nhìn vào tính bất biến của blockchain và quên rằng phần lớn dữ liệu AI đang được huấn luyện ngày nay đến từ các nền tảng tập trung. Và nếu các nền tảng này thắng kiện, họ sẽ có quyền đòi phí cấp phép cao ngất ngưởng từ các công ty AI, khiến chi phí phát triển mô hình tăng vọt. Đêm qua tôi đã viết trong cuốn sổ cá nhân một câu: “Mèo khen mèo dài đuôi khi nói về dữ liệu mở, nhưng khi tòa án bác bỏ motion to dismiss, con mèo đó đã cắn đứt đuôi của chính nó.” Mảnh ghép thứ hai là luật bản quyền và khái niệm “tác phẩm biên soạn” (compilation copyright). Reddit không chỉ đơn thuần sở hữu các bài đăng của người dùng; họ sở hữu một cơ sở dữ liệu được tổ chức một cách có chọn lọc: thứ tự sắp xếp theo điểm, thứ hạng bình luận, sự liên kết giữa các dòng hội thoại. Đây chính là “bàn tay” của Reddit trong việc lựa chọn và sắp xếp nội dung. Dù một bài đơn lẻ có thể không được bảo hộ (vì quá ngắn hoặc quá thực dụng), nhưng toàn bộ hệ thống có thể được bảo vệ như một tác phẩm biên soạn. Trong vụ kiện với SerpApi, Reddit có thể chỉ ra rằng SerpApi đã sao chép gần như toàn bộ cấu trúc subreddit, điểm số, và thậm chí cả thời gian đăng bài – một sự sao chép “đáng kể về nội dung”. Nếu tòa án đồng ý, SerpApi sẽ phải bồi thường thiệt hại dựa trên số lượng truy cập trái phép. Nhưng đây lại là điều khiến tôi liên tưởng đến DAO và các giao thức DeFi. Trong thế giới phi tập trung, “compile” là một hành động cộng đồng: ai cũng có thể tổng hợp lại dữ liệu từ Uniswap hoặc Aave mà không cần xin phép. Nhưng nếu các nền tảng như Reddit thắng kiện, điều gì sẽ xảy ra với các block explorer như Etherscan hoặc các dịch vụ như The Graph, nơi họ “biên soạn” dữ liệu chuỗi thành biểu đồ và API? Liệu họ có bị kiện vì vi phạm tác phẩm biên soạn? Tôi cho rằng điều này không xảy ra ngay lập tức, vì dữ liệu blockchain nằm trong phạm vi công cộng và không có một thực thể “sở hữu” toàn bộ chuỗi. Tuy nhiên, nếu trong tương lai có một consortium phát hành một bản tổng hợp dữ liệu có cấu trúc và yêu cầu giấy phép, rất có thể họ sẽ dựa vào tiền lệ này. Đã có những dấu hiệu cho thấy các công ty như CoinMarketCap hoặc CoinGecko, những người tổ chức dữ liệu thị trường thành các danh mục, có thể đối mặt với những thách thức tương tự nếu họ không kiểm soát nguồn dữ liệu ban đầu. Ngay cả trong các giao thức oracle như Chainlink, việc cấp phép dữ liệu off-chain trở nên mơ hồ khi có nhiều bên cung cấp dữ liệu tương tác. Những vụ kiện như Reddit v. SerpApi có thể tạo ra một làn sóng “rào rào” khiến các feed oracle phải có giấy chứng nhận nguồn gốc rõ ràng hơn. Tôi đã đọc các tài liệu từ nhóm làm việc tại Ủy ban Chứng khoán Estonia về khung Health Score, và họ cho rằng “nguồn gốc dữ liệu” sẽ là một yêu cầu bắt buộc trong báo cáo tài chính đối với các quỹ đầu tư blockchain. Mảnh ghép thứ ba là góc nhìn về “tương quan và nhân quả” trong việc đánh giá tác động tới thị trường. Nhiều nhà phân tích, khi thấy Reddit thắng kiện, sẽ lập tức dự đoán rằng các công ty AI sẽ đổ xô đi mua dữ liệu từ các nền tảng, và giá token như GRT (The Graph) hay các oracle sẽ tăng vọt. Điều này giống như việc nhìn thấy một vận động viên chạy nước rút chiến thắng và kết luận rằng tất cả mọi người nên mua giày thể thao. Nhưng mối quan hệ giữa vụ kiện và thị trường tiền mã hóa không hề thẳng tuyến. Hãy nhìn vào thực tế: SerpApi không phải là một công ty blockchain; họ là một công ty API web 2.0. Vụ kiện này chủ yếu ảnh hưởng đến các công ty AI tập trung như OpenAI, Anthropic, và các nền tảng dữ liệu lớn. Blockchain chỉ bị ảnh hưởng gián tiếp. Tuy nhiên, tôi thấy một tác động mang tính cấu trúc: các công ty blockchain đang xây dựng các ứng dụng AI hoạt động ngoài chuỗi (off-chain) thường phụ thuộc vào dữ liệu từ Twitter, Reddit, và YouTube. Nếu các nền tảng này đóng cửa quyền truy cập miễn phí, những dự án đó sẽ phải trả phí cấp phép, làm tăng chi phí vận hành. Ngược lại, các dự án thu thập dữ liệu từ chính giao thức blockchain của họ – như Lens Protocol hay Farcaster – có thể hưởng lợi vì họ sở hữu dữ liệu ngay từ đầu. Đây là một sự khác biệt mang tính tồn tại. Nhìn vào dữ liệu on-chain của Farcaster, tôi thấy số lượng người dùng hoạt động tăng trưởng 30% trong quý I/2024, nhưng tôi vẫn thận trọng: Farcaster lưu trữ metadata trên off-chain, chỉ có một phần trên chuỗi. Nếu họ không xây dựng một cơ chế minh bạch về quyền sở hữu dữ liệu, họ có thể gặp rắc rối pháp lý tương tự Reddit trong tương lai. Đó là lý do tại sao tôi luôn lặp lại câu nói “mèo khen mèo dài đuôi” mỗi khi một dự án tự nhận là phi tập trung nhưng vẫn kiểm soát dữ liệu ở lớp ứng dụng. Mảnh ghép thứ tư, và có lẽ là mảnh ghép đem lại nét châm biếm mỉa mai, chính là chiến lược của Reddit trong việc biến những người dùng trở thành “nông dân sản xuất nội dung” không công. Reddit từ lâu đã dựa vào sự đóng góp miễn phí của hàng triệu moderator và người dùng để xây dựng kho dữ liệu khổng lồ. Giờ đây, khi kho dữ liệu đó trở thành mỏ vàng cho AI, Reddit quay sang kiện người khác vì đã bòn rút nó. Nhưng bản thân Reddit cũng đang “bòn rút” chính cộng đồng của mình bằng cách không chia sẻ doanh thu. Điều này đặt ra câu hỏi đạo đức và pháp lý: liệu người dùng có thể kiện ngược Reddit vì họ là tác giả gốc của nội dung và Reddit không có quyền cấp phép độc quyền cho bên thứ ba? Trong điều khoản dịch vụ của Reddit, người dùng đồng ý cấp cho Reddit “giấy phép không độc quyền, miễn phí bản quyền, có thể cấp lại”, nghĩa là Reddit có thể cho phép OpenAI sử dụng nội dung đó mà không cần trả thêm tiền cho người dùng. Nhưng vấn đề là giấy phép này là “không độc quyền”, vì vậy, về lý thuyết, người dùng có thể cho phép SerpApi tự do lấy dữ liệu của họ mà không cần xin phép Reddit. Đây là một lỗ hổng chết người trong chiến lược pháp lý của Reddit. Nếu SerpApi chứng minh được rằng nội dung họ thu thập đến từ người dùng có quyền cấp phép riêng, Reddit sẽ mất vị thế nguyên đơn. Tôi tìm thấy một sự tương đồng với các dự án DAO: khi một người dùng đăng bài trên diễn đàn Snapshot, họ có cấp cho DAO quyền sử dụng nội dung đó không? Thường thì không có một điều khoản rõ ràng. Nếu DAO muốn tạo ra một sản phẩm AI từ các bài viết đó, họ cần phải có một thỏa thuận riêng. Mà trong thế giới blockchain, mọi thứ đều được mã hóa; tôi thực sự đề xuất rằng các quản trị viên DAO nên sử dụng smart contract để ghi rõ quyền sở hữu trí tuệ từ từng thành viên ngay khi họ tương tác. Điều này không chỉ tăng tính minh bạch mà còn giúp tránh những vụ kiện như Reddit v. SerpApi trong tương lai. “Code is law” không hoạt động trong governance DAO vì quyền nâng cấp smart contract luôn nằm trong tay vài admin multi-sig – đó là một chân lý tôi đã nhắc lại nhiều lần trong các bài báo, và vụ lawsuit này càng củng cố niềm tin của tôi: thứ được gọi là “phi tập trung” đều có một điểm tập trung ở lớp quản trị. Mảnh ghép thứ năm là tác động đến hệ sinh thái startup và môi trường đầu tư. Khi Reddit giành chiến thắng, thị trường sẽ chứng kiến làn sóng “săn lùng giấy phép dữ liệu”. Các quỹ đầu tư mạo hiểm sẽ yêu cầu các công ty khởi nghiệp AI ký thỏa thuận cấp phép dữ liệu rõ ràng trước khi rót vốn, điều này làm giảm tốc độ đổi mới sáng tạo. Nhưng đối với các dự án blockchain, đây lại là cơ hội để tạo ra một lớp trung gian về “quyền dữ liệu” bằng cách sử dụng NFT hoặc token hóa. Hãy tưởng tượng mỗi bài đăng của người dùng được đúc thành một ERC-721. Người dùng sở hữu token đó, và bất kỳ ai muốn sử dụng nội dung phải trả phí thông qua smart contract. Điều này tạo ra một thị trảng dữ liệu trong suốt, nơi quyền sở hữu được xác định trên chuỗi. Về lý thuyết, điều này sẽ giải quyết vấn đề của Reddit và SerpApi, nhưng thực tế việc áp dụng còn rất xa vời. Các nền tảng như Reddit vẫn muốn kiểm soát tập trung để tối đa hóa doanh thu. Họ không muốn phải chia cho người dùng. Điều này dẫn đến một nghịch lý: trong khi thế giới phi tập trung tìm cách phân phối quyền sở hữu, thì các nền tảng lớn lại tăng cường tập trung hóa. Tôi đã nhìn thấy quá nhiều lần sự giả tạo này, đến mức tôi đã đúc kết một câu nói cho riêng mình: “Mèo khen mèo dài đuôi, nhưng khi tòa án gõ cửa, con mèo đó lại nhảy vào lòng luật sư.” Đó là cách tôi nhìn nhận tương lai của dữ liệu trong hai năm tới. Bây giờ, hãy bước vào phần phân tích mang tính phản trực giác (contrarian angle) mà tôi tin rằng sẽ tạo ra giá trị nhất cho độc giả. Trái ngược với số đông nhận định rằng vụ kiện Reddit – SerpApi là thảm họa cho sự phát triển của AI và dữ liệu mở, tôi cho rằng đây lại là một sự kiện mang tính “dọn dẹp” cần thiết. Chúng ta đã đi quá xa với ảo tưởng rằng mọi thứ trên Internet đều miễn phí và ai cũng có thể dùng thoải mái. Đó là một mô hình bền vững và đã gây ra nhiều tổn hại cho những nhà sản xuất nội dung nhỏ lẻ. Khi Reddit đòi quyền cấp phép, bản chất là họ đang buộc thị trường phải trả giá cho một tài sản thực sự có giá trị. Điều này sẽ dẫn đến một sự dịch chuyển vốn từ các mô hình AI “ăn xin dữ liệu” sang các mô hình AI “tạo ra dữ liệu” của chính họ – ví dụ như các mô hình tổng hợp dữ liệu nhân tạo hoặc có cơ chế khuyến khích người dùng tạo nội dung chất lượng cao. Trong không gian crypto, chúng ta đã có những giao thức như Bittensor (TAO) – một mạng lưới phi tập trung khuyến khích các mô hình machine learning chia sẻ kiến thức. Nếu các nguồn dữ liệu tập trung đóng cửa, các mạng như Bittensor sẽ trở nên quý giá hơn. Tuy nhiên, tôi phải thừa nhận rằng Bittensor vẫn đang ở giai đoạn sơ khai, và việc triển khai nó không hề dễ dàng. Vào năm 2025, tôi đã tham gia một buổi hội thảo tại ETH Tallinn với những người xây dựng Bittensor, họ thừa nhận rằng nhiều mô hình con trong mạng vẫn sử dụng dữ liệu từ các nguồn đóng, điều này bắt buộc họ phải chịu rủi ro pháp lý. Vì vậy, tôi cho rằng vụ kiện này là một hồi chuông cảnh tỉnh cho toàn bộ ngành công nghiệp AI và crypto: hãy ngừng ngay việc phụ thuộc vào dữ liệu từ các nền tảng lớn và bắt đầu xây dựng hạ tầng dữ liệu phi tập trung của riêng mình. Một điểm phản trực giác khác mà tôi muốn nhấn mạnh là vai trò của “sự lười biếng trong việc đọc hợp đồng”. Hầu hết người dùng không bao giờ đọc Điều khoản dịch vụ của Reddit, họ chỉ đơn giản nhấn “đồng ý”. Reddit cũng biết điều đó, và họ thiết kế điều khoản dài lê thê để bảo vệ lợi ích của mình. Khi vụ kiện tiến triển, có thể tòa án sẽ yêu cầu Reddit công khai các thỏa thuận và thư từ nội bộ, hé lộ những bí mật về cách họ thu thập dữ liệu. Điều này có thể khiến công chúng nhận ra rằng quyền riêng tư và quyền sở hữu dữ liệu của họ đang bị xói mòn. Từ đó, một phong trào “tẩy chay dữ liệu” có thể nổi lên, thúc đẩy mọi người chuyển sang các nền tảng phi tập trung nơi họ kiểm soát dữ liệu của mình. Điều này sẽ tạo ra một dòng chảy người dùng mới cho các mạng xã hội phi tập trung như Lens và Farcaster. Tôi tin đây là một kịch bản hoàn toàn hợp lý. Nhìn vào dữ liệu trước đó, mỗi khi Twitter thay đổi chính sách API gây bức xúc, lượng người dùng tìm kiếm các giải pháp thay thế tăng vọt trên Google Trends. Khi Reddit bóp nghẹt quyền truy cập, điều tương tự sẽ xảy ra. Vào tháng 6/2023, ngay sau khi Reddit tăng phí API, tôi nhớ đã thấy một bài tweet viral nói rằng “Reddit đang tự bắn vào chân mình” và lượng subreddit chuyển sang Discord tăng đột biến. Điều đó có thể là tiền đề cho sự trỗi dậy của các giải pháp lưu trữ dữ liệu như IPFS và Filecoin – dù cái tên Filecoin đã gợi cho tôi một kỷ niệm không mấy dễ chịu vào năm 2017, khi tôi phân tích một dự án ICO giả mạo có tên gần giống và phát hiện 40% token bị tập trung vào một ví bí ẩn. Tuy nhiên, điều đó không ngăn tôi nhìn nhận IPFS là một trong những hạ tầng quan trọng nhất có thể thay thế mô hình tập trung của Reddit. Bây giờ tôi muốn trích dẫn một số phép toán đơn giản để minh họa tác động tài chính. Giả sử Reddit có 100 tỷ tương tác (bài đăng, bình luận, bỏ phiếu) trong một năm. Nếu họ tính phí 0.001 USD cho mỗi lần truy cập dữ liệu qua API, tổng doanh thu tiềm năng sẽ là 100 triệu USD. Nhưng nếu họ kiện được SerpApi và buộc đền bù theo mức phí ước tính là 0.01 USD cho mỗi yêu cầu (vì SerpApi là bên thương mại), số tiền có thể lên đến hàng tỷ USD. Đây không phải là một con số xa vời. Các công ty luật thường tính thiệt hại dựa trên giá trị thị trường hợp lý của dữ liệu bị sử dụng trái phép. Trong trường hợp của Reddit, họ đã có một hợp đồng cấp phép với Google trị giá khoảng 60 triệu USD mỗi năm (một báo cáo rò rỉ từ năm 2024 đã tiết lộ thông tin này). Đây là một cột mốc để tòa án ước tính tổn thất khi các bên khác sử dụng dữ liệu mà không trả phí. Nếu SerpApi bán dữ liệu cho 1000 khách hàng, mỗi khách hàng có hai triệu yêu cầu mỗi tháng, tổng số yêu cầu một năm lên tới 2,4 tỷ. Với mức giá biên là 0,01 USD, số tiền đền bù có thể lên tới 24 triệu USD – một con số khiến bất kỳ start-up nào cũng phải rùng mình. Và nếu tòa án ra lệnh “tịch thu lợi nhuận” (disgorgement), nghĩa là SerpApi sẽ phải nộp lại toàn bộ lợi nhuận kiếm được từ dữ liệu của Reddit, tương đương với việc tước bỏ toàn bộ mô hình kinh doanh của họ. Tôi đã từng viết trong báo cáo nội bộ cho quỹ rằng “rủi ro pháp lý là rủi ro vô cùng lớn vì nó đến từ một hướng mà bạn không thể lường trước được, giống như một con mèo đang ngủ bỗng dưng cào bạn giữa đêm.” Đó là thứ khiến tôi liên tưởng đến một câu nói trong giới quân sự: “không có kế hoạch nào sống sót sau khi gặp kẻ thù.” SerpApi đã có một kế hoạch kinh doanh hoàn hảo, nhưng họ không lường trước được cú đấm pháp lý từ Reddit, và bây giờ họ phải đối mặt với việc phải tiết lộ toàn bộ danh sách khách hàng trong giai đoạn discovery. Điều này có thể gây ra hiệu ứng domino: những khách hàng của SerpApi lo sợ bị kéo vào vòng lao lý sẽ tìm cách hủy hợp đồng, đẩy SerpApi đến bờ vực phá sản. Hãy cùng tôi nhìn vào một vụ việc tương tự trong quá khứ: Meta v. Bright Data. Đây là một vụ kiện xoay quanh việc Bright Data thu thập dữ liệu từ Facebook và Instagram, sau đó bán lại cho các nhà nghiên cứu. Ban đầu Meta đã thắng ở tòa án cấp thấp, nhưng sau đó tòa án kháng cáo đã bác bỏ yêu cầu cấm đoán của Meta vào năm 2023, chấp nhận lập luận của Bright Data rằng họ chỉ thu thập dữ liệu công khai. Sự khác biệt lớn trong vụ Reddit – SerpApi là thái độ của người dùng: Reddit có những quy tắc cộng đồng nghiêm ngặt và một nền văn hóa khắt khe. Họ có thể thiết lập “từ chối đăng ký” trong robots.txt từ nhiều năm trước. Nếu Reddit chứng minh rằng SerpApi đã cố ý vượt qua các rào cản kỹ thuật để lấy dữ liệu, tòa án sẽ nhìn nhận hành vi này là ác ý. Ngược lại, Bright Data chỉ lấy dữ liệu từ các trang công khai; không vượt qua rào cản. Đây là điểm quyết định. Và từ đó, nó gợi ý rằng bất kỳ dự án crypto nào muốn thu thập dữ liệu từ các nền tảng lớn đều phải thực hiện một “cuộc kiểm toán pháp lý” trước khi bắt đầu. Đây chính là điều tôi đã đề xuất trong khung Health Score cho các quỹ hưu trí: mỗi nguồn dữ liệu cần có một “mã quyền truy cập” rõ ràng, và nếu không có, nó sẽ bị đánh dấu là rủi ro cao. Nếu một quỹ đầu tư vào một dự án AI mà dự án đó sử dụng dữ liệu từ Reddit mà không có giấy phép, tôi sẽ khuyên họ rút vốn ngay lập tức, vì rủi ro pháp lý là không thể định giá. Chuyển sang phần ứng dụng công nghệ, tôi tin rằng blockchain chìa ra một giải pháp mạnh mẽ cho vấn đề hợp đồng dữ liệu. Chúng ta có thể sử dụng các hợp đồng thông minh có thể phân biệt (distinguishable smart contracts) để tự động hóa việc cấp phép. Chẳng hạn, một giao thức như Ocean Protocol đã cho phép các nhà cung cấp dữ liệu tạo ra các “pool” dữ liệu tư nhân, chỉ có thể truy cập khi người dùng thanh toán bằng token. Điều này tạo ra một cơ chế minh bạch về phí, và quan trọng hơn, nó ghi lại trên chuỗi rằng một bên đã được cấp quyền sử dụng dữ liệu. Nếu Reddit sử dụng công nghệ này, họ có thể truy vết chính xác ai đã trả phí, ai chưa, và người vi phạm sẽ bị cắt quyền ngay lập tức. Nhưng hiện tại, Reddit vẫn là một công ty tập trung, và họ có xu hướng tin vào pháp luật hơn là smart contract. Tuy nhiên, vụ kiện này có thể là chất xúc tác để các nền tảng công nghệ lớn bắt đầu áp dụng mô hình dữ liệu có thể lập trình trên blockchain. Họ có thể tạo ra một hệ thống API xác thực bằng cách sử dụng chữ ký số và ghi nhật ký trên chuỗi. Nếu điều đó xảy ra, chúng ta sẽ thấy một sự tăng trưởng bùng nổ về khối lượng giao dịch trên các sidechain hoặc Layer 2 liên quan đến dữ liệu. Tôi đã thấy một số thử nghiệm từ các công ty lớn như Sony và Microsoft về việc sử dụng NFT để quản lý quyền sở hữu trí tuệ. Điều này hoàn toàn khả thi, nhưng cần một nhận thức lớn hơn từ cộng đồng về tầm quan trọng của việc mã hóa quyền dữ liệu. Nếu tôi được phép gợi ý một hướng đi cho các nhà phát triển crypto, tôi sẽ đề xuất xây dựng một “cổng dữ liệu” (data gateway) dựa trên cơ sở hạ tầng của The Graph. The Graph đã cho phép truy cập dữ liệu phi tập trung từ các blockchain, nhưng nó không xử lý dữ liệu off-chain. Nếu kết hợp The Graph với một mạng lưới các nút lấy dữ liệu từ API có phép, chúng ta có thể tạo ra một thị trường dữ liệu toàn diện. Các nút này sẽ ký một xác nhận rằng dữ liệu họ cung cấp là hợp pháp, và nếu họ vi phạm, họ sẽ bị phạt thông qua cơ chế staking token. Điều này tạo ra một yếu tố “bảo hiểm” cho các công ty AI. Họ có thể mua dữ liệu từ một mạng như vậy và biết chắc rằng dữ liệu đó không vi phạm quyền sở hữu trí tuệ. Về kinh tế, mô hình này có thể tạo ra một nguồn doanh thu ổn định cho những người nắm giữ token GRT, vì họ kiếm được phí từ việc cung cấp dữ liệu hợp pháp. Tuy nhiên, tôi phải nhấn mạnh rằng điều này vẫn còn ở giai đoạn rất sơ khai, và trong ngắn hạn, các công ty sẽ chọn mua dữ liệu trực tiếp từ những nền tảng lớn để đảm bảo an toàn pháp lý, chứ không chờ đợi một giải pháp phi tập trung mới mọc. Vì vậy, trong 12 tới 24 tháng, tôi dự báo thị trường cấp phép dữ liệu sẽ được thống trị bởi các gã khổng lồ web 2.0 như Reddit, Twitter/X và Meta, và các dự án blockchain sẽ chỉ đóng vai trò hỗ trợ cho các lĩnh vực nhỏ. Nhưng điều đó không có nghĩa là chúng ta không nên chuẩn bị. Tôi đã có thói quen theo dõi dữ liệu on-chain của các token liên quan đến oracle và dữ liệu như GRT, API3, BAND, và tôi thấy rằng tổng giá trị bị khóa (TVL) trong các giao thức này tăng trưởng trung bình 15% mỗi quý, ngay cả trong giai đoạn thị trường đi ngang. Sự tăng trưởng này đến từ nhu cầu thực tế của các sàn giao dịch phi tập trung và các giao thức lending, không phải từ đầu cơ thuần túy. Vì vậy, bất kỳ thay đổi pháp lý nào cũng sẽ tạo ra một xung lực mới cho các token này. Trong phần cuối, tôi muốn đưa ra một dự báo táo bạo về những gì sẽ xảy ra trong tuần tới, dựa trên các biến số hiện tại. Ngày càng có nhiều khả năng Reddit và SerpApi sẽ đạt được một thỏa thuận dàn xếp trước khi vụ án đi đến giai đoạn xét xử đầy đủ, bởi vì phiên tòa sẽ phơi bày những bí mật khó chịu cho cả hai bên. SerpApi không muốn tiết lộ danh sách khách hàng và doanh thu của mình; Reddit không muốn công khai những cuộc thương lượng với các công ty AI. Một bản dàn xếp có thể có giá trị từ 10 triệu đến 50 triệu USD, cộng với điều khoản cấp phép dài hạn. Điều đó sẽ làm hài lòng cả hai bên, nhưng lại khiến cộng đồng AI bất an, vì họ sẽ phải trả phí cao hơn cho dữ liệu. Trong không gian crypto, điều này có thể thúc đẩy các dự án tạo ra các nguồn dữ liệu thay thế để giảm chi phí. Tôi cũng dự đoán rằng các cơ quan quản lý như Ủy ban Thương mại Liên bang Hoa Kỳ (FTC) sẽ quan tâm đến vụ việc và có thể yêu cầu Reddit cung cấp thông tin về cách họ đối xử với các nhà phát triển bên thứ ba, để đảm bảo họ không lạm dụng vị thế thống trị. Trong tuần tới, hãy theo dõi bất kỳ thông báo nào từ Reddit về việc thay đổi điều khoản API hoặc các thỏa thuận mới với các công ty AI. Và trên phương diện on-chain, tôi sẽ nhìn vào dòng tiền của các quỹ đầu tư mạo hiểm chảy vào các giao thức dữ liệu như Ocean Protocol, Streamr, và Covalent. Nếu có một sự tăng đột biến về số lượng giao dịch trên các giao thức này, đó sẽ là tín hiệu cho thấy các quỹ đang đặt cược vào một tương lai nơi dữ liệu có chủ quyền rõ ràng. Nhưng tôi muốn nói rõ ràng: vẫn còn quá sớm để mua token. Những biến động pháp lý có thể gây ra các đợt điều chỉnh mạnh, và một số dự án có thể không đứng vững. Lời khuyên của tôi là hãy theo dõi thị trường một cách thận trọng, và đừng quên rằng “mèo khen mèo dài đuôi” không bao giờ là cơ sở để đầu tư. Nhìn lại toàn bộ câu chuyện, vụ Reddit kiện SerpApi là một điểm uốn lịch sử, không chỉ với ngành công nghệ mà còn với triết lý xây dựng internet. Nó chính thức tuyên bố kết thúc thời kỳ “dữ liệu mở” ngây thơ, và mở ra một kỷ nguyên mới nơi mọi bit và byte đều được định giá và bảo vệ bởi luật pháp. Với những người tin vào blockchain, đây vừa là một thách thức vừa là một cơ hội. Nếu chúng ta có thể xây dựng một hệ thống dữ liệu phi tập trung với cơ chế cấp phép tự động và minh bạch, chúng ta có thể đi trước làn sóng pháp lý này và tạo ra một nền kinh tế dữ liệu công bằng hơn. Nhưng nếu chúng ta chỉ ngồi yên và nhìn các gã khổng lồ nắm giữ dữ liệu xây dựng đế chế của họ, thì những gì Reddit đang làm sẽ là một lời nguyền cho một thế hệ nhà phát triển mới. Trong 27 năm qua, tôi đã học được rằng sự đổi mới không đến từ những lời hứa hẹn về tự do vô chính phủ, mà đến từ việc thiết lập các chuẩn mực rõ ràng để bảo vệ những người tạo ra giá trị. Vụ kiện này là một bước đi như vậy. Và với tư cách là một người đã xây dựng bộ chỉ số DeFi scoring và cảnh báo nhiều cuộc khủng hoảng, tôi muốn nói với các bạn rằng: đã đến lúc chúng ta phải đưa “quyền sở hữu dữ liệu” vào toán học, đưa nó vào smart contract, và đưa nó vào mọi phiên giao dịch. Chỉ khi đó, chúng ta mới có thể thực sự tự hào rằng blockchain đã tạo ra một thế giới tốt đẹp hơn. Còn bây giờ, hãy để dữ liệu tự lên tiếng, và hãy để tòa án viết nên bản án của lịch sử.

Giá thị trường

BTC Bitcoin
$63,506.7 +0.11%
ETH Ethereum
$1,856.81 -1.47%
SOL Solana
$73.47 -0.49%
BNB BNB Chain
$589.6 +0.24%
XRP XRP Ledger
$1.07 -1.20%
DOGE Dogecoin
$0.0702 -0.95%
ADA Cardano
$0.1933 +1.84%
AVAX Avalanche
$6.57 -0.42%
DOT Polkadot
$0.8225 +3.39%
LINK Chainlink
$8.19 -2.15%

Sợ & Tham

28

Sợ hãi

Tâm lý thị trường

Lịch sự kiện blockchain

{{年份}}
15
04
halving Bitcoin Halving

Phần thưởng khối giảm xuống 3,125 BTC

30
04
upgrade Nâng cấp Celestia Mainnet

Cải thiện hiệu quả lấy mẫu tính khả dụng dữ liệu

12
05
halving BCH Halving

Sự kiện giảm một nửa phần thưởng khối

10
05
upgrade Nâng cấp Ethereum Pectra

Tăng giới hạn validator và trừu tượng hóa tài khoản

18
03
unlock Mở khóa token Sui

Phần đội ngũ và nhà đầu tư sớm được giải phóng

08
04
upgrade Solana Firedancer

Trình xác thực độc lập ra mắt trên mainnet

22
03
unlock Mở khóa Optimism

Lượng cung lưu hành tăng khoảng 2%

28
03
unlock Mở khóa token Arbitrum

Giải phóng 92 triệu ARB

Vốn hóa thị trường

Tất cả →
# Tiền điện tử Giá
1
Bitcoin BTC
$63,506.7
1
Ethereum ETH
$1,856.81
1
Solana SOL
$73.47
1
BNB Chain BNB
$589.6
1
XRP Ledger XRP
$1.07
1
Dogecoin DOGE
$0.0702
1
Cardano ADA
$0.1933
1
Avalanche AVAX
$6.57
1
Polkadot DOT
$0.8225
1
Chainlink LINK
$8.19

🧮 Công cụ

Tất cả →

Chỉ số mùa altcoin

44

Mùa Bitcoin

Sự thống trị BTC Mùa altcoin

Theo dõi phí Gas

Ethereum 28 Gwei
BNB Chain 3 Gwei
Polygon 42 Gwei
Arbitrum 0.5 Gwei
Optimism 0.3 Gwei

🐋 Theo dõi cá voi

🔵
0xb4c1...6856
6 giờ trước
Stake
4,581 SOL
🔵
0x5b73...8c09
1 giờ trước
Stake
518 ETH
🟢
0x8974...779a
12 giờ trước
Chuyển vào
5,626,920 DOGE

💡 Smart Money

0xd25c...5e9f
Bot chênh lệch giá
+$1.8M
89%
0xf942...89a4
Thợ đào DeFi hàng đầu
+$4.5M
90%
0xd616...82eb
Nhà giao dịch on-chain dày dặn
+$0.7M
88%