0

Tối ưu AI Citation (Phần 7): Điều gì xảy ra giữa câu hỏi của người dùng và một lượt trích dẫn của ChatGPT?

Phân tích 16.851 truy vấn và 353.799 trang web trong toàn bộ quy trình tìm kiếm của ChatGPT cho thấy vị trí xuất hiện trong kết quả tìm kiếm nội bộ là yếu tố dự báo mạnh nhất cho việc được trích dẫn, mạnh hơn bất kỳ tín hiệu nội dung nào. Trang ở vị trí đầu tiên có tỷ lệ được trích dẫn 58%, trong khi trang ở vị trí thứ 10 chỉ đạt 14%. Không có chất lượng nội dung nào có thể bù đắp cho việc không được tìm thấy.

Tóm tắt các điểm chính

  1. Vị trí trong kết quả tìm kiếm nội bộ của ChatGPT là yếu tố dự báo số 1. Trang ở vị trí 1 có tỷ lệ trích dẫn 58%, vị trí 10 chỉ 14%, khoảng cách gấp 4 lần.
  2. Heading khớp với truy vấn của người dùng là tín hiệu nội dung mạnh nhất. Trang có heading khớp tốt được trích dẫn 41% thời gian, trang khớp kém chỉ 29%.
  3. Bài focused thắng bài toàn diện. Trang bao phủ 26-50% subtopic vượt trội trang bao phủ 100% khi query match được giữ không đổi.
  4. Domain authority không có giá trị dự báo. Trang luôn được trích dẫn có DA trung bình 53, thấp hơn trang không bao giờ được trích dẫn (DA 55,7).
  5. 58% trang không bao giờ được trích dẫn, 25% luôn được trích dẫn, chỉ 17% ở giữa. Phân bổ này có tính chất hai cực rõ rệt, không phải đường cong chuẩn.

1/ Phát hiện 1: Vị trí trong kết quả tìm kiếm nội bộ quyết định tất cả

Vị trí trang trong kết quả tìm kiếm web của ChatGPT là yếu tố dự báo mạnh nhất cho việc được trích dẫn, và điều này giữ nguyên qua mọi biến kiểm soát.

Vị trí tìm kiếm quyết định

Khi ChatGPT trả lời một truy vấn, nó tự tạo ra các query fan-out, tìm kiếm web và nhận về danh sách URL được xếp hạng. Vị trí 0 là kết quả đầu tiên, vị trí 1 là kết quả thứ hai, và tiếp tục như vậy.

Vị trí trong kết quả tìm kiếm Tỷ lệ trích dẫn
Vị trí 1 (kết quả đầu tiên) 58,4%
Vị trí 2 54,4%
Vị trí 3 35,5%
Vị trí 4 29,9%
Vị trí 6 24,6%
Vị trí 10 14,2%

Trang ở vị trí 0 có khả năng được trích dẫn cao gấp 4 lần so với trang ở vị trí 10.

Vị trí dự báo tính nhất quán của trích dẫn: Trang được trích dẫn cả 3 lần chạy (nguồn đáng tin nhất) có vị trí tốt hơn đáng kể so với trang không bao giờ được trích dẫn.

Nhóm Số trang Vị trí trung bình tốt nhất Vị trí trung vị
Được trích dẫn cả 3 lần 6.124 6,2 2,5
Được trích dẫn 2/3 lần 21.287 8,8 5,0
Được trích dẫn 1/3 lần 77.285 11,6 8,0
Không bao giờ được trích dẫn 172.190 14,6 13,0

Vị trí vẫn quan trọng ngay cả khi nội dung đã khớp tốt: Trong nhóm trang có heading khớp tốt với truy vấn (độ tương đồng >= 0,8), vị trí vẫn tạo ra khoảng cách 58 điểm phần trăm.

Nhóm vị trí Tỷ lệ trích dẫn (khi heading match >= 0,8)
Vị trí 1 79,6%
Vị trí 2 74,7%
Vị trí 3-4 47,8%
Vị trí 5-6 37,0%
Vị trí 7-10 25,5%
Vị trí 11+ 21,5%

Một trang có nội dung yếu (heading match < 0,60) ở vị trí 1 vẫn đạt tỷ lệ trích dẫn 55,9%, vượt trội trang có nội dung xuất sắc ở vị trí 11+ (21,5%). Khả năng được tìm thấy là mục tiêu tối ưu hóa đầu tiên. Chất lượng nội dung khuếch đại tín hiệu đó, nhưng nếu không được tìm thấy thì không có gì để khuếch đại.

2/ Phát hiện 2: Heading khớp truy vấn thắng chiều rộng bao phủ

Tín hiệu nội dung mạnh nhất là mức độ heading của trang khớp với truy vấn gốc của người dùng. Số lượng fan-out subtopic mà trang bao phủ gần như không ảnh hưởng.

Phân tích này chỉ đo độ tương đồng ở cấp heading (H1-H4 so với query embedding), không phải toàn bộ nội dung bài. Phương pháp này đo mức độ liên quan về cấu trúc (trang được tổ chức xung quanh điều gì) thay vì tổng độ trùng lặp văn bản.

Heading match dự báo trích dẫn rõ ràng và đơn điệu:

Độ tương đồng heading Tỷ lệ trích dẫn Số lần chạy được trích dẫn trung bình
< 0,50 30,2% 0,43
0,50-0,59 29,8% 0,44
0,60-0,69 28,6% 0,42
0,70-0,79 31,0% 0,49
0,80-0,89 34,5% 0,62
0,90+ 41,0% 0,81

Ngay cả khi kiểm soát vị trí (chỉ xem trang ở vị trí 0-2), heading match cao hơn vẫn thêm 19 điểm phần trăm vào tỷ lệ trích dẫn: từ 55,9% ở mức < 0,60 lên 75,3% ở mức 0,90+.

Heading khớp truy vấn

Fan-out coverage là tín hiệu yếu:

Fan-out coverage đo tỷ lệ subtopic từ query fan-out mà trang bao phủ, được tính dựa trên H2-H4 subheading với ngưỡng cosine similarity 0,80.

Fan-out coverage (H2-H4 @ 0,80) Số trang Tỷ lệ trích dẫn Số lần chạy trung bình
0% 591.662 30,6% 0,48
1-50% 112.706 33,3% 0,56
51-100% 107.943 35,2% 0,64

Bao phủ 100% subtopic chỉ thêm 4,6 điểm phần trăm so với bao phủ 0%. Và khoảng cách này còn mang tính đánh lừa: trang có coverage cao cũng có xu hướng có heading match cao hơn (0,834 so với 0,680), nên hai tín hiệu này đi cùng nhau.

Bài kiểm soát: bao phủ vừa phải thắng bao phủ toàn diện:

Khi giữ heading match không đổi (>= 0,8), lợi thế của density biến mất và thậm chí đảo chiều.

Fan-out coverage (heading match >= 0,8) Số trang Tỷ lệ trích dẫn
0% 79.024 35,5%
26-50% 28.785 38,2%
100% 120.572 34,0%

Trang bao phủ 26-50% subtopic vượt trội trang bao phủ 100%. Bao phủ toàn diện có vẻ báo hiệu nội dung "generalist" đề cập nhiều chủ đề nhưng không đủ sâu, trong khi bao phủ vừa phải kết hợp với heading match tốt báo hiệu chuyên môn tập trung.

Bao phủ chủ đề

Heading spread củng cố thêm mô hình này:

Số H2-H4 khớp với query fan-out Số trang Tỷ lệ trích dẫn Được trích dẫn cả 3 lần
0 heading 79.024 35,5% 3,77%
1 heading 101.430 35,2% 3,87%
2 heading 48.150 33,9% 3,60%
3-4 heading 635 29,8% 2,68%

Khớp 1 subheading cho kết quả gần như giống hệt khớp 0. Khớp 3-4 subheading giảm tỷ lệ trích dẫn 6 điểm phần trăm. Nhiều heading match hơn không giúp ích và có thể cho thấy nội dung bị loãng.

Hãy viết nội dung trả lời trực tiếp truy vấn bạn nhắm đến. Một trang trả lời tốt một câu hỏi vượt trội trang trả lời tạm được năm câu hỏi.

3/ Phát hiện 3: Cấu trúc nội dung đóng vai trò hỗ trợ, không phải cứu cánh thực sự

Các tín hiệu cấu trúc giúp ở mức biên nhưng không thể lấn át vị trí tìm kiếm hay mức độ khớp truy vấn. Phân tích này loại trừ các trang ít nội dung (dưới 100 từ).

Độ dài nội dung:

Số từ Tỷ lệ trích dẫn
< 500 30,5%
500-999 34,3%
1.000-1.499 32,9%
1.500-1.999 33,5%
2.000-2.999 32,6%
3.000-4.999 30,2%
5.000+ 28,6%

Điểm tối ưu là 500-2.000 từ. Trang trên 5.000 từ kém hơn trang dưới 500 từ. Độ dài quá lớn làm hại tỷ lệ trích dẫn trong ChatGPT.

Độ dài nội dung

Số lượng heading H2-H4:

Số H2-H4 Tỷ lệ trích dẫn
0 30,1%
1-3 28,0%
4-6 32,1%
7-10 33,5%
11-20 33,6%
21+ 31,9%

Dải 7-20 subheading là tối ưu. Đáng chú ý: nhóm 1-3 heading (28,0%) kém hơn nhóm 0 heading (30,1%), cho thấy cấu trúc nửa vời còn tệ hơn không có cấu trúc. Tuy nhiên tối ưu khác nhau theo loại trang:

Loại trang 0 heading 1-3 4-10 11-20 21+
Bài viết (Article) 30,4% 31,8% 33,2% 32,6% 33,0%
Trang sản phẩm (Product) 43,2% 33,8% 31,9% 33,8% 25,0%
Khác (forums, landing page...) 29,8% 27,6% 32,9% 33,8% 31,8%

Với bài viết, 4-10 heading hoạt động tốt nhất (33,2%). Với trang sản phẩm, 0 heading có tỷ lệ trích dẫn cao nhất (43,2%), có thể vì trang sản phẩm đã tập trung vào một mục cụ thể và không cần cấu trúc biên tập.

Schema markup: lợi thế thực sự:

Trạng thái JSON-LD Tỷ lệ trích dẫn
Có JSON-LD 38,5%
Không có JSON-LD 32,0%

Trang có JSON-LD schema markup có lợi thế 6,5 điểm phần trăm. Các loại schema hoạt động tốt nhất:

Loại JSON-LD Tỷ lệ trích dẫn
MedicalWebPage 47,0%
BreadcrumbList 46,2%
FAQPage 45,6%
Organization 44,3%
WebSite 40,6%

Điểm quan trọng: trang có JSON-LD không khác biệt về số từ (2.634 so với 2.627), số heading (23,7 so với 23,0), DA (60,2 so với 59,4), hay heading match (0,745 so với 0,739). Lợi thế từ schema là tín hiệu độc lập, có thể vì structured data giúp hệ thống tìm kiếm phân tích và phân loại nội dung trang hiệu quả hơn.

JSON-LD

Danh sách và bảng biểu:

Cấu trúc Tỷ lệ trích dẫn
Có cả danh sách + bảng 33,9%
Chỉ có bảng 32,9%
Chỉ có danh sách 31,6%
Không có cả hai 31,0%

Trang có cả danh sách lẫn bảng biểu đạt lợi thế 2,9 điểm phần trăm. Tín hiệu này mạnh nhất với trang sản phẩm (+13 điểm phần trăm so với không có), hầu như không đáng kể với bài viết.

Khả năng đọc hiểu

Flesch-Kincaid Grade Tỷ lệ trích dẫn
< 8 (Tiểu học) 29,6%
8-9 (THPT) 32,1%
10-11 31,7%
12-13 32,3%
14-15 33,3%
16-17 (Đại học) 35,9%
18-19 (Sau đại học) 34,3%
20+ (Học thuật) 33,2%

Dải FK 16-17 hoạt động tốt nhất (35,9%), nhất quán với các nghiên cứu AI Citation trước đây cho thấy FK 16 là tối ưu cho AI citation. ChatGPT ưu tiên văn phong chuyên nghiệp ở cấp đại học, đạt đỉnh ở mức này rồi giảm dần khi vượt qua ngưỡng 18.

Khả năng đọc hiểu

Cấu trúc hỗ trợ, không phải cứu cánh thực sự. Các tín hiệu cấu trúc cộng thêm 2-6 điểm phần trăm vào tỷ lệ trích dẫn nhưng không thể bù đắp cho vị trí tìm kiếm kém hay heading match yếu. Phát hiện này bổ sung cho nghiên cứu AI Citation phần 4 - làm rõ hơn các tín hiệu trên trang.

4/ Phát hiện 4: Domain authority không có giá trị dự báo

Domain authority và số lượng backlink không có tương quan dương với tỷ lệ trích dẫn trong câu trả lời AI, thậm chí còn có tương quan âm nhẹ. Đây là những tuyên bố mà Infinity đã viết trong nội dung "AI chọn nguồn nào để trích dẫn" trong series nghiên cứu AI Citation.

Nhóm DA trung bình Backlink trung bình
Luôn được trích dẫn (79K trang) 53,0 1,1 triệu
Đôi khi được trích dẫn (57K trang) 57,8 752 nghìn
Không bao giờ được trích dẫn (182K trang) 55,7 3,2 triệu

Trang luôn được trích dẫn có DA thấp hơn và ít backlink hơn trang không bao giờ được trích dẫn.

DA không giúp ích ở bất kỳ mức heading match nào:

Mức heading match DA thấp nhất (Q1) DA cao nhất (Q4)
Thấp (< 0,7) 31,3% 27,3%
Trung bình (0,7-0,8) 33,2% 30,2%
Cao (0,8+) 35,2% 35,0%

Ở mọi mức độ liên quan nội dung, nhóm DA thấp nhất hoạt động ngang bằng hoặc tốt hơn nhóm DA cao nhất.

Các nền tảng thẩm quyền cao nhất tạo ra kết quả rất khác nhau:

Nền tảng Domain Authority Tỷ lệ trích dẫn
YouTube 100 2,4%
Reddit 92 29,9%
Báo lớn (Forbes, NYT...) 94 32,0%
Health Publishers 90 46,4%
Wikipedia 95 59,2%

Năm nhóm có DA cao nhất trong bộ dữ liệu tạo ra tỷ lệ trích dẫn từ 2,4% đến 59,2%. DA gần như giống nhau, kết quả hoàn toàn khác. DA không cho biết gì về khả năng được trích dẫn.

ChatGPT đánh giá nội dung trực tiếp dựa trên mức độ liên quan và cấu trúc. Thẩm quyền domain không có trọng số quan sát được. Hãy đánh giá chiến lược AEO dựa trên chất lượng nội dung, không phải hồ sơ backlink.

Phân tích theo loại trang

Tỷ lệ trích dẫn, vị trí tìm kiếm và đặc điểm nội dung khác nhau đáng kể theo loại trang:

Loại trang Số trang Tỷ lệ trích dẫn Vị trí trung vị % Top 3 Heading match
Wikipedia 5.342 59,2% 24,0 3,6% 0,576
Health Publishers 3.484 46,4% 7,0 29,3% 0,734
Travel Platforms 2.147 42,3% 8,0 21,8% 0,764
Education 4.031 41,2% 8,0 17,5% 0,659
Government 5.234 34,4% 8,0 19,0% 0,649
Bài viết khác 53.688 32,6% 10,0 14,0% 0,754
Báo lớn 2.686 32,0% 12,0 20,2% 0,720
Trang sản phẩm 3.627 30,4% 9,0 15,9% 0,757
Reddit 12.765 29,9% 11,0 15,0% 0,743
Marketplace 1.301 15,9% 12,0 12,5% 0,726
YouTube 2.647 2,4% 15,0 10,7% 0,714

Ngoại lệ Wikipedia: Wikipedia đạt tỷ lệ trích dẫn cao nhất (59,2%) dù có vị trí tìm kiếm tệ nhất (trung vị 24, chỉ 3,6% trong top 3) và heading match thấp nhất (0,576). Đây là loại trang duy nhất mà density thực sự vượt qua vị trí tìm kiếm kém.

Điều làm Wikipedia khác biệt là mật độ nội dung:

Chỉ số Wikipedia Health Publishers Reddit Trung bình toàn bộ
Số từ trung bình 4.383 2.111 1.194 2.324
H2-H4 trung bình 13,6 17,2 1,4 22,1
Danh sách trung bình 31,0 18,8 1,8 10,7
Bảng trung bình 6,6 0,2 0,0 0,8
JSON-LD 0,0% 1,5% 0,0% 1,0%

Wikipedia thắng hoàn toàn nhờ density nội dung: bao phủ bách khoa, dữ liệu có cấu trúc phong phú trong bài, xử lý chủ đề toàn diện. Không có loại trang nào khác tái tạo được mô hình này. Đây không phải chiến lược có thể áp dụng cho hầu hết các nhà xuất bản.

Health Publishers: mô hình query match kết hợp vị trí tốt: Health publishers (Healthline, WebMD, Mayo Clinic...) đạt tỷ lệ trích dẫn cao thứ hai (46,4%) thông qua chiến lược khác hẳn Wikipedia: vị trí tìm kiếm tốt nhất trong bộ dữ liệu (trung vị 7, 29,3% trong top 3), kết hợp heading match cao (0,734) và fan-out coverage ratio cao nhất (0,918). Nội dung tập trung (2.111 từ trung bình), có cấu trúc tốt, rất liên quan với các truy vấn mà chúng xuất hiện.

Reddit: thẩm quyền cao, giá trị thấp: Reddit có DA 92 nhưng tỷ lệ trích dẫn chỉ 29,9% và tính nhất quán thấp nhất (chỉ 0,59% trang được trích dẫn cả 3 lần). Trang Reddit gần như không có cấu trúc (1,4 H2-H4 heading, 0 bảng) và nội dung ngắn (1.194 từ). Không có sự khác biệt cấu trúc giữa trang Reddit luôn được trích dẫn và không bao giờ được trích dẫn. Với Reddit, việc được trích dẫn hoàn toàn phụ thuộc vào nội dung thread có chứa đúng thông tin ChatGPT cần hay không.

Báo lớn: xuất hiện nhiều, nhất quán kém: Các tờ báo lớn (Forbes, NYT, Guardian, BBC...) có DA thứ hai (94) nhưng tỷ lệ trích dẫn dưới trung bình (32,0%) và tỷ lệ "đôi khi được trích dẫn" cao. Họ xuất hiện trong nhiều truy vấn nhưng hiếm khi sở hữu một chủ đề. Trong nhóm này, trang luôn được trích dẫn có cấu trúc đáng kể hơn trang không bao giờ được trích dẫn (28,4 so với 20,4 H2-H4 heading), một trong số ít loại trang mà cấu trúc nội dung thực sự phân biệt kết quả.

YouTube và marketplace: bất lợi cấu trúc: YouTube (2,4% tỷ lệ trích dẫn) bất lợi vì thiếu văn bản có thể trích xuất (600 từ trung bình). Marketplace dù có nội dung phong phú (3.349 từ, 40,4 H2-H4) nhưng định dạng listing sản phẩm không phù hợp với truy vấn thông tin. Amazon kéo trung bình xuống (12,2% do hạn chế bot), trong khi Target (26,7%) và Etsy (23,0%) hoạt động gần mức trung bình toàn bộ dữ liệu hơn.

5/ Phát hiện 5: Thực tế hai cực của trích dẫn

Phân bổ trích dẫn có tính chất hai cực rõ rệt: các trang hoặc được trích dẫn hoặc không, với rất ít trường hợp ở giữa.

Tỷ lệ trích dẫn trang Số trang % tổng số trang
0% (không bao giờ) 205.334 58,0%
1-10% 1.371 0,4%
11-25% 9.714 2,7%
26-50% 38.208 10,8%
51-75% 10.335 2,9%
76-99% 1.333 0,4%
100% (luôn luôn) 87.504 24,7%

58% trang không bao giờ được trích dẫn trong bất kỳ truy vấn nào mà chúng xuất hiện. 25% được trích dẫn mỗi lần xuất hiện. Chỉ 17% ở giữa.

Tín hiệu nội dung không giải thích được sự phân chia này:

Chỉ số Luôn được trích dẫn Không bao giờ được trích dẫn
Số từ trung bình 2.172 2.365
H2-H4 trung bình 20,3 21,1
Readability (FK) trung bình 12,0 12,2
Danh sách trung bình 11,0 10,6
Bảng trung bình 0,9 0,8
DA trung bình 53,0 55,7

Các hồ sơ gần như giống hệt nhau. Số từ, heading, readability, danh sách, bảng, domain authority đều không phân biệt được trang luôn được trích dẫn với trang không bao giờ được trích dẫn. Yếu tố phân biệt, như đã xác lập, là vị trí tìm kiếm.

Các trang "đôi khi được trích dẫn" kể một câu chuyện:

Chỉ số Luôn trích dẫn Đôi khi Không bao giờ
Số trang 79.273 57.450 182.056
Số truy vấn xuất hiện (trung vị) 1 3 1
Số từ trung bình 2.172 2.573 2.365
H2-H4 trung bình 20,3 23,5 21,1
DA trung bình 53,0 57,8 55,7

Trang "đôi khi được trích dẫn" xuất hiện trong nhiều truy vấn nhất (trung vị 3), có nội dung dài nhất, nhiều heading nhất, và DA cao nhất. Đây chính là các "ultimate guide" và bài tổng hợp toàn diện, và dữ liệu cho thấy chiến lược này tạo ra kết quả kém nhất quán nhất.

Phân bổ hai cực theo loại trang:

Loại trang % Không bao giờ % Luôn luôn % Đôi khi
Wikipedia 25,9% 55,4% 18,8%
Travel Platforms 51,7% 32,1% 16,2%
Education 46,5% 31,5% 22,0%
Reddit 58,4% 29,3% 12,4%
Health Publishers 36,3% 28,6% 35,1%
Bài viết khác 56,2% 24,8% 19,0%
Government 57,0% 24,5% 18,5%
Báo lớn 54,1% 17,8% 28,1%
Marketplace 80,6% 13,5% 5,8%
YouTube 95,9% 1,6% 2,5%

Wikipedia có phân bổ thuận lợi nhất: 55% trang luôn được trích dẫn. Health Publishers có tỷ lệ "đôi khi" cao nhất (35,1%), phản ánh sự cạnh tranh khốc liệt trong không gian truy vấn sức khỏe. Marketplace có phân bổ tệ nhất: 81% không bao giờ được trích dẫn.

6/ Phát hiện 6: Trích dẫn tập trung ở đầu câu trả lời và theo thứ tự vị trí tìm kiếm

Câu trả lời của ChatGPT trích dẫn trung bình 5-7 nguồn. Các trích dẫn tập trung ở phần đầu câu trả lời và tuân theo thứ tự vị trí tìm kiếm.

Vị trí trong câu trả lời % trích dẫn
Phần đầu (1/3 đầu) 40,7%
Phần giữa 34,8%
Phần cuối 24,5%

41% trích dẫn xuất hiện trong phần mở đầu của câu trả lời (trong nghiên cứu trước đó 44,2% trích dẫn ChatGPT đến từ 30% đầu nội dung). Phần cuối chỉ chiếm 25%.

Vị trí tìm kiếm dự báo vị trí trích dẫn trong câu trả lời:

Vị trí tìm kiếm Vị trí trích dẫn trung bình Trung vị
Vị trí 0-2 2,2 2
Từ bộ nhớ huấn luyện (không có trong kết quả tìm kiếm) 3,3 3
Vị trí 3-5 3,9 3
Vị trí 6-10 4,9 5
Vị trí 11+ 6,2 6

Trang xếp hạng 0-2 được trích dẫn ở vị trí 2,2 trung bình. Trang xếp hạng 11+ xuất hiện ở vị trí 6,2. Trang được trích dẫn từ bộ nhớ huấn luyện (không tìm thấy trong kết quả tìm kiếm) xuất hiện sớm (vị trí 3,3), cho thấy ChatGPT xem tham chiếu từ dữ liệu huấn luyện là nguồn có độ tin cậy cao.

Mỗi trang được trích dẫn đúng 1 lần trong mỗi câu trả lời, bất kể coverage subtopic là bao nhiêu. Density không giúp một trang được trích dẫn nhiều lần trong cùng một câu trả lời.

7/ Phát hiện 7: Độ mới nội dung có vai trò, nhưng chỉ khi nội dung đã liên quan

41% trang trong bộ dữ liệu có ngày xuất bản có thể phát hiện được. Trong số đó, tuổi trang có mối quan hệ rõ ràng với tỷ lệ trích dẫn.

Tuổi trang Tỷ lệ trích dẫn Được trích dẫn cả 3 lần
< 30 ngày 25,3% 1,91%
30-89 ngày 32,8% 2,36%
90-179 ngày 32,4% 2,16%
180-364 ngày 31,5% 1,98%
1-2 năm 32,0% 2,14%
2-5 năm 27,5% 1,94%
5+ năm 27,6% 1,80%

Điểm tối ưu là 30-89 ngày tuổi (32,8%). Nội dung rất mới (< 30 ngày) hoạt động kém ở 25,3%, có thể vì trang mới chưa được lập chỉ mục đầy đủ hoặc chưa xây dựng tín hiệu tìm kiếm. Trang trên 2 năm giảm xuống khoảng 27,5%.

Làm mới nội dung

Độ mới theo ngành:

Ngành <30 ngày 30-89 ngày 90-364 ngày 1-2 năm 2-5 năm 5+ năm
SaaS 36,3% 39,3% 38,0% 36,1% 34,7% 28,5%
Finance 46,5% 50,2% 49,1% 39,1% 40,4% 35,1%
E-commerce 24,4% 35,9% 37,3% 37,4% 33,5% 36,7%
Real estate 36,0% 38,3% 44,1% 40,7% 35,2% 36,5%

Finance có tín hiệu độ mới mạnh nhất: 50,2% ở 30-89 ngày, giảm xuống 35,1% ở 5+ năm (khoảng cách 15 điểm phần trăm). Hợp lý với ngành nơi lãi suất, quy định và sản phẩm thay đổi thường xuyên. SaaS đạt đỉnh ở 30-89 ngày (39,3%) và giảm đều xuống 28,5% ở 5+ năm (khoảng cách 11 điểm phần trăm). Nội dung phần mềm lỗi thời nhanh. E-commerce là ngoại lệ: trang 5+ năm (36,7%) hoạt động gần ngang bằng với 30-89 ngày (35,9%). Nội dung sản phẩm evergreen vẫn giữ được giá trị.

Độ mới chỉ có giá trị khi nội dung đã liên quan:

Tuổi trang Heading match cao (0,8+) Heading match trung bình (0,7-0,8) Heading match thấp (< 0,7)
< 1 năm 35,4% 30,9% 25,9%
1-5 năm 31,2% 28,9% 27,2%
5+ năm 31,7% 28,6% 23,9%

Với trang có heading match tốt, nội dung mới hơn có lợi thế 4,2 điểm phần trăm. Với trang có heading match yếu, tuổi trang gần như không có ý nghĩa. Độ mới khuếch đại mức độ liên quan của nội dung, không thay thế cho nó.

8/ Phát hiện 8: ChatGPT trích dẫn từ bộ nhớ huấn luyện

6.371 tổ hợp trang-truy vấn trong bộ dữ liệu được ChatGPT trích dẫn mà không có trang nào xuất hiện trong bất kỳ kết quả tìm kiếm nào cho truy vấn đó. Đây là trang mà ChatGPT tham chiếu từ dữ liệu huấn luyện.

Loại trang Số trang %
Domain khác 1.363 79,5%
Reddit 190 11,1%
Health Publishers 57 3,3%
Báo lớn 42 2,4%
Wikipedia 37 2,2%
Education 14 0,8%
Government 12 0,7%

Reddit là nguồn trích dẫn từ bộ nhớ lớn nhất có thể xác định (11,1%), tiếp theo là health publishers và báo. Phần lớn (79,5%) đến từ các domain khác. Domain cá nhân hàng đầu: Reddit (190 trang), Wikipedia (37), Forbes (32), Healthline (25), Tom's Hardware (22).

Trang được trích dẫn từ bộ nhớ trông giống hệt trang được trích dẫn từ tìm kiếm:

Chỉ số Trích dẫn từ bộ nhớ Trích dẫn từ tìm kiếm
Số từ trung bình 2.418 2.518
H2-H4 trung bình 22,8 22,7
DA trung bình 59,1 58,0
Heading match trung bình 0,748 0,747

Hồ sơ nội dung gần như giống hệt nhau. ChatGPT không áp dụng tiêu chuẩn chất lượng khác cho trích dẫn từ bộ nhớ so với trích dẫn từ tìm kiếm. Trích dẫn từ bộ nhớ xuất hiện ở vị trí 3,3 trong câu trả lời trung bình, sớm hơn hầu hết trích dẫn từ tìm kiếm.

9/ Kết luận: Hàm ý cho chiến lược AI visibility

  1. Khả năng được tìm thấy là ưu tiên đầu tiên. Nếu ChatGPT không tìm thấy trang trong kết quả tìm kiếm web của nó, không có gì khác quan trọng. Vị trí tìm kiếm là yếu tố dự báo trích dẫn mạnh nhất (58% ở vị trí 0 so với 14% ở vị trí 10). Tối ưu hóa cho AEO bắt đầu bằng việc có thể được tìm thấy bởi hệ thống tìm kiếm.

  2. Query match thắng chiều rộng. Khớp truy vấn trực tiếp trong heading. Bài 800 từ tập trung thắng bài hướng dẫn 5.000 từ. Khi heading match tốt, bao phủ subtopic vừa phải (26-50%) vượt trội bao phủ toàn diện (100%). Viết nội dung là câu trả lời tốt nhất cho một câu hỏi cụ thể.

  3. Cấu trúc hỗ trợ nhưng không cứu vãn. Dùng 4-10 H2-H4 subheading cho bài viết (tối ưu khác nhau theo loại trang; trang sản phẩm hoạt động tốt nhất với ít hoặc không có subheading). Thêm danh sách và bảng khi phù hợp. Thêm JSON-LD schema markup. Viết ở cấp FK 14-17. Các tín hiệu cấu trúc thêm 2-6 điểm phần trăm nhưng không thể bù đắp vị trí tìm kiếm kém hay heading match yếu.

  4. Đánh giá lại thẩm quyền như một thước đo. Domain authority và backlink không dự báo AI citation. Nhóm DA thấp nhất hoạt động ngang bằng nhóm DA cao nhất ở mọi mức độ liên quan. Hãy đánh giá chiến lược AEO dựa trên chất lượng nội dung, không phải hồ sơ backlink.

  5. Chiến lược Wikipedia chỉ hoạt động ở quy mô Wikipedia. Density kiểu Wikipedia là tín hiệu thực sự, nhưng đòi hỏi bao phủ bách khoa: 4.000+ từ, hàng chục danh sách, nhiều bảng, xử lý chủ đề toàn diện. Không có loại trang nào khác tái tạo được mô hình này. Với hầu hết nhà xuất bản, chiến lược tốt hơn là trở thành câu trả lời được tìm thấy tốt, khớp tốt, có cấu trúc tốt cho một truy vấn cụ thể.

  6. Độ mới là đòn bẩy cần khai thác. Trang 30-89 ngày tuổi đạt tỷ lệ trích dẫn cao nhất (32,8%). Nội dung rất mới (< 30 ngày) hoạt động kém (25,3%), có thể vì trang mới chưa xây dựng tín hiệu tìm kiếm. Trang trên 2 năm giảm xuống 27,5%. Tác động của độ mới mạnh nhất khi heading match đã tốt (+4,2 điểm phần trăm cho trang dưới 1 năm so với 1-5 năm). Với nội dung liên quan đang lỗi thời qua 2 năm, làm mới là cơ hội tăng 5 điểm phần trăm đang chờ.

Phương pháp nghiên cứu

Nghiên cứu sử dụng giao diện người dùng của ChatGPT, không phải API, để thu thập dữ liệu phản ánh đúng hành vi thực tế của người dùng thông thường.

Quy mô: 16.851 truy vấn riêng biệt trên 10 danh mục (Publishing, E-commerce, Travel, Health, SaaS, Real Estate, Finance, Legal, Marketing, Business Services) và 4 loại intent (commercial, informational, transactional, local).

Quy trình: Mỗi truy vấn được gửi cho ChatGPT 3 lần riêng biệt. Với mỗi lần chạy, hệ thống thu thập toàn bộ câu trả lời, mọi query fan-out mà ChatGPT tự tạo ra để tìm kiếm thông tin, mọi URL được trả về và URL được trích dẫn trong câu trả lời, cùng toàn bộ nội dung HTML của mỗi trang ChatGPT truy xuất.

Chỉ số Số liệu
Truy vấn riêng biệt 16.851
Câu trả lời ChatGPT (truy vấn × 3 lần) 50.553
Trang web được thu thập 353.799
Dòng dữ liệu đánh giá coverage 815.484
Dòng chi tiết fan-out 1.511.251

Fan-out behavior: 88,6% truy vấn tạo ra đúng 2 fan-out sub-query. Chỉ 8,8% không tạo fan-out (thường là truy vấn sản phẩm đơn giản hoặc thực thể cụ thể), và 2,5% tạo 4 sub-query trở lên (thường là truy vấn so sánh phức tạp).

Nguồn: Infinity - đơn vị cung cấp giải pháp Digital Marketing tích hợp cho doanh nghiệp — từ thiết kế website chuẩn SEO & UX/UI, dịch vụ AI SEO (GEO/AEO), PR Digital, sáng tạo nội dung số, quảng cáo trực tuyến (SEM/Ads) đến phân tích dữ liệu Marketing. Với nền tảng nghiên cứu và dữ liệu thực chiến, chúng tôi giúp doanh nghiệp xây dựng chiến lược thương hiệu bền vững và tăng trưởng có hệ thống trong kỷ nguyên AI.


All rights reserved

Viblo
Hãy đăng ký một tài khoản Viblo để nhận được nhiều bài viết thú vị hơn.
Đăng kí