חיפוש AI ו-GEO
למה רוב הדאטה המקורי לעולם לא מצוטט
מחקר ראשוני הוא נדיר, אבל מייצר פי 3.3 יותר ציטוטי AI לעמוד. למדו למה benchmark studies מנצחים דאטה מקורי אחר.
פתיחה
חלק 1 התמודד עם חשיבות אותות הציטוט של צד שלישי, בעוד שחלק 2 הציג טיעון לפרסום מידע מקורי: זהו הקריטריון החזק ביותר של מקוריות עמוד, והסיכוי להשגת נראות/סמכות דרך המהלך הזה נמוך.
זה מוסיף אלמנט תמיכה נוסף לשימוש שלכם במידע מקורי ביצירת תוכן.
פרסום מספרים הוא הכרחי. אבל זה לא תמיד מה שמצוטט. משכנו את נתוני הציטוט של Gauge כדי לגלות מה AI באמת מתגמל כשמדובר בפרסום מידע מקורי, והתשובה פשוטה יותר מ-"מידע מקורי מנצח" (למרות שמידע מקורי כן - למעשה, מנצח).
AI מתגמל פורמט אחד יותר מכל השאר כמעט באופן בלעדי: המחקר ההשוואתי שעונה על 'מי הכי טוב'.
מחקר מקורי הוא נדיר ובעל משקל כבד
עבדנו על ה-URL-ים המצוטטים של Gauge: דפים חיים (301 דפים) שמערכות AI ציטטו (316 פרומפטים ייחודיים על פני 7 תחומי פעילות), שמכילים ביחד 1,075 ציטוטים.
אחרי סקירה מלאה של URL-ים, רק 8 מתוך 301 הדפים עמדו בקריטריון של מחקר ראשוני - כלומר מקור המידע והמתודולוגיה המקוריים נמצאים בעמוד, ולא שכתוב מספרים ממקור אחר.
שמונה עמודים מתוך 301 זה 2.7%. אותם 8 עמודים הפיקו 90 מתוך 1,075 ציטוטים, או 8.4% מנפח הציטוטים. מחקר עצמאי מופיע לעיתים נדירות, ואז מאונדקס פי 3 על חלק מהציטוטים כשהוא כן מופיע.
הדרך הבורה יותר לראות את זה היא צפיפות.
מחקר ראשוני קיבל בממוצע 11.3 ציטוטים לעמוד. כל השאר קיבלו 3.4. עמוד מחקר ראשוני היה צפוף פי 3.3 בציטוטים מעמוד שאינו מקורי.
מחקר ראשוני מצטבר לציטוטים.
זו אותה צורה כמו ממצא המידע החדש שדובר עליו בחלק 2, המידע החדש נצפה על ידי ה-AI במקום 10 הקישורים הכחולים הקלאסיים.
שם, מידע מקורי היה בקורלציה עם מקוריות עמוד יותר מכל תכונה אחרת. כאן, מידע מקורי הוא בקורלציה עם צפיפות הציטוטים. שניהם מצביעים לאותו כיוון: המספר שרק אתם יכולים לייצר משפיע.
מחקר מקורי מנצח כשלשאלה יש יכולת השוואה
כאן הפילטר של 'מידע מקורי מנצח' הופך לחד יותר.
90 הציטוטים של מחקר ראשוני לא מפוזרים שווה בשווה על 8 העמודים, והם לא מפוזרים שווה בשווה בכיסוי נושאים.
75 מתוך 90 הגיעו מקלאסטר אחד: cloud data warehouses benchmarks. ה-Fivetran's warehouse benchmark לבדו לקח 44 ציטוטים - קצת פחות ממחצית מכל ציטוטי המחקר הראשוני (עוד על זה למטה).
אם מוציאים את קלאסטר ה-benchmark, מחקר עצמאי בקושי נרשם בסט הציטוטים. אז - 'פרסמנו מידע מקורי' לא מנצח.
הניצחון הוא 'פרסמנו benchmark שעונה על השוואת קנייה', וכמעט אף אחד לא בונה benchmark כזה. ('Benchmark' פירושו שאתם מודדים סט של ישויות בשם זו מול זו על מדד מוגדר, ומפרסמים את התוצאות כמספרים).
מחקר מקורי יעיל ביותר כשהוא מוגדר בצורה שיכולה לענות ישירות על שאילתות השוואה מסחריות.
זה מה שגוגל מחפש בתוכן non-commodity: מידע חדש ומועיל שקשה להשיג.
ציטוטים ממחקר ראשוני התקבצו במקום שהפרומפט ביקש מ-AI להשוות אפשרויות על מפרטים מדידים: מהירות, עלות, זמן תגובה, תפוקה או ביצועים.
זה מסביר את העליה החדה של warehouse benchmark. התווית 'HR Tech / Compensation' רועשת, אבל הציטוטים בתוך ה-bucket הזה בעיקר הגיעו מפרומפטים של benchmark cloud data warehouse. ל-Fivetran, Estuary ו-ClickHouse היו מספרים ש-AI יכול היה להשתמש בהם.
Crypto / Solana מראה את אותו דפוס בקנה מידה קטן יותר. Marinade ו-Helius הרוויחו ציטוטים כי שאלות staking ו-MEV צריכות מידע עצמאי מהאקוסיסטם, לא הסברים גנריים.
הדפוס נעלם בנושאים בלי יכולת השוואה ברורה. B2B SaaS / CRM, Education / TEFL ו-Product Analytics החזירו רשימות, דפי מוצר, הסברים ו-case studies. אף אחד מהנושאים האלה לא ייצר עמוד מחקר ראשוני שצוטט.
מבט מקרוב על התוכן שהחזיר 44 מהציטוטים
השוואה של ה-warehouse של Fivetran ייצג 44 ציטוטים בסט, ו-2 דפי השוואה של Fivetran יחד ייצגו 58 מתוך 90 ציטוטי המחקר הראשוני בסט. למה?
זה תוכן מ-2022, אבל כשבוחנים אותו, קל לראות למה LLM-ים מעדיפים אותו.
- הוא עונה על השוואת המדידה באופן ישיר. Warehouses בשמות - BigQuery, Redshift, Snowflake ו-Databricks - מדורגים על פי מהירות ועלות. הוא entity-rich ולא מפחד לציין את כל השחקנים הגדולים.
- הוא רץ על מידע עצמאי אמיתי. Fivetran בדק מול שימוש אמיתי של לקוחות ולא על פי הנחות סינתטיות, וציין את הבחירה הזו ישירות.
- הוא מראה את השיטה, שלב אחר שלב. אותות אמון. סעיפים נפרדים עוברים על איזה מידע שאלו, אילו שאילתות הריצו, ואיך קינפגו וכיוונו כל warehouse. הקורא (או המודל) יכול לראות בדיוק איך הופקו המספרים.
- המבנה בנוי להיות lifted. כותרות תיאוריות ('Results', 'How much did performance improve?', 'Why are our results different from previous benchmarks?') מאפשרות ל-AI למפות שאלה לתשובה בפסקה אחת.
- הוא מקשר למידע הגולמי ולמקורות. העמוד מייצר הערות מהמקורות שלו, כולל C-Store paper, ומצביע על המידע הבסיסי כך שכל טענה ניתנת לאימות. לא הרבה מותגים משקיעים כל כך הרבה עבודה בתוכן מבוסס דאטה, ובוודאי לא חושפים את הדאטהסט המלא למען השקיפות.
- הוא מראה את התפרים. הערות תיקון מתאריך דצמבר 2022, חסמי איכות והסתייגות כנה של 'performance floor' הופכים את הטענות הכמותיות לאמינות יותר - לא פחות. הם גם מציינים תיקונים.
- ה-URL לא זז. עמוד מ-2022 עדיין אוסף ציטוטים ב-2026 כי הוא נשאר בכתובת קנונית אחת.
המידע קל לשליפה - ה-craft הוא ה-moat
הדאטה מאחורי עמוד כזה קל יותר לשליפה וניתוח מאי פעם. מה שלא קל: השיטה הנקייה, המקורות המקושרים, התיקונים, מבנה הניווט, הנכונות לציין מה המספרים לא מוכיחים. זה craft, וזה ה-moat כאן.
החלק שממוקד מידע עצמאי הוא לא הצהרות לעיתונות שלא מסתמכות על מידע מנכסים, והוא מחזיק במוניטין כבר 4 שנים. המסקנה: AI לא מתגמל 'מידע מקורי' כברירת מחדל. הוא מתגמל מחקר עצמאי כשהעמוד נותן תשובה ברורה להשוואה מדידה אם היא מסמנת עומק, מומחיות ואמון.
ההזדמנות כאן היא לפרסם מקורות אחזור לשאלת הקונה כאשר ל-AI אין כרגע מקור השוואה נקי. זה מעיד על ממצא unanswered-questions מחלק 2: הדלת הפתוחה קיימת, ובתחומים האלה אף אחד לא עבר דרכה עם דאטהסט אמיתי.
דאטה מקורי צריך מאגר מוכן לציטוט
דאטה מקורי נותן לעמוד משהו ש-AI לא יכול לקבל ממקור הסבר אחר. אבל ה-AI עדיין צריך לאחזר אותו, לפרסר אותו, ולמפות אותו לשאלה.
בתהליך הזה הרבה מותגים מאבדים את הציטוט. הם מפרסמים מספרים ייחודיים, אבל קוברים אותם בנרטיב, שמים אותם מאחורי טופס, מעבירים את ה-URL, או מדלגים על המתודולוגיה. המידע קיים. הציטוט לא.
העמודים שניצחו בדאטהסט הזה היו להם שניהם: מספרים מקוריים וצורת ציטוט נקייה. URL יציב. שיטה ברורה. השוואה בשם. תוצאות שענו ישירות על שאלת קנייה.
- מי מנצח: מותגים שיושבים על דאטה מקורי של מוצר, שימוש או תמחור, ואורזים אותו להשוואה שקונה יכול להבין לפעול לפיה - כזו שמאפשרת ל-LLM להפוך תוצאות להמלצות.
- מי מפסיד: מותגים שמפרסמים מספרים מקוריים קבורים בנרטיב, בעמודים איטיים או לא יציבים, בלי יכולת השוואה ש-AI יכול להשתמש בה.
- להוביל עם תוצאת ההשוואה - הממצא המרכזי ('X הכי מהיר, Y הכי זול ב-scale') ב-30% העליונים של העמוד. תוצאה, אחר כך שיטה, אחר כך ניואנס.
- להגדיר את המתודולוגיה - דגימה, חלון זמן, מה נמדד, איך. Attribution confidence הוא חלק ממה שהופך מספר לכזה עם יכולת להיות מצוטט. הפכו את המתודולוגיה לברורה בעמוד.
- להגדיר ספציפית כהשוואה אם זו השוואה. AI מגיע להשוואה בפרומפטים של 'מי הכי טוב'. טבלה שמשווה אפשרויות על מפרטים.
- שמירה על יציבות ה-URL - עמוד קנוני אחד, live, לא URL ששונה לו השם או שהועבר לכתובת אחרת בכל עיצוב חדש. הציטוט שתרוויחו ברבעון הזה מתחזק רק אם העמוד עדיין שם ברבעון הבא. מתוך 365 URL-ים שצוטטו בדאטהסט הזה - 64 היו מתים, שבורים או מנותבים, ו-203 ציטוטים נפלו איתם.
זה העבודה מאחורי השוואות מצוטטות
זו העבודה מאחורי השוואות מצוטטות והיא מורכבת יותר ממה שנראה.
HockeyStack תיעדו את הגרסה שלהם ב-playbook על השקת דוחות מחקר: הם פרסמו 18 דוחות מקוריים שנבנו לחלוטין על מידע עצמאי אנונימי של לקוחות - הסוג שאף מתחרה לא יכול לשכפל.
התהליך שלהם מציין כל שלב שהעמוד של Fivetran מציג: הצגת נקודות המידע החיוניות, משיכה ב-SQL, הגדרה ותיעוד השיטה כדי שהמספרים יעמדו בביקורת, ואז בניית הדוח סביב שאלת ICP אמיתית. הם קוראים למתודולוגיה לא ניתנת למו"מ וזה לא סתם - בלי זה, מישהו תמיד יערער על המידע שלכם.
עם ניתוח AI, המידע הוא החלק הקל. לבנות את התוכן למשהו שניתן לציטוט, שמדגים E-E-A-T, ועדיין מרוויח נראות 4 שנים אחר כך לשאילתות מסחריות - שם העבודה הקשה.
אילו אתרים כבר מוכרים וניתנים להסתמכות עבור הנושא שלכם? כשההשוואה שלא פרסמתם לוקחת את הציטוטים בקטגוריה שלכם, Citation Source Mapper ממפה את ה-trusted set לרשימת מטרות מדורגת שניתן לכוונון. זה יהיה ב-premium library.