================================================================================ RECHERCHE: Guide-Generierungskette erweitern Ziel: Lernen ohne Angst vor (a) Falschem, (b) fehlenden Infos, (c) nervigem Aufbau, (d) Überforderung durch Struktur/Auswahl/Lesbarkeit. Bestehende Kette: Auswahl → Gliederung → Inhalte → Inhalts-Check → Writer → Lese-Check. ================================================================================ ## META-ERKENNTNIS (gilt übergreifend) - "Mehr gleiche Agenten" sättigt früh und erzeugt Echo-Kammer: identische Modelle teilen dieselben systematischen Fehler. Voting/Debatte schlagen Single-Agent nur moderat und nicht zuverlässig besser als Self-Consistency. - Echte Hebel: HETEROGENITÄT (andere Modelle), EXTERNE ERDUNG (Quellen/Tools/Websuche), ROLLEN-TRENNUNG, GATES zwischen Stufen. - Selbst-Korrektur OHNE externes Feedback verbessert Faktualität kaum, kann verschlechtern (CommonSenseQA 75,8 → 38,1 nach 1 Runde). Nur MIT Quelle/Tool/Oracle einsetzen. - ~41,8 % der Multi-Agent-Fehler sind System-/Spezifikations-Design, nicht Modell-Fähigkeit (MAST). → Architektur (Rollen, Gates, Stopp-Logik) ist der größte Hebel. ================================================================================ A) GEGEN FALSCHES (faktische Korrektheit) ================================================================================ 1. RAG / Grounding gegen verlässliche Quellen — stärkster Hebel gegen erfundene Fakten. Generierung auf abgerufene Quell-Passagen beschränken. (Inhalte/Prüfen) 2. Zitat-Pflicht + Attribution: jeder Fakt braucht Inline-Quelle; gilt nur als belegt, wenn aus dem Zitat ableitbar. Macht Fehler sichtbar/prüfbar. (Schreiben/Prüfen) 3. Claim-Extraktion + Verifikation (FActScore-Stil): Text in atomare Fakten zerlegen, jeden einzeln gegen Quelle prüfen. Fängt einzelne falsche Sätze. (Prüfen) 4. SAFE (Search-Augmented Factuality Evaluator): Claims zerlegen → pro Claim Websuche → per Reasoning prüfen. Übertrifft menschliche Annotatoren, ~20x billiger. Ideal, da Websuche schon vorhanden. (Prüfen) 5. Abstention bei Unsicherheit: unbelegte/inkonsistente Fakten weglassen oder markieren statt raten. Tauscht Coverage gegen Korrektheit — für Lerninhalte oft richtig. 6. Chain-of-Verification (CoVe): Entwurf → Verifikationsfragen → einzeln beantworten → revidieren. Günstig (reines Prompting). (Prüfen, pro Baustein) 7. Self-Consistency: mehrere Pfade samplen, Mehrheit wählen. Nur für Varianz-Reduktion, NICHT für Wahrheit (systematische Fehler bleiben). Sweet Spot 10–20 Samples. 8. Post-hoc Revision (RARR): fertigen Text nehmen, pro Claim Evidenz suchen, widersprechende Claims editieren, Originaltext maximal erhalten. (zwischen Schreiben und Lesbarkeit) 9. Stärkerer Verifier statt mehr gleicher Agenten: generieren günstig, verifizieren mit stärkerem/anderem Modell. Lohnt bei schwierigen/seltenen Fakten. (Prüfen) 10. Self-Refine/Reflexion NUR mit externem Feedback (Tool/Quelle). Intrinsisch verschlechtert. Quellen A: - SAFE / Long-form Factuality: https://openreview.net/pdf?id=4M9f8VMt2C - FActScore (Primer): https://aman.ai/primers/ai/factuality-in-LLMs/ - Chain-of-Verification: https://arxiv.org/pdf/2309.11495 - Grounded Attribution + Refuse: https://arxiv.org/pdf/2409.11242 - Self-Correction braucht externes Feedback: https://arxiv.org/abs/2310.01798 - When Can LLMs Self-Correct (TACL): https://direct.mit.edu/tacl/article/doi/10.1162/tacl_a_00713/125177/ - RARR: https://aclanthology.org/2023.acl-long.910/ - Weaver / Generation-Verification-Gap: https://arxiv.org/pdf/2506.18203 - Abstention-Survey: https://direct.mit.edu/tacl/article/doi/10.1162/tacl_a_00754/131566/ ================================================================================ B) GEGEN LÜCKEN (Vollständigkeit) ================================================================================ 1. Backward Design (Stufe 0): zuerst Lernziele definieren, DANN Inhalt generieren. 3 Schichten: "familiar with" / "important to know" / "enduring understanding". 2. Lernziele explizit als Anker-Liste (Bloom-Verben). Jeder Abschnitt wird genau einem Lernziel zugeordnet. Ziel ohne Inhalt = Lücke; Inhalt ohne Ziel = Ballast. 3. Curriculum-Mapping / Alignment-Matrix (Lernziel × Abschnitt × Assessment) als eigene Stufe: prüft Abdeckung, Doppelungen, hängende Ziele gleichzeitig. 4. "What's missing"-Critic-Agent: bekommt Thema + Guide + Referenzfakten, sucht NUR fehlende korrekte Punkte, bessert minimal nach. Discrimination von Revision trennen. 5. "Das Wichtige" verlässlich via Mehrquellen-Konsens (Triangulation): Standard-Curricula + mehrere unabhängige Quellen (Schnittmenge = Kern) + LLM-Delphi (Konsens-Topics). Quellen B: - Backward Design: https://fctl.ucf.edu/teaching-resources/course-design/backward-design/ - Understanding by Design: https://en.wikipedia.org/wiki/Understanding_by_Design - GPT-4 Learning Objectives: https://arxiv.org/pdf/2306.17459 - Curriculum Mapping: https://pce.sandiego.edu/curriculum-mapping/ - Critique-Guided Improvement: https://arxiv.org/pdf/2503.16024 - Delphi-Konsens (PMC): https://pmc.ncbi.nlm.nih.gov/articles/PMC8178515/ ================================================================================ C) GEGEN ÜBERFORDERUNG (Struktur, Reihenfolge, Lesbarkeit) ================================================================================ 1. Prerequisite-/Concept-Dependency-Graph: Konzepte = Knoten, "X braucht Y" = Kante. Topologische Sortierung → gültige Reihenfolge (Basics zuerst). LLM extrahiert Kanten, Zyklus-Check. Knoten mit vielen ausgehenden Kanten = Kernkonzepte, früh. 2. Knowledge-Space-Theorie (Doignon/Falmagne, ALEKS): erlaubte Wissenszustände statt fixer Linie. Validiert Reihenfolge, schließt unmögliche Pfade aus. 3. Bloom-Progression: Remember → Understand → Apply → Analyze → Evaluate → Create. Jeden Abschnitt taggen, monotone Progression prüfen. 4. Cognitive Load GLOBAL budgetieren (nicht nur pro Abschnitt): Working Memory ~4–7 Einheiten. Neue Konzepte/Abschnitt begrenzen, Spitzen glätten, schwer/leicht abwechseln. 5. Chunking + einfach→komplex: Teilfertigkeiten zuerst, dann zusammensetzen. Lange Abschnitte automatisch splitten (Max-Chunk-Regel). 6. Scaffolding mit Fading: anfangs viele Worked Examples, Stütze schrittweise zurücknehmen. Achtung Expertise-Reversal: was Novizen hilft, bremst Fortgeschrittene. 7. Diátaxis-Struktur: Tutorial / How-to / Reference / Explanation NICHT mischen (häufigste Ursache verwirrender Doku). Für Lern-Guide: Tutorial + Explanation trennen. 8. Spiral-Curriculum + Spaced Retrieval: Kernideen wiederkehren lassen, aktives Abrufen. + Lesbarkeit (frühere Recherche): Ø-Satz ≤ 20 W, keiner > 40; ≤ ~4 neue Begriffe/Abschnitt; eine Idee pro Absatz; Listen statt Aufzählungssätze. Quellen C: - Concept Graph (CMU): https://www.cs.cmu.edu/~hanxiaol/publications/yang-wsdm15.pdf - Prerequisite Relations (AAAI): https://ojs.aaai.org/index.php/AAAI/article/view/10550 - Knowledge Spaces / ALEKS: https://www.aleks.com/about_aleks/Science_Behind_ALEKS.pdf - Cognitive Load Strategien: https://www.structural-learning.com/post/cognitive-load-theory-a-teachers-guide - Expertise Reversal: https://en.wikipedia.org/wiki/Expertise_reversal_effect - Diátaxis: https://diataxis.fr/start-here/ - Spiral Curriculum: https://www.structural-learning.com/post/the-spiral-curriculum-a-teachers-guide ================================================================================ D) ARCHITEKTUR-METHODEN (Pipeline-Qualität) ================================================================================ 1. Generator–Critic-Loop NUR mit externer Erdung (Self-Refine ~+20 % bei offenen Aufgaben; intrinsisch ohne Signal verschlechtert). Für Faktenprüfung Tool-Erdung (CRITIC). 2. Stopp-Kriterien: fast alle Gewinne in Runde 1–2. Stoppen bei Stabilität/Score-Delta<1/ Draft-Ähnlichkeit>0,90. Bestes Draft per Validierung wählen, nicht das letzte. 3. Rollen-Spezialisierung statt Klone: Faktenprüfer ≠ Didaktiker ≠ Lektor ≠ Zielgruppen- Anwalt. Erlaubt kleinere/billigere Modelle pro Teilschritt. 4. Heterogenität ist der Wirkstoff von Debatte: Gewinn kommt aus VERSCHIEDENEN Modellen, nicht aus dem Mechanismus. Identische Modelle ≈ Self-Consistency, nur teurer. 5. LLM-as-Judge mit Rubrik, BINÄR (pass/fail) statt 1–5; Multi-Kriterien getrennt; vage Begriffe definieren; niedrige Temperatur; gegen 1 Experten kalibrieren. 6. Eval-Harness + Regression-Evals (CI-Gate): Golden-Set (25–50 Fälle reichen anfangs), wächst mit jedem Produktionsfehler. PR/Release blockt unter Schwelle. 7. Diminishing Returns: Voting Sweet Spot 10–20 Samples; Debatte-Plateau ~3 Runden; bei sequentiellen Aufgaben degradiert jede Multi-Agent-Variante um 39–70 %. 8. Fehler-Akkumulation: 95 %/Schritt × 10 = 59 %; 90 % → 35 %. Verifier-Gate ZWISCHEN die Stufen; zentrale Koordination begrenzt Verstärkung (4,4x statt 17,2x). 9. Pitfall Sycophancy/Konsens-Bias: Modelle stimmen zu (~42–58 %); Peer-Druck-Flip ~48 %. Fix STRUKTURELL: Mehrheit klein halten (6→3 Agenten senkt Konformität 70 %→33 %), isolierte Selbstkorrektur vor Konsens. Prompt-Nudges ("sei standhaft") wirken NICHT. 10. Pitfall Self-Preference: Judge bevorzugt eigene Outputs (GPT-4 ~+10 %, Claude ~+25 %). Fix: Judge ≠ Generator-Modell (Cross-Model-Judging), Positionen tauschen+mitteln. 11. Human-in-the-Loop kalibrierend, NICHT als blindes Reward (OpenAI GPT-4o-Sycophancy- Vorfall April 2025 durch Thumbs-up/down). Experten-Review-Gate behalten. 12. MAST-Failure-Taxonomie als Architektur-Checkliste (System-Design / Inter-Agent / Verification-Termination). Quellen D: - Self-Refine: https://arxiv.org/pdf/2303.17651 - CRITIC: https://arxiv.org/abs/2305.11738 - Multiagent Debate: https://arxiv.org/abs/2305.14325 ; Stop Overvaluing: https://arxiv.org/pdf/2502.08788 - LLM-as-Judge (MT-Bench): https://arxiv.org/abs/2306.05685 ; G-Eval: https://aclanthology.org/2023.emnlp-main.153/ - Eval-Prozess (Hamel): https://hamel.dev/blog/posts/llm-judge/ - Google Scaling Agent Systems: https://research.google/blog/towards-a-science-of-scaling-agent-systems-when-and-why-agent-systems-work/ - Sycophancy: https://arxiv.org/abs/2310.13548 ; Conformity: https://arxiv.org/abs/2505.21588 - MAST: https://arxiv.org/abs/2503.13657 - OpenAI Sycophancy-Postmortem: https://venturebeat.com/ai/openai-rolls-back-chatgpts-sycophancy-and-explains-what-went-wrong ================================================================================ EMPFOHLENE NÄCHSTE STUFEN FÜR UNSERE KETTE (priorisiert, größter Nutzen/Aufwand) ================================================================================ 0. (Stufe ganz vorn) Lernziele definieren (Backward Design) + "das Wichtige" via Mehrquellen-Konsens → ankert Auswahl UND Vollständigkeit. 1. Reihenfolge: Prerequisite-Graph + topologische Sortierung in/nach der Gliederung (Basics zuerst, keine Vorgriffe). 2. Faktencheck-Gate (SAFE/CoVe) in der Inhalts-Prüfung — nutzt vorhandene Websuche; Verifier = anderes/stärkeres Modell, BINÄRE Urteile. 3. Abstention: unbelegte Fakten raus/markieren. 4. Coverage-/"Was-fehlt"-Critic + Lernziel↔Inhalt-Mapping als Schluss-Gate (zurück bei Lücken). 5. Cognitive-Load-Pass über den ganzen Guide (neue Begriffe/Abschnitt begrenzen, schwer/leicht mischen). 6. Architektur-Hygiene: Gate zwischen jeder Stufe (Judge ≠ Generator), Loops nach 1–2 Runden stoppen, Voting 10–20 Samples, kleine Mehrheiten (Konsens-Bias), Golden-Set-Regression-Evals. WARNUNG: NICHT auf "mehr gleiche Agenten" setzen. Heterogenität + externe Erdung + Gates.