Files
creator/recherche.txt
2026-06-17 19:59:06 +02:00

168 lines
12 KiB
Plaintext
Raw Blame History

This file contains ambiguous Unicode characters
This file contains Unicode characters that might be confused with other characters. If you think that this is intentional, you can safely ignore this warning. Use the Escape button to reveal them.
================================================================================
RECHERCHE: Guide-Generierungskette erweitern
Ziel: Lernen ohne Angst vor (a) Falschem, (b) fehlenden Infos,
(c) nervigem Aufbau, (d) Überforderung durch Struktur/Auswahl/Lesbarkeit.
Bestehende Kette: Auswahl → Gliederung → Inhalte → Inhalts-Check → Writer → Lese-Check.
================================================================================
## META-ERKENNTNIS (gilt übergreifend)
- "Mehr gleiche Agenten" sättigt früh und erzeugt Echo-Kammer: identische Modelle
teilen dieselben systematischen Fehler. Voting/Debatte schlagen Single-Agent nur
moderat und nicht zuverlässig besser als Self-Consistency.
- Echte Hebel: HETEROGENITÄT (andere Modelle), EXTERNE ERDUNG (Quellen/Tools/Websuche),
ROLLEN-TRENNUNG, GATES zwischen Stufen.
- Selbst-Korrektur OHNE externes Feedback verbessert Faktualität kaum, kann verschlechtern
(CommonSenseQA 75,8 → 38,1 nach 1 Runde). Nur MIT Quelle/Tool/Oracle einsetzen.
- ~41,8 % der Multi-Agent-Fehler sind System-/Spezifikations-Design, nicht Modell-Fähigkeit
(MAST). → Architektur (Rollen, Gates, Stopp-Logik) ist der größte Hebel.
================================================================================
A) GEGEN FALSCHES (faktische Korrektheit)
================================================================================
1. RAG / Grounding gegen verlässliche Quellen — stärkster Hebel gegen erfundene Fakten.
Generierung auf abgerufene Quell-Passagen beschränken. (Inhalte/Prüfen)
2. Zitat-Pflicht + Attribution: jeder Fakt braucht Inline-Quelle; gilt nur als belegt,
wenn aus dem Zitat ableitbar. Macht Fehler sichtbar/prüfbar. (Schreiben/Prüfen)
3. Claim-Extraktion + Verifikation (FActScore-Stil): Text in atomare Fakten zerlegen,
jeden einzeln gegen Quelle prüfen. Fängt einzelne falsche Sätze. (Prüfen)
4. SAFE (Search-Augmented Factuality Evaluator): Claims zerlegen → pro Claim Websuche →
per Reasoning prüfen. Übertrifft menschliche Annotatoren, ~20x billiger.
Ideal, da Websuche schon vorhanden. (Prüfen)
5. Abstention bei Unsicherheit: unbelegte/inkonsistente Fakten weglassen oder markieren
statt raten. Tauscht Coverage gegen Korrektheit — für Lerninhalte oft richtig.
6. Chain-of-Verification (CoVe): Entwurf → Verifikationsfragen → einzeln beantworten →
revidieren. Günstig (reines Prompting). (Prüfen, pro Baustein)
7. Self-Consistency: mehrere Pfade samplen, Mehrheit wählen. Nur für Varianz-Reduktion,
NICHT für Wahrheit (systematische Fehler bleiben). Sweet Spot 1020 Samples.
8. Post-hoc Revision (RARR): fertigen Text nehmen, pro Claim Evidenz suchen, widersprechende
Claims editieren, Originaltext maximal erhalten. (zwischen Schreiben und Lesbarkeit)
9. Stärkerer Verifier statt mehr gleicher Agenten: generieren günstig, verifizieren mit
stärkerem/anderem Modell. Lohnt bei schwierigen/seltenen Fakten. (Prüfen)
10. Self-Refine/Reflexion NUR mit externem Feedback (Tool/Quelle). Intrinsisch verschlechtert.
Quellen A:
- SAFE / Long-form Factuality: https://openreview.net/pdf?id=4M9f8VMt2C
- FActScore (Primer): https://aman.ai/primers/ai/factuality-in-LLMs/
- Chain-of-Verification: https://arxiv.org/pdf/2309.11495
- Grounded Attribution + Refuse: https://arxiv.org/pdf/2409.11242
- Self-Correction braucht externes Feedback: https://arxiv.org/abs/2310.01798
- When Can LLMs Self-Correct (TACL): https://direct.mit.edu/tacl/article/doi/10.1162/tacl_a_00713/125177/
- RARR: https://aclanthology.org/2023.acl-long.910/
- Weaver / Generation-Verification-Gap: https://arxiv.org/pdf/2506.18203
- Abstention-Survey: https://direct.mit.edu/tacl/article/doi/10.1162/tacl_a_00754/131566/
================================================================================
B) GEGEN LÜCKEN (Vollständigkeit)
================================================================================
1. Backward Design (Stufe 0): zuerst Lernziele definieren, DANN Inhalt generieren.
3 Schichten: "familiar with" / "important to know" / "enduring understanding".
2. Lernziele explizit als Anker-Liste (Bloom-Verben). Jeder Abschnitt wird genau einem
Lernziel zugeordnet. Ziel ohne Inhalt = Lücke; Inhalt ohne Ziel = Ballast.
3. Curriculum-Mapping / Alignment-Matrix (Lernziel × Abschnitt × Assessment) als eigene
Stufe: prüft Abdeckung, Doppelungen, hängende Ziele gleichzeitig.
4. "What's missing"-Critic-Agent: bekommt Thema + Guide + Referenzfakten, sucht NUR
fehlende korrekte Punkte, bessert minimal nach. Discrimination von Revision trennen.
5. "Das Wichtige" verlässlich via Mehrquellen-Konsens (Triangulation): Standard-Curricula
+ mehrere unabhängige Quellen (Schnittmenge = Kern) + LLM-Delphi (Konsens-Topics).
Quellen B:
- Backward Design: https://fctl.ucf.edu/teaching-resources/course-design/backward-design/
- Understanding by Design: https://en.wikipedia.org/wiki/Understanding_by_Design
- GPT-4 Learning Objectives: https://arxiv.org/pdf/2306.17459
- Curriculum Mapping: https://pce.sandiego.edu/curriculum-mapping/
- Critique-Guided Improvement: https://arxiv.org/pdf/2503.16024
- Delphi-Konsens (PMC): https://pmc.ncbi.nlm.nih.gov/articles/PMC8178515/
================================================================================
C) GEGEN ÜBERFORDERUNG (Struktur, Reihenfolge, Lesbarkeit)
================================================================================
1. Prerequisite-/Concept-Dependency-Graph: Konzepte = Knoten, "X braucht Y" = Kante.
Topologische Sortierung → gültige Reihenfolge (Basics zuerst). LLM extrahiert Kanten,
Zyklus-Check. Knoten mit vielen ausgehenden Kanten = Kernkonzepte, früh.
2. Knowledge-Space-Theorie (Doignon/Falmagne, ALEKS): erlaubte Wissenszustände statt fixer
Linie. Validiert Reihenfolge, schließt unmögliche Pfade aus.
3. Bloom-Progression: Remember → Understand → Apply → Analyze → Evaluate → Create.
Jeden Abschnitt taggen, monotone Progression prüfen.
4. Cognitive Load GLOBAL budgetieren (nicht nur pro Abschnitt): Working Memory ~47
Einheiten. Neue Konzepte/Abschnitt begrenzen, Spitzen glätten, schwer/leicht abwechseln.
5. Chunking + einfach→komplex: Teilfertigkeiten zuerst, dann zusammensetzen. Lange
Abschnitte automatisch splitten (Max-Chunk-Regel).
6. Scaffolding mit Fading: anfangs viele Worked Examples, Stütze schrittweise zurücknehmen.
Achtung Expertise-Reversal: was Novizen hilft, bremst Fortgeschrittene.
7. Diátaxis-Struktur: Tutorial / How-to / Reference / Explanation NICHT mischen
(häufigste Ursache verwirrender Doku). Für Lern-Guide: Tutorial + Explanation trennen.
8. Spiral-Curriculum + Spaced Retrieval: Kernideen wiederkehren lassen, aktives Abrufen.
+ Lesbarkeit (frühere Recherche): Ø-Satz ≤ 20 W, keiner > 40; ≤ ~4 neue Begriffe/Abschnitt;
eine Idee pro Absatz; Listen statt Aufzählungssätze.
Quellen C:
- Concept Graph (CMU): https://www.cs.cmu.edu/~hanxiaol/publications/yang-wsdm15.pdf
- Prerequisite Relations (AAAI): https://ojs.aaai.org/index.php/AAAI/article/view/10550
- Knowledge Spaces / ALEKS: https://www.aleks.com/about_aleks/Science_Behind_ALEKS.pdf
- Cognitive Load Strategien: https://www.structural-learning.com/post/cognitive-load-theory-a-teachers-guide
- Expertise Reversal: https://en.wikipedia.org/wiki/Expertise_reversal_effect
- Diátaxis: https://diataxis.fr/start-here/
- Spiral Curriculum: https://www.structural-learning.com/post/the-spiral-curriculum-a-teachers-guide
================================================================================
D) ARCHITEKTUR-METHODEN (Pipeline-Qualität)
================================================================================
1. GeneratorCritic-Loop NUR mit externer Erdung (Self-Refine ~+20 % bei offenen Aufgaben;
intrinsisch ohne Signal verschlechtert). Für Faktenprüfung Tool-Erdung (CRITIC).
2. Stopp-Kriterien: fast alle Gewinne in Runde 12. Stoppen bei Stabilität/Score-Delta<1/
Draft-Ähnlichkeit>0,90. Bestes Draft per Validierung wählen, nicht das letzte.
3. Rollen-Spezialisierung statt Klone: Faktenprüfer ≠ Didaktiker ≠ Lektor ≠ Zielgruppen-
Anwalt. Erlaubt kleinere/billigere Modelle pro Teilschritt.
4. Heterogenität ist der Wirkstoff von Debatte: Gewinn kommt aus VERSCHIEDENEN Modellen,
nicht aus dem Mechanismus. Identische Modelle ≈ Self-Consistency, nur teurer.
5. LLM-as-Judge mit Rubrik, BINÄR (pass/fail) statt 15; Multi-Kriterien getrennt; vage
Begriffe definieren; niedrige Temperatur; gegen 1 Experten kalibrieren.
6. Eval-Harness + Regression-Evals (CI-Gate): Golden-Set (2550 Fälle reichen anfangs),
wächst mit jedem Produktionsfehler. PR/Release blockt unter Schwelle.
7. Diminishing Returns: Voting Sweet Spot 1020 Samples; Debatte-Plateau ~3 Runden;
bei sequentiellen Aufgaben degradiert jede Multi-Agent-Variante um 3970 %.
8. Fehler-Akkumulation: 95 %/Schritt × 10 = 59 %; 90 % → 35 %. Verifier-Gate ZWISCHEN
die Stufen; zentrale Koordination begrenzt Verstärkung (4,4x statt 17,2x).
9. Pitfall Sycophancy/Konsens-Bias: Modelle stimmen zu (~4258 %); Peer-Druck-Flip ~48 %.
Fix STRUKTURELL: Mehrheit klein halten (6→3 Agenten senkt Konformität 70 %→33 %),
isolierte Selbstkorrektur vor Konsens. Prompt-Nudges ("sei standhaft") wirken NICHT.
10. Pitfall Self-Preference: Judge bevorzugt eigene Outputs (GPT-4 ~+10 %, Claude ~+25 %).
Fix: Judge ≠ Generator-Modell (Cross-Model-Judging), Positionen tauschen+mitteln.
11. Human-in-the-Loop kalibrierend, NICHT als blindes Reward (OpenAI GPT-4o-Sycophancy-
Vorfall April 2025 durch Thumbs-up/down). Experten-Review-Gate behalten.
12. MAST-Failure-Taxonomie als Architektur-Checkliste (System-Design / Inter-Agent /
Verification-Termination).
Quellen D:
- Self-Refine: https://arxiv.org/pdf/2303.17651
- CRITIC: https://arxiv.org/abs/2305.11738
- Multiagent Debate: https://arxiv.org/abs/2305.14325 ; Stop Overvaluing: https://arxiv.org/pdf/2502.08788
- LLM-as-Judge (MT-Bench): https://arxiv.org/abs/2306.05685 ; G-Eval: https://aclanthology.org/2023.emnlp-main.153/
- Eval-Prozess (Hamel): https://hamel.dev/blog/posts/llm-judge/
- Google Scaling Agent Systems: https://research.google/blog/towards-a-science-of-scaling-agent-systems-when-and-why-agent-systems-work/
- Sycophancy: https://arxiv.org/abs/2310.13548 ; Conformity: https://arxiv.org/abs/2505.21588
- MAST: https://arxiv.org/abs/2503.13657
- OpenAI Sycophancy-Postmortem: https://venturebeat.com/ai/openai-rolls-back-chatgpts-sycophancy-and-explains-what-went-wrong
================================================================================
EMPFOHLENE NÄCHSTE STUFEN FÜR UNSERE KETTE (priorisiert, größter Nutzen/Aufwand)
================================================================================
0. (Stufe ganz vorn) Lernziele definieren (Backward Design) + "das Wichtige" via
Mehrquellen-Konsens → ankert Auswahl UND Vollständigkeit.
1. Reihenfolge: Prerequisite-Graph + topologische Sortierung in/nach der Gliederung
(Basics zuerst, keine Vorgriffe).
2. Faktencheck-Gate (SAFE/CoVe) in der Inhalts-Prüfung — nutzt vorhandene Websuche;
Verifier = anderes/stärkeres Modell, BINÄRE Urteile.
3. Abstention: unbelegte Fakten raus/markieren.
4. Coverage-/"Was-fehlt"-Critic + Lernziel↔Inhalt-Mapping als Schluss-Gate (zurück bei Lücken).
5. Cognitive-Load-Pass über den ganzen Guide (neue Begriffe/Abschnitt begrenzen, schwer/leicht mischen).
6. Architektur-Hygiene: Gate zwischen jeder Stufe (Judge ≠ Generator), Loops nach 12 Runden
stoppen, Voting 1020 Samples, kleine Mehrheiten (Konsens-Bias), Golden-Set-Regression-Evals.
WARNUNG: NICHT auf "mehr gleiche Agenten" setzen. Heterogenität + externe Erdung + Gates.