168 lines
12 KiB
Plaintext
168 lines
12 KiB
Plaintext
================================================================================
|
||
RECHERCHE: Guide-Generierungskette erweitern
|
||
Ziel: Lernen ohne Angst vor (a) Falschem, (b) fehlenden Infos,
|
||
(c) nervigem Aufbau, (d) Überforderung durch Struktur/Auswahl/Lesbarkeit.
|
||
Bestehende Kette: Auswahl → Gliederung → Inhalte → Inhalts-Check → Writer → Lese-Check.
|
||
================================================================================
|
||
|
||
## META-ERKENNTNIS (gilt übergreifend)
|
||
- "Mehr gleiche Agenten" sättigt früh und erzeugt Echo-Kammer: identische Modelle
|
||
teilen dieselben systematischen Fehler. Voting/Debatte schlagen Single-Agent nur
|
||
moderat und nicht zuverlässig besser als Self-Consistency.
|
||
- Echte Hebel: HETEROGENITÄT (andere Modelle), EXTERNE ERDUNG (Quellen/Tools/Websuche),
|
||
ROLLEN-TRENNUNG, GATES zwischen Stufen.
|
||
- Selbst-Korrektur OHNE externes Feedback verbessert Faktualität kaum, kann verschlechtern
|
||
(CommonSenseQA 75,8 → 38,1 nach 1 Runde). Nur MIT Quelle/Tool/Oracle einsetzen.
|
||
- ~41,8 % der Multi-Agent-Fehler sind System-/Spezifikations-Design, nicht Modell-Fähigkeit
|
||
(MAST). → Architektur (Rollen, Gates, Stopp-Logik) ist der größte Hebel.
|
||
|
||
|
||
================================================================================
|
||
A) GEGEN FALSCHES (faktische Korrektheit)
|
||
================================================================================
|
||
1. RAG / Grounding gegen verlässliche Quellen — stärkster Hebel gegen erfundene Fakten.
|
||
Generierung auf abgerufene Quell-Passagen beschränken. (Inhalte/Prüfen)
|
||
2. Zitat-Pflicht + Attribution: jeder Fakt braucht Inline-Quelle; gilt nur als belegt,
|
||
wenn aus dem Zitat ableitbar. Macht Fehler sichtbar/prüfbar. (Schreiben/Prüfen)
|
||
3. Claim-Extraktion + Verifikation (FActScore-Stil): Text in atomare Fakten zerlegen,
|
||
jeden einzeln gegen Quelle prüfen. Fängt einzelne falsche Sätze. (Prüfen)
|
||
4. SAFE (Search-Augmented Factuality Evaluator): Claims zerlegen → pro Claim Websuche →
|
||
per Reasoning prüfen. Übertrifft menschliche Annotatoren, ~20x billiger.
|
||
Ideal, da Websuche schon vorhanden. (Prüfen)
|
||
5. Abstention bei Unsicherheit: unbelegte/inkonsistente Fakten weglassen oder markieren
|
||
statt raten. Tauscht Coverage gegen Korrektheit — für Lerninhalte oft richtig.
|
||
6. Chain-of-Verification (CoVe): Entwurf → Verifikationsfragen → einzeln beantworten →
|
||
revidieren. Günstig (reines Prompting). (Prüfen, pro Baustein)
|
||
7. Self-Consistency: mehrere Pfade samplen, Mehrheit wählen. Nur für Varianz-Reduktion,
|
||
NICHT für Wahrheit (systematische Fehler bleiben). Sweet Spot 10–20 Samples.
|
||
8. Post-hoc Revision (RARR): fertigen Text nehmen, pro Claim Evidenz suchen, widersprechende
|
||
Claims editieren, Originaltext maximal erhalten. (zwischen Schreiben und Lesbarkeit)
|
||
9. Stärkerer Verifier statt mehr gleicher Agenten: generieren günstig, verifizieren mit
|
||
stärkerem/anderem Modell. Lohnt bei schwierigen/seltenen Fakten. (Prüfen)
|
||
10. Self-Refine/Reflexion NUR mit externem Feedback (Tool/Quelle). Intrinsisch verschlechtert.
|
||
|
||
Quellen A:
|
||
- SAFE / Long-form Factuality: https://openreview.net/pdf?id=4M9f8VMt2C
|
||
- FActScore (Primer): https://aman.ai/primers/ai/factuality-in-LLMs/
|
||
- Chain-of-Verification: https://arxiv.org/pdf/2309.11495
|
||
- Grounded Attribution + Refuse: https://arxiv.org/pdf/2409.11242
|
||
- Self-Correction braucht externes Feedback: https://arxiv.org/abs/2310.01798
|
||
- When Can LLMs Self-Correct (TACL): https://direct.mit.edu/tacl/article/doi/10.1162/tacl_a_00713/125177/
|
||
- RARR: https://aclanthology.org/2023.acl-long.910/
|
||
- Weaver / Generation-Verification-Gap: https://arxiv.org/pdf/2506.18203
|
||
- Abstention-Survey: https://direct.mit.edu/tacl/article/doi/10.1162/tacl_a_00754/131566/
|
||
|
||
|
||
================================================================================
|
||
B) GEGEN LÜCKEN (Vollständigkeit)
|
||
================================================================================
|
||
1. Backward Design (Stufe 0): zuerst Lernziele definieren, DANN Inhalt generieren.
|
||
3 Schichten: "familiar with" / "important to know" / "enduring understanding".
|
||
2. Lernziele explizit als Anker-Liste (Bloom-Verben). Jeder Abschnitt wird genau einem
|
||
Lernziel zugeordnet. Ziel ohne Inhalt = Lücke; Inhalt ohne Ziel = Ballast.
|
||
3. Curriculum-Mapping / Alignment-Matrix (Lernziel × Abschnitt × Assessment) als eigene
|
||
Stufe: prüft Abdeckung, Doppelungen, hängende Ziele gleichzeitig.
|
||
4. "What's missing"-Critic-Agent: bekommt Thema + Guide + Referenzfakten, sucht NUR
|
||
fehlende korrekte Punkte, bessert minimal nach. Discrimination von Revision trennen.
|
||
5. "Das Wichtige" verlässlich via Mehrquellen-Konsens (Triangulation): Standard-Curricula
|
||
+ mehrere unabhängige Quellen (Schnittmenge = Kern) + LLM-Delphi (Konsens-Topics).
|
||
|
||
Quellen B:
|
||
- Backward Design: https://fctl.ucf.edu/teaching-resources/course-design/backward-design/
|
||
- Understanding by Design: https://en.wikipedia.org/wiki/Understanding_by_Design
|
||
- GPT-4 Learning Objectives: https://arxiv.org/pdf/2306.17459
|
||
- Curriculum Mapping: https://pce.sandiego.edu/curriculum-mapping/
|
||
- Critique-Guided Improvement: https://arxiv.org/pdf/2503.16024
|
||
- Delphi-Konsens (PMC): https://pmc.ncbi.nlm.nih.gov/articles/PMC8178515/
|
||
|
||
|
||
================================================================================
|
||
C) GEGEN ÜBERFORDERUNG (Struktur, Reihenfolge, Lesbarkeit)
|
||
================================================================================
|
||
1. Prerequisite-/Concept-Dependency-Graph: Konzepte = Knoten, "X braucht Y" = Kante.
|
||
Topologische Sortierung → gültige Reihenfolge (Basics zuerst). LLM extrahiert Kanten,
|
||
Zyklus-Check. Knoten mit vielen ausgehenden Kanten = Kernkonzepte, früh.
|
||
2. Knowledge-Space-Theorie (Doignon/Falmagne, ALEKS): erlaubte Wissenszustände statt fixer
|
||
Linie. Validiert Reihenfolge, schließt unmögliche Pfade aus.
|
||
3. Bloom-Progression: Remember → Understand → Apply → Analyze → Evaluate → Create.
|
||
Jeden Abschnitt taggen, monotone Progression prüfen.
|
||
4. Cognitive Load GLOBAL budgetieren (nicht nur pro Abschnitt): Working Memory ~4–7
|
||
Einheiten. Neue Konzepte/Abschnitt begrenzen, Spitzen glätten, schwer/leicht abwechseln.
|
||
5. Chunking + einfach→komplex: Teilfertigkeiten zuerst, dann zusammensetzen. Lange
|
||
Abschnitte automatisch splitten (Max-Chunk-Regel).
|
||
6. Scaffolding mit Fading: anfangs viele Worked Examples, Stütze schrittweise zurücknehmen.
|
||
Achtung Expertise-Reversal: was Novizen hilft, bremst Fortgeschrittene.
|
||
7. Diátaxis-Struktur: Tutorial / How-to / Reference / Explanation NICHT mischen
|
||
(häufigste Ursache verwirrender Doku). Für Lern-Guide: Tutorial + Explanation trennen.
|
||
8. Spiral-Curriculum + Spaced Retrieval: Kernideen wiederkehren lassen, aktives Abrufen.
|
||
+ Lesbarkeit (frühere Recherche): Ø-Satz ≤ 20 W, keiner > 40; ≤ ~4 neue Begriffe/Abschnitt;
|
||
eine Idee pro Absatz; Listen statt Aufzählungssätze.
|
||
|
||
Quellen C:
|
||
- Concept Graph (CMU): https://www.cs.cmu.edu/~hanxiaol/publications/yang-wsdm15.pdf
|
||
- Prerequisite Relations (AAAI): https://ojs.aaai.org/index.php/AAAI/article/view/10550
|
||
- Knowledge Spaces / ALEKS: https://www.aleks.com/about_aleks/Science_Behind_ALEKS.pdf
|
||
- Cognitive Load Strategien: https://www.structural-learning.com/post/cognitive-load-theory-a-teachers-guide
|
||
- Expertise Reversal: https://en.wikipedia.org/wiki/Expertise_reversal_effect
|
||
- Diátaxis: https://diataxis.fr/start-here/
|
||
- Spiral Curriculum: https://www.structural-learning.com/post/the-spiral-curriculum-a-teachers-guide
|
||
|
||
|
||
================================================================================
|
||
D) ARCHITEKTUR-METHODEN (Pipeline-Qualität)
|
||
================================================================================
|
||
1. Generator–Critic-Loop NUR mit externer Erdung (Self-Refine ~+20 % bei offenen Aufgaben;
|
||
intrinsisch ohne Signal verschlechtert). Für Faktenprüfung Tool-Erdung (CRITIC).
|
||
2. Stopp-Kriterien: fast alle Gewinne in Runde 1–2. Stoppen bei Stabilität/Score-Delta<1/
|
||
Draft-Ähnlichkeit>0,90. Bestes Draft per Validierung wählen, nicht das letzte.
|
||
3. Rollen-Spezialisierung statt Klone: Faktenprüfer ≠ Didaktiker ≠ Lektor ≠ Zielgruppen-
|
||
Anwalt. Erlaubt kleinere/billigere Modelle pro Teilschritt.
|
||
4. Heterogenität ist der Wirkstoff von Debatte: Gewinn kommt aus VERSCHIEDENEN Modellen,
|
||
nicht aus dem Mechanismus. Identische Modelle ≈ Self-Consistency, nur teurer.
|
||
5. LLM-as-Judge mit Rubrik, BINÄR (pass/fail) statt 1–5; Multi-Kriterien getrennt; vage
|
||
Begriffe definieren; niedrige Temperatur; gegen 1 Experten kalibrieren.
|
||
6. Eval-Harness + Regression-Evals (CI-Gate): Golden-Set (25–50 Fälle reichen anfangs),
|
||
wächst mit jedem Produktionsfehler. PR/Release blockt unter Schwelle.
|
||
7. Diminishing Returns: Voting Sweet Spot 10–20 Samples; Debatte-Plateau ~3 Runden;
|
||
bei sequentiellen Aufgaben degradiert jede Multi-Agent-Variante um 39–70 %.
|
||
8. Fehler-Akkumulation: 95 %/Schritt × 10 = 59 %; 90 % → 35 %. Verifier-Gate ZWISCHEN
|
||
die Stufen; zentrale Koordination begrenzt Verstärkung (4,4x statt 17,2x).
|
||
9. Pitfall Sycophancy/Konsens-Bias: Modelle stimmen zu (~42–58 %); Peer-Druck-Flip ~48 %.
|
||
Fix STRUKTURELL: Mehrheit klein halten (6→3 Agenten senkt Konformität 70 %→33 %),
|
||
isolierte Selbstkorrektur vor Konsens. Prompt-Nudges ("sei standhaft") wirken NICHT.
|
||
10. Pitfall Self-Preference: Judge bevorzugt eigene Outputs (GPT-4 ~+10 %, Claude ~+25 %).
|
||
Fix: Judge ≠ Generator-Modell (Cross-Model-Judging), Positionen tauschen+mitteln.
|
||
11. Human-in-the-Loop kalibrierend, NICHT als blindes Reward (OpenAI GPT-4o-Sycophancy-
|
||
Vorfall April 2025 durch Thumbs-up/down). Experten-Review-Gate behalten.
|
||
12. MAST-Failure-Taxonomie als Architektur-Checkliste (System-Design / Inter-Agent /
|
||
Verification-Termination).
|
||
|
||
Quellen D:
|
||
- Self-Refine: https://arxiv.org/pdf/2303.17651
|
||
- CRITIC: https://arxiv.org/abs/2305.11738
|
||
- Multiagent Debate: https://arxiv.org/abs/2305.14325 ; Stop Overvaluing: https://arxiv.org/pdf/2502.08788
|
||
- LLM-as-Judge (MT-Bench): https://arxiv.org/abs/2306.05685 ; G-Eval: https://aclanthology.org/2023.emnlp-main.153/
|
||
- Eval-Prozess (Hamel): https://hamel.dev/blog/posts/llm-judge/
|
||
- Google Scaling Agent Systems: https://research.google/blog/towards-a-science-of-scaling-agent-systems-when-and-why-agent-systems-work/
|
||
- Sycophancy: https://arxiv.org/abs/2310.13548 ; Conformity: https://arxiv.org/abs/2505.21588
|
||
- MAST: https://arxiv.org/abs/2503.13657
|
||
- OpenAI Sycophancy-Postmortem: https://venturebeat.com/ai/openai-rolls-back-chatgpts-sycophancy-and-explains-what-went-wrong
|
||
|
||
|
||
================================================================================
|
||
EMPFOHLENE NÄCHSTE STUFEN FÜR UNSERE KETTE (priorisiert, größter Nutzen/Aufwand)
|
||
================================================================================
|
||
0. (Stufe ganz vorn) Lernziele definieren (Backward Design) + "das Wichtige" via
|
||
Mehrquellen-Konsens → ankert Auswahl UND Vollständigkeit.
|
||
1. Reihenfolge: Prerequisite-Graph + topologische Sortierung in/nach der Gliederung
|
||
(Basics zuerst, keine Vorgriffe).
|
||
2. Faktencheck-Gate (SAFE/CoVe) in der Inhalts-Prüfung — nutzt vorhandene Websuche;
|
||
Verifier = anderes/stärkeres Modell, BINÄRE Urteile.
|
||
3. Abstention: unbelegte Fakten raus/markieren.
|
||
4. Coverage-/"Was-fehlt"-Critic + Lernziel↔Inhalt-Mapping als Schluss-Gate (zurück bei Lücken).
|
||
5. Cognitive-Load-Pass über den ganzen Guide (neue Begriffe/Abschnitt begrenzen, schwer/leicht mischen).
|
||
6. Architektur-Hygiene: Gate zwischen jeder Stufe (Judge ≠ Generator), Loops nach 1–2 Runden
|
||
stoppen, Voting 10–20 Samples, kleine Mehrheiten (Konsens-Bias), Golden-Set-Regression-Evals.
|
||
|
||
WARNUNG: NICHT auf "mehr gleiche Agenten" setzen. Heterogenität + externe Erdung + Gates.
|