This commit is contained in:
team3
2026-06-17 19:59:06 +02:00
parent c487e9cfcd
commit 0ff33271a0
10 changed files with 382 additions and 18 deletions

167
recherche.txt Normal file
View File

@@ -0,0 +1,167 @@
================================================================================
RECHERCHE: Guide-Generierungskette erweitern
Ziel: Lernen ohne Angst vor (a) Falschem, (b) fehlenden Infos,
(c) nervigem Aufbau, (d) Überforderung durch Struktur/Auswahl/Lesbarkeit.
Bestehende Kette: Auswahl → Gliederung → Inhalte → Inhalts-Check → Writer → Lese-Check.
================================================================================
## META-ERKENNTNIS (gilt übergreifend)
- "Mehr gleiche Agenten" sättigt früh und erzeugt Echo-Kammer: identische Modelle
teilen dieselben systematischen Fehler. Voting/Debatte schlagen Single-Agent nur
moderat und nicht zuverlässig besser als Self-Consistency.
- Echte Hebel: HETEROGENITÄT (andere Modelle), EXTERNE ERDUNG (Quellen/Tools/Websuche),
ROLLEN-TRENNUNG, GATES zwischen Stufen.
- Selbst-Korrektur OHNE externes Feedback verbessert Faktualität kaum, kann verschlechtern
(CommonSenseQA 75,8 → 38,1 nach 1 Runde). Nur MIT Quelle/Tool/Oracle einsetzen.
- ~41,8 % der Multi-Agent-Fehler sind System-/Spezifikations-Design, nicht Modell-Fähigkeit
(MAST). → Architektur (Rollen, Gates, Stopp-Logik) ist der größte Hebel.
================================================================================
A) GEGEN FALSCHES (faktische Korrektheit)
================================================================================
1. RAG / Grounding gegen verlässliche Quellen — stärkster Hebel gegen erfundene Fakten.
Generierung auf abgerufene Quell-Passagen beschränken. (Inhalte/Prüfen)
2. Zitat-Pflicht + Attribution: jeder Fakt braucht Inline-Quelle; gilt nur als belegt,
wenn aus dem Zitat ableitbar. Macht Fehler sichtbar/prüfbar. (Schreiben/Prüfen)
3. Claim-Extraktion + Verifikation (FActScore-Stil): Text in atomare Fakten zerlegen,
jeden einzeln gegen Quelle prüfen. Fängt einzelne falsche Sätze. (Prüfen)
4. SAFE (Search-Augmented Factuality Evaluator): Claims zerlegen → pro Claim Websuche →
per Reasoning prüfen. Übertrifft menschliche Annotatoren, ~20x billiger.
Ideal, da Websuche schon vorhanden. (Prüfen)
5. Abstention bei Unsicherheit: unbelegte/inkonsistente Fakten weglassen oder markieren
statt raten. Tauscht Coverage gegen Korrektheit — für Lerninhalte oft richtig.
6. Chain-of-Verification (CoVe): Entwurf → Verifikationsfragen → einzeln beantworten →
revidieren. Günstig (reines Prompting). (Prüfen, pro Baustein)
7. Self-Consistency: mehrere Pfade samplen, Mehrheit wählen. Nur für Varianz-Reduktion,
NICHT für Wahrheit (systematische Fehler bleiben). Sweet Spot 1020 Samples.
8. Post-hoc Revision (RARR): fertigen Text nehmen, pro Claim Evidenz suchen, widersprechende
Claims editieren, Originaltext maximal erhalten. (zwischen Schreiben und Lesbarkeit)
9. Stärkerer Verifier statt mehr gleicher Agenten: generieren günstig, verifizieren mit
stärkerem/anderem Modell. Lohnt bei schwierigen/seltenen Fakten. (Prüfen)
10. Self-Refine/Reflexion NUR mit externem Feedback (Tool/Quelle). Intrinsisch verschlechtert.
Quellen A:
- SAFE / Long-form Factuality: https://openreview.net/pdf?id=4M9f8VMt2C
- FActScore (Primer): https://aman.ai/primers/ai/factuality-in-LLMs/
- Chain-of-Verification: https://arxiv.org/pdf/2309.11495
- Grounded Attribution + Refuse: https://arxiv.org/pdf/2409.11242
- Self-Correction braucht externes Feedback: https://arxiv.org/abs/2310.01798
- When Can LLMs Self-Correct (TACL): https://direct.mit.edu/tacl/article/doi/10.1162/tacl_a_00713/125177/
- RARR: https://aclanthology.org/2023.acl-long.910/
- Weaver / Generation-Verification-Gap: https://arxiv.org/pdf/2506.18203
- Abstention-Survey: https://direct.mit.edu/tacl/article/doi/10.1162/tacl_a_00754/131566/
================================================================================
B) GEGEN LÜCKEN (Vollständigkeit)
================================================================================
1. Backward Design (Stufe 0): zuerst Lernziele definieren, DANN Inhalt generieren.
3 Schichten: "familiar with" / "important to know" / "enduring understanding".
2. Lernziele explizit als Anker-Liste (Bloom-Verben). Jeder Abschnitt wird genau einem
Lernziel zugeordnet. Ziel ohne Inhalt = Lücke; Inhalt ohne Ziel = Ballast.
3. Curriculum-Mapping / Alignment-Matrix (Lernziel × Abschnitt × Assessment) als eigene
Stufe: prüft Abdeckung, Doppelungen, hängende Ziele gleichzeitig.
4. "What's missing"-Critic-Agent: bekommt Thema + Guide + Referenzfakten, sucht NUR
fehlende korrekte Punkte, bessert minimal nach. Discrimination von Revision trennen.
5. "Das Wichtige" verlässlich via Mehrquellen-Konsens (Triangulation): Standard-Curricula
+ mehrere unabhängige Quellen (Schnittmenge = Kern) + LLM-Delphi (Konsens-Topics).
Quellen B:
- Backward Design: https://fctl.ucf.edu/teaching-resources/course-design/backward-design/
- Understanding by Design: https://en.wikipedia.org/wiki/Understanding_by_Design
- GPT-4 Learning Objectives: https://arxiv.org/pdf/2306.17459
- Curriculum Mapping: https://pce.sandiego.edu/curriculum-mapping/
- Critique-Guided Improvement: https://arxiv.org/pdf/2503.16024
- Delphi-Konsens (PMC): https://pmc.ncbi.nlm.nih.gov/articles/PMC8178515/
================================================================================
C) GEGEN ÜBERFORDERUNG (Struktur, Reihenfolge, Lesbarkeit)
================================================================================
1. Prerequisite-/Concept-Dependency-Graph: Konzepte = Knoten, "X braucht Y" = Kante.
Topologische Sortierung → gültige Reihenfolge (Basics zuerst). LLM extrahiert Kanten,
Zyklus-Check. Knoten mit vielen ausgehenden Kanten = Kernkonzepte, früh.
2. Knowledge-Space-Theorie (Doignon/Falmagne, ALEKS): erlaubte Wissenszustände statt fixer
Linie. Validiert Reihenfolge, schließt unmögliche Pfade aus.
3. Bloom-Progression: Remember → Understand → Apply → Analyze → Evaluate → Create.
Jeden Abschnitt taggen, monotone Progression prüfen.
4. Cognitive Load GLOBAL budgetieren (nicht nur pro Abschnitt): Working Memory ~47
Einheiten. Neue Konzepte/Abschnitt begrenzen, Spitzen glätten, schwer/leicht abwechseln.
5. Chunking + einfach→komplex: Teilfertigkeiten zuerst, dann zusammensetzen. Lange
Abschnitte automatisch splitten (Max-Chunk-Regel).
6. Scaffolding mit Fading: anfangs viele Worked Examples, Stütze schrittweise zurücknehmen.
Achtung Expertise-Reversal: was Novizen hilft, bremst Fortgeschrittene.
7. Diátaxis-Struktur: Tutorial / How-to / Reference / Explanation NICHT mischen
(häufigste Ursache verwirrender Doku). Für Lern-Guide: Tutorial + Explanation trennen.
8. Spiral-Curriculum + Spaced Retrieval: Kernideen wiederkehren lassen, aktives Abrufen.
+ Lesbarkeit (frühere Recherche): Ø-Satz ≤ 20 W, keiner > 40; ≤ ~4 neue Begriffe/Abschnitt;
eine Idee pro Absatz; Listen statt Aufzählungssätze.
Quellen C:
- Concept Graph (CMU): https://www.cs.cmu.edu/~hanxiaol/publications/yang-wsdm15.pdf
- Prerequisite Relations (AAAI): https://ojs.aaai.org/index.php/AAAI/article/view/10550
- Knowledge Spaces / ALEKS: https://www.aleks.com/about_aleks/Science_Behind_ALEKS.pdf
- Cognitive Load Strategien: https://www.structural-learning.com/post/cognitive-load-theory-a-teachers-guide
- Expertise Reversal: https://en.wikipedia.org/wiki/Expertise_reversal_effect
- Diátaxis: https://diataxis.fr/start-here/
- Spiral Curriculum: https://www.structural-learning.com/post/the-spiral-curriculum-a-teachers-guide
================================================================================
D) ARCHITEKTUR-METHODEN (Pipeline-Qualität)
================================================================================
1. GeneratorCritic-Loop NUR mit externer Erdung (Self-Refine ~+20 % bei offenen Aufgaben;
intrinsisch ohne Signal verschlechtert). Für Faktenprüfung Tool-Erdung (CRITIC).
2. Stopp-Kriterien: fast alle Gewinne in Runde 12. Stoppen bei Stabilität/Score-Delta<1/
Draft-Ähnlichkeit>0,90. Bestes Draft per Validierung wählen, nicht das letzte.
3. Rollen-Spezialisierung statt Klone: Faktenprüfer ≠ Didaktiker ≠ Lektor ≠ Zielgruppen-
Anwalt. Erlaubt kleinere/billigere Modelle pro Teilschritt.
4. Heterogenität ist der Wirkstoff von Debatte: Gewinn kommt aus VERSCHIEDENEN Modellen,
nicht aus dem Mechanismus. Identische Modelle ≈ Self-Consistency, nur teurer.
5. LLM-as-Judge mit Rubrik, BINÄR (pass/fail) statt 15; Multi-Kriterien getrennt; vage
Begriffe definieren; niedrige Temperatur; gegen 1 Experten kalibrieren.
6. Eval-Harness + Regression-Evals (CI-Gate): Golden-Set (2550 Fälle reichen anfangs),
wächst mit jedem Produktionsfehler. PR/Release blockt unter Schwelle.
7. Diminishing Returns: Voting Sweet Spot 1020 Samples; Debatte-Plateau ~3 Runden;
bei sequentiellen Aufgaben degradiert jede Multi-Agent-Variante um 3970 %.
8. Fehler-Akkumulation: 95 %/Schritt × 10 = 59 %; 90 % → 35 %. Verifier-Gate ZWISCHEN
die Stufen; zentrale Koordination begrenzt Verstärkung (4,4x statt 17,2x).
9. Pitfall Sycophancy/Konsens-Bias: Modelle stimmen zu (~4258 %); Peer-Druck-Flip ~48 %.
Fix STRUKTURELL: Mehrheit klein halten (6→3 Agenten senkt Konformität 70 %→33 %),
isolierte Selbstkorrektur vor Konsens. Prompt-Nudges ("sei standhaft") wirken NICHT.
10. Pitfall Self-Preference: Judge bevorzugt eigene Outputs (GPT-4 ~+10 %, Claude ~+25 %).
Fix: Judge ≠ Generator-Modell (Cross-Model-Judging), Positionen tauschen+mitteln.
11. Human-in-the-Loop kalibrierend, NICHT als blindes Reward (OpenAI GPT-4o-Sycophancy-
Vorfall April 2025 durch Thumbs-up/down). Experten-Review-Gate behalten.
12. MAST-Failure-Taxonomie als Architektur-Checkliste (System-Design / Inter-Agent /
Verification-Termination).
Quellen D:
- Self-Refine: https://arxiv.org/pdf/2303.17651
- CRITIC: https://arxiv.org/abs/2305.11738
- Multiagent Debate: https://arxiv.org/abs/2305.14325 ; Stop Overvaluing: https://arxiv.org/pdf/2502.08788
- LLM-as-Judge (MT-Bench): https://arxiv.org/abs/2306.05685 ; G-Eval: https://aclanthology.org/2023.emnlp-main.153/
- Eval-Prozess (Hamel): https://hamel.dev/blog/posts/llm-judge/
- Google Scaling Agent Systems: https://research.google/blog/towards-a-science-of-scaling-agent-systems-when-and-why-agent-systems-work/
- Sycophancy: https://arxiv.org/abs/2310.13548 ; Conformity: https://arxiv.org/abs/2505.21588
- MAST: https://arxiv.org/abs/2503.13657
- OpenAI Sycophancy-Postmortem: https://venturebeat.com/ai/openai-rolls-back-chatgpts-sycophancy-and-explains-what-went-wrong
================================================================================
EMPFOHLENE NÄCHSTE STUFEN FÜR UNSERE KETTE (priorisiert, größter Nutzen/Aufwand)
================================================================================
0. (Stufe ganz vorn) Lernziele definieren (Backward Design) + "das Wichtige" via
Mehrquellen-Konsens → ankert Auswahl UND Vollständigkeit.
1. Reihenfolge: Prerequisite-Graph + topologische Sortierung in/nach der Gliederung
(Basics zuerst, keine Vorgriffe).
2. Faktencheck-Gate (SAFE/CoVe) in der Inhalts-Prüfung — nutzt vorhandene Websuche;
Verifier = anderes/stärkeres Modell, BINÄRE Urteile.
3. Abstention: unbelegte Fakten raus/markieren.
4. Coverage-/"Was-fehlt"-Critic + Lernziel↔Inhalt-Mapping als Schluss-Gate (zurück bei Lücken).
5. Cognitive-Load-Pass über den ganzen Guide (neue Begriffe/Abschnitt begrenzen, schwer/leicht mischen).
6. Architektur-Hygiene: Gate zwischen jeder Stufe (Judge ≠ Generator), Loops nach 12 Runden
stoppen, Voting 1020 Samples, kleine Mehrheiten (Konsens-Bias), Golden-Set-Regression-Evals.
WARNUNG: NICHT auf "mehr gleiche Agenten" setzen. Heterogenität + externe Erdung + Gates.