Lauf: — ■ refresh in 10:00
Takte: Status alle 10 min · Rekonstruktionsbogen alle 2 500 Schritte (≈ 18 min) · Konvergenzmessung bei jedem Checkpoint, alle 20 000 Schritte (≈ 2,5 h)
| Step | Auflösung | Bildvorlagen | Tempo | rec | ffl | KL | Aktualisiert |
|---|---|---|---|---|---|---|---|
| — | — | — | — | — | — | — | — |
obere Reihe Original, untere Reihe Rekonstruktion · Checkpoint — · Klick: groß
Noch kein Bild.
2 000 zurückgehaltene Bilder, bei jedem Checkpoint neu gemessen · schwarz: PSNR (links) · grau: SSIM (rechts)
L1, PSNR und SSIM belohnen Glätte. Sie taugen zum Verfolgen des Fortschritts, nicht zum Beurteilen der Schärfe — dafür sind die Bilder da.
je Checkpoint ein Bogen · Klick: groß
Noch kein Verlauf.
| Parameter | Wert |
|---|---|
| Architektur | KL-Autoencoder, f=8, 8 Latent-Kanäle (vorher 4) · ch 128, ch_mult 1/2/4/4 |
| Verlust | L1 + KL (1e-6) + Focal Frequency Loss (Gewicht 10) · kein Diskriminator · kein LPIPS |
| Warum kein GAN | zwei Läufe zerstört: Magenta-Blöcke ab 50k (disc_weight 0.5), weiße Ringe ab 70k (0.15). Ohne LPIPS lenkt nichts die Textur, die der Diskriminator fordert. |
| Frequenzterm | Jiang et al., ICCV 2021 · reine FFT-Arithmetik, keine gelernten Gewichte · bestraft Unschärfe 6× härter als Rauschen (gemessen) · Ersatz für LPIPS (VGG/ImageNet), das wir aus Herkunftsgründen nicht verwenden |
| Daten | 4 776 810 ganze Bilder · megalith-cc0 (2 232 762) + PD12M (2 535 849) · keine Auswahl, kein Ästhetikfilter, kein Unschärfefilter |
| Zuschnitt | kurze Seite skaliert, dann Zufallscrop + Spiegelung · Validierung mittig |
| Holdout | 2 000 Bilder, nie im Training |
| Lernrate | — |
| Batch | — |
| GPU | RTX PRO 6000 Blackwell Max-Q · 96 GB · 300 W (leistungsbegrenzt) |
| Vorgeschichte | alter VAE: 400 000 pd-extended-Crops, 4 Kanäle, 50k@256 + 20k@512 → Neubau ab 22.09.2026 auf ganzen Bildern beider Pools |
http://lossy-vae.viewcount.org/ — aktualisiert sich alle 5 Minuten. LOSSY-512