|
| 1 | +"""`dataherb catalog build`: config + catalog entries + job status -> a static site in dist/.""" |
| 2 | + |
| 3 | +from __future__ import annotations |
| 4 | + |
| 5 | +import shutil |
| 6 | +from dataclasses import dataclass |
| 7 | +from pathlib import Path |
| 8 | + |
| 9 | +from dataherb.version import __version__ |
| 10 | +from .resolve import BuildIssue, build_catalog, load_entries |
| 11 | +from .config import Config |
| 12 | +from .lint import lint_dataset |
| 13 | +from .status import HEALTH_ORDER, collect |
| 14 | +from .stores import LocalStore, make_stores |
| 15 | +from .util import dump_json, iso, log, utcnow |
| 16 | +from .validate import errors |
| 17 | + |
| 18 | + |
| 19 | +@dataclass |
| 20 | +class BuildSummary: |
| 21 | + datasets: int |
| 22 | + jobs: int |
| 23 | + errors: int |
| 24 | + warnings: int |
| 25 | + out: Path |
| 26 | + |
| 27 | + |
| 28 | +def validate_inputs(cfg: Config) -> list[BuildIssue]: |
| 29 | + issues = [ |
| 30 | + BuildIssue("error", None, f"dataherb.config.yml {e}") |
| 31 | + for e in errors("config", cfg.data) |
| 32 | + ] |
| 33 | + entries, load_issues = load_entries(cfg) |
| 34 | + issues.extend(load_issues) |
| 35 | + for e in entries: |
| 36 | + doc = {k: v for k, v in e.items() if k != "_file"} |
| 37 | + for msg in errors("catalog-entry", doc): |
| 38 | + issues.append(BuildIssue("error", e.get("id"), f"{e['_file']} {msg}")) |
| 39 | + if e.get("inline"): |
| 40 | + for msg in errors("dataset", doc): |
| 41 | + issues.append(BuildIssue("warning", e.get("id"), f"{e['_file']} {msg}")) |
| 42 | + return issues |
| 43 | + |
| 44 | + |
| 45 | +def link_jobs(datasets: list[dict], jobs: list[dict]) -> None: |
| 46 | + """Attach job health to datasets, via status_job in metadata or datasets[] in status files.""" |
| 47 | + by_dataset: dict[str, set[str]] = {} |
| 48 | + for j in jobs: |
| 49 | + for d in (j.get("state") or {}).get("datasets") or []: |
| 50 | + if d.get("id"): |
| 51 | + by_dataset.setdefault(str(d["id"]), set()).add(j["id"]) |
| 52 | + job_by_id = {j["id"]: j for j in jobs} |
| 53 | + for d in datasets: |
| 54 | + ids = list( |
| 55 | + dict.fromkeys( |
| 56 | + [*d.get("status_jobs", []), *sorted(by_dataset.get(d["id"], ()))] |
| 57 | + ) |
| 58 | + ) |
| 59 | + d["status_jobs"] = ids |
| 60 | + healths = [job_by_id[i]["health"] for i in ids if i in job_by_id] |
| 61 | + d["health"] = min(healths, key=HEALTH_ORDER.index) if healths else None |
| 62 | + updated = [] |
| 63 | + for i in ids: |
| 64 | + jb = job_by_id.get(i) |
| 65 | + if not jb: |
| 66 | + continue |
| 67 | + updated.append(jb.get("last_success_at")) |
| 68 | + for ds in (jb.get("state") or {}).get("datasets") or []: |
| 69 | + if str(ds.get("id")) == d["id"] and ds.get("data_updated_at"): |
| 70 | + updated.append(ds["data_updated_at"]) |
| 71 | + d["updated_at"] = max((u for u in updated if u), default=None) |
| 72 | + |
| 73 | + |
| 74 | +def build( |
| 75 | + cfg: Config, out: Path, site_dir: Path | None = None, strict: bool = False |
| 76 | +) -> BuildSummary: |
| 77 | + started = utcnow() |
| 78 | + site_dir = site_dir or cfg.root / "site" |
| 79 | + if not (site_dir / "index.html").is_file(): |
| 80 | + raise FileNotFoundError( |
| 81 | + f"no site template at {site_dir}; build from a fork of " |
| 82 | + "https://github.com/DataHerb/dataherb-explorer or pass --site" |
| 83 | + ) |
| 84 | + issues = validate_inputs(cfg) |
| 85 | + |
| 86 | + log.info("resolving catalog") |
| 87 | + cat = build_catalog(cfg) |
| 88 | + issues.extend(cat.issues) |
| 89 | + |
| 90 | + log.info("collecting job status") |
| 91 | + jobs, status_issues = collect(cfg, now=started) |
| 92 | + issues.extend(BuildIssue(**i) for i in status_issues) |
| 93 | + |
| 94 | + link_jobs(cat.datasets, jobs) |
| 95 | + known = {j["id"] for j in jobs} |
| 96 | + for d in cat.datasets: |
| 97 | + d["quality"] = lint_dataset(d, known_jobs=known) |
| 98 | + |
| 99 | + # Assemble the site. |
| 100 | + if out.exists(): |
| 101 | + shutil.rmtree(out) |
| 102 | + shutil.copytree(site_dir, out, ignore=shutil.ignore_patterns("data", ".DS_Store")) |
| 103 | + for store in make_stores(cfg.stores, cfg.root).values(): |
| 104 | + if isinstance(store, LocalStore): |
| 105 | + store.publish(out) |
| 106 | + if ( |
| 107 | + cfg.explorer.get("duckdb", {}).get("mode") == "vendored" |
| 108 | + and not (out / "vendor" / "duckdb").exists() |
| 109 | + ): |
| 110 | + issues.append( |
| 111 | + BuildIssue( |
| 112 | + "error", |
| 113 | + None, |
| 114 | + "explorer.duckdb.mode is 'vendored' but site/vendor/duckdb is missing; run `npm ci && npm run vendor`", |
| 115 | + ) |
| 116 | + ) |
| 117 | + |
| 118 | + visible = [d for d in cat.datasets if not d.get("hidden")] |
| 119 | + n_err = sum(1 for i in issues if i.level == "error") |
| 120 | + n_warn = sum(1 for i in issues if i.level == "warning") |
| 121 | + generated = iso(utcnow()) |
| 122 | + dump_json( |
| 123 | + {**cfg.public(), "generated_at": generated, "version": __version__}, |
| 124 | + out / "data" / "config.json", |
| 125 | + ) |
| 126 | + dump_json( |
| 127 | + {"generated_at": generated, "datasets": visible}, out / "data" / "catalog.json" |
| 128 | + ) |
| 129 | + dump_json({"generated_at": generated, "jobs": jobs}, out / "data" / "status.json") |
| 130 | + dump_json( |
| 131 | + { |
| 132 | + "generated_at": generated, |
| 133 | + "duration_seconds": round((utcnow() - started).total_seconds(), 2), |
| 134 | + "version": __version__, |
| 135 | + "datasets": len(visible), |
| 136 | + "jobs": len(jobs), |
| 137 | + "errors": n_err, |
| 138 | + "warnings": n_warn, |
| 139 | + "issues": [i.as_dict() for i in issues], |
| 140 | + }, |
| 141 | + out / "data" / "build.json", |
| 142 | + pretty=True, |
| 143 | + ) |
| 144 | + (out / ".nojekyll").write_text("") |
| 145 | + if strict and n_err: |
| 146 | + raise SystemExit( |
| 147 | + f"build finished with {n_err} error(s); see {out / 'data' / 'build.json'}" |
| 148 | + ) |
| 149 | + return BuildSummary( |
| 150 | + datasets=len(visible), jobs=len(jobs), errors=n_err, warnings=n_warn, out=out |
| 151 | + ) |
0 commit comments