Skip to main content
Arka हर repo के लिए एक custom skill की आवश्यकता के बिना public GitHub repositories से data files import कर सकता है। यह repository archive download करता है, सामान्य data formats extract करता है, उन्हें locally cache करता है, और file previews के साथ एक manifest लिखता है।
प्राकृतिक भाषा उसी importer पर route होती है:

Arka क्या extract करता है

Generic importer इनके लिए repo archive स्कैन करता है:
  • .csv
  • .json
  • .jsonl / .ndjson
  • .tsv
  • .yaml / .yml
  • .xml
  • .parquet
यह node_modules, .git, venv, dist, और build जैसे स्पष्ट build और dependency folders को skip करता है।

Cache location

Imported files इनके तहत store होती हैं:
Manifest में source URL, branch, cached file paths, file sizes, और best-effort previews जैसे CSV columns या JSON keys शामिल हैं।

Licensing

Arka किसी repository के license या redistribution rights को infer नहीं करता। किसी product, dataset, demo, या public export में imported data का उपयोग करने से पहले, upstream repository के license और README का निरीक्षण करें। Heavily curated sources के लिए, Arka अभी भी arka exercises जैसा नामित preset प्रदान कर सकता है; वे presets generic GitHub dataset importer के ऊपर domain-specific normalization जोड़ सकते हैं।