تخطَّ إلى المحتوى الرئيسي
ActivePapers قم بتخزين بياناتك كمستندات قابلة لإعادة الحساب، بحيث يمكن إعادة تشغيل أي نتيجة منشورة والتحقق منها وحفظها.

بعض الروابط في هذا الموقع هي روابط تسويقية؛ إذا قمت بالشراء من خلالها، قد نحصل على عمولة دون أي تكلفة إضافية عليك. هذا لا يؤثر أبداً على توصياتنا. راجع إخلاء مسؤولية الروابط التسويقية لمزيد من التفاصيل. إفصاح عن التسويق بالعمولة.

تخزين البيانات القابلة لإعادة الحساب

إصدار Python إصدار JVM المدونة … مكتبة —> تخزين البيانات القابلة لإعادة الحساب بقلم كونراد هينسن، نُشر في 03 يناير 2014 سؤال يتكرر عليّ كثيرًا عند عرض ActivePapers هو: “ما الفائدة من تخزين نتائج العمليات الحسابية؟ إذا احتفظت بالكود، يمكنك ببساطة إعادة تشغيله. كل ما تحتاج إلى تخزينه هو الكود وبيانات الإدخال.” الإجابة المختصرة هي أن هذا صحيح نظريًا، لكنه أقل دقة عمليًا. أما الإجابة المفصلة، فتابع القراءة. ستتعلم أيضًا كيف يمكن لـ ActivePapers مساعدتك في كلتا الحالتين: تخزين البيانات القابلة لإعادة الحساب وعدم تخزينها. أولًا، دعنا نضع السبب الواضح لتخزين البيانات القابلة لإعادة الحساب جانبًا: قد تكون العملية الحسابية باهظة التكلفة بحيث لا يمكن تكرار تشغيلها مرارًا. هذه حالة كلاسيكية للموازنة بين وقت (إعادة) الحساب واستخدام مساحة التخزين على القرص. في كثير من الحالات، يكون الحل الوسط الأمثل هو الاحتفاظ بالبيانات الناتجة لفترة زمنية معينة، لتمكين إجراء تحليل سريع عليها إذا طرأت فكرة جديدة، دون الحاجة إلى أرشفتها لفترات طويلة. ثانيًا، هناك سبب أقل وضوحًا، علاوة على أنه سبب لا نحب تذكير أنفسنا به: قد لا تكون العملية الحسابية قابلة للتكرار بالقدر المطلوب. فالبرامج التي تنتج نتائج مختلفة قليلًا اعتمادًا على المنصة التي تُشغَّل عليها (نظام التشغيل، إصدار المترجم، …) شائعة جدًا. والبرامج التي تستخدم الحسابيات ذات الفاصلة العائمة تقع حتمًا تقريبًا في هذه الفئة. ويتفاقم الأمر عندما تكون الاختلافات بين تشغيلين لنفس البرنامج كبيرة لدرجة تغير الاستنتاجات المستخلصة من النتائج. نعم، يحدث هذا بالفعل. أخيرًا، هناك حالة شائعة جدًا لا يكون فيها تخزين بيانات مخرجات العملية الحسابية أمرًا مهمًا، لكن تخزين البيانات الوصفية المرتبطة بها يكون ضروريًا. وهنا يبرز تميز ActivePapers حقًا. تحدث هذه الحالة عندما تكون مخرجاتك القابلة لإعادة الحساب في الواقع بيانات وسيطة ضمن سير عملك الكامل. على سبيل المثال، تشغّل محاكاة ما تنتج مسارًا زمنيًا طويلًا، ثم تجري تحليلًا على هذا المسار الزمني، ومنه تولّد رسمًا بيانيًا. الرسم البياني هو نتيجتك النهائية، لذا ترغب في الاحتفاظ به. أما المسار الزمني والتحليل الأولي فهما نتيجتان وسيطتان، ولا حاجة لتخزينهما إلا إذا انطبقت عليهما إحدى الفئتين السابقتين. لكنك بالتأكيد تريد توثيق حقيقة أن رسمك البياني وُلِّد من تحليلك الأولي، الذي وُلِّد بدوره من مسار المحاكاة الزمنية. بهذه المعلومات، يمكنك أنت وأي شخص آخر يطّلع على عملك لاحقًا التحقق بسهولة من أن الرسم البياني يتوافق فعليًا مع أحدث إصدار من كود المحاكاة والتحليل الخاص بك. يوفر ActivePapers “مجموعات بيانات وهمية” للتعامل مع هذه الحالة. مجموعة البيانات الوهمية لا تحتوي على بيانات فعلية، لكنها تتضمن جميع البيانات الوصفية التي يولّدها ActivePapers أثناء تنفيذ الكودlets. وفي الوضع الحالي لـ ActivePapers، فإن الطريقة الوحيدة لإنشاء مجموعة بيانات وهمية هي أولًا إنشاء مجموعة بيانات حقيقية، ثم تشغيل جميع calclets التي تستخدمها كمدخلات، وفي النهاية استبدال مجموعة البيانات الحقيقية بمجموعة بيانات وهمية باستخدام الأمر aptool dummy … . يذكر البرنامج التعليمي أيضًا مجموعات البيانات الوهمية ويوضح كيفية إعادة حساب البيانات الأصلية. هناك مجال واسع لتحسينات مستقبلية في واجهة المستخدم الخاصة بمجموعات البيانات الوهمية. على سبيل المثال، يمكن لـ calclet الذي ينشئ مجموعة بيانات أن يحددها كمجموعة وهمية فورًا، وعندها لن تُكتب أبدًا إلى الملف، بل تُمرَّر إلى calclets cliente في الذاكرة. إذا كانت لديك أي أفكار حول هذا الموضوع، يرجى فتح مشكلة على متتبع مشاكل Github . التعليقات مدعومة من Disqus


إنشاء محفظة بيانات، مشروعًا تلو الآخر

مسارات علوم البيانات القائمة على المشاريع مع محطة موجهة ومجموعات بيانات حقيقية