Les meilleurs datasets de vision par ordinateur pour l'industrie manufacturière
Accédez à des datasets manufacturiers complets et fiables pour alimenter vos projets d'IA et de machine learning.
Picsellia Team
·12 min read

Automatisez l'inspection visuelle
Decouvrez comment les equipes deployent des modeles de detection de defauts sur les lignes de production avec Picsellia.
Datasets manufacturiers pour une IA améliorée dans l'industrie
Manufacturing datasets
Source de l'image
L'intelligence artificielle (IA) a considérablement transformé l'industrie manufacturière, plaçant les fabricants en position d'augmenter leur productivité et d'optimiser leurs opérations et processus. Avec la complexité croissante des processus de production et le volume toujours grandissant de données générées par les capteurs et les machines, les fabricants se tournent vers le machine learning (ML) comme un outil puissant pour obtenir des informations, optimiser les opérations et stimuler l'innovation.
Les datasets manufacturiers et les modèles de machine learning sont les éléments fondamentaux au coeur des solutions d'IA dans l'industrie manufacturière. Ils sont essentiels au succès des solutions d'IA. Des lacunes existent entre les datasets manufacturiers et le développement des modèles ML utilisés dans les solutions d'IA manufacturières.
Cet article discute des défis auxquels l'industrie manufacturière fait face avec les datasets manufacturiers lors de la mise en oeuvre de solutions d'IA et met en lumière une sélection de datasets manufacturiers publics de haute qualité qui peuvent servir de base au développement de solutions d'IA manufacturières.
Datasets manufacturiers : démystifier l'utilisation de l'IA dans l'industrie manufacturière
Pour remédier aux inefficacités de fabrication, les solutions d'IA analysent de grandes quantités de données et identifient des patterns pour améliorer la qualité et l'efficacité des opérations et des processus. Malheureusement, les données manufacturières ne sont pas facilement disponibles. Les fabricants doivent généralement construire leurs datasets à partir de zéro, ce qui implique typiquement un processus fastidieux, chronophage et manuel de prise de mesures de capteurs sur les machines en fonctionnement et de leur prétraitement ensuite.
Différentes lignes de production et industries manufacturières nécessitent des datasets différents pour développer leurs solutions, ce qui est normal avec les solutions d'IA. Cependant, dans la plupart des cas, les fabricants sont très confidentiels avec leurs données, donc il n'y a pas beaucoup de datasets manufacturiers publiquement disponibles. Certains fabricants hésitent également à partager des données en raison de préoccupations relatives à la confidentialité et à la sécurité, ainsi que de la crainte de donner un avantage à leurs concurrents.
Ces inconvénients significatifs des datasets manufacturiers découragent la capacité à développer ou mettre à l'échelle rapidement des modèles ML pour les solutions d'IA manufacturières. Voici d'autres problèmes de datasets manufacturiers rencontrés lors de la mise en oeuvre d'une solution d'IA dans l'écosystème manufacturier :
- Accès à des données de qualité : Les entreprises ont du mal à stocker des données manufacturières ou à trouver des données correspondant à leur cas d'usage IA, et quand ces données sont trouvées, elles tendent à être privées ou coûteuses à acquérir.
- Pénurie de talents en IA : Pas assez de talents en IA sont investis dans l'industrie. L'industrie manufacturière a besoin d'experts qui ne comprennent pas seulement l'IA mais peuvent traduire leurs connaissances métier pour construire des modèles d'IA manufacturiers puissants, et ces experts sont difficiles à trouver.
- Déploiements en edge : L'industrie a besoin de modèles d'IA qui peuvent être poussés en production. C'est le problème majeur qui freine la diffusion de l'IA dans l'industrie manufacturière. De nombreux modèles sont construits mais ne peuvent pas être poussés en production ou faire des prédictions en temps réel en raison de contraintes sur les appareils en edge.
- Manque d'amélioration continue : C'est un autre problème freinant l'adoption de l'IA dans l'industrie manufacturière. Un modèle d'IA apprend à partir des données qui lui sont fournies, et une fois déployé, il arrête d'apprendre et performerait très probablement mal sur de nouvelles données (c'est-à-dire des données différentes de celles utilisées pendant l'entraînement). Les modèles d'IA ne peuvent pas automatiquement apprendre de nouvelles données une fois déployés ; ils doivent être réentraînés. Cela amène les entreprises à accumuler des coûts de maintenance supplémentaires pour maintenir l'efficacité du modèle. Ce défaut est progressivement éliminé avec le MLOps grâce à l'intégration CI/CD/CT.
- Manque de standardisation : L'absence de standardisation dans les datasets manufacturiers pose un défi significatif pour le développement de l'IA dans l'environnement industriel. Ce problème découle de l'utilisation diverse de formats, d'unités et de définitions à travers les datasets, créant un état de désordre des données. Par conséquent, le manque de standardisation a plusieurs effets néfastes, tels que des conflits d'intégration de données, des modèles d'IA trompeurs et des détours chronophages pour les data scientists.
Malgré ces défis avec les datasets manufacturiers, les avantages potentiels de l'utilisation du machine learning dans la fabrication sont vastes. En comprenant et en traitant les problèmes associés aux datasets manufacturiers, les développeurs peuvent construire des solutions robustes et fiables qui améliorent l'efficacité, la qualité et la sécurité des processus de production. Voici quelques solutions :
- Employer des techniques robustes de nettoyage et de prétraitement des données.
- Promouvoir une forte collaboration entre les data scientists et les experts métier pour enrichir les connaissances et perspectives spécifiques au domaine.
- Promouvoir la démocratisation des données en démantelant les silos de données et en mettant en oeuvre des pratiques de gouvernance des données cohésives.
- Initier des moyens de générer des données synthétiques réalistes pour augmenter les datasets existants et combler les lacunes.
- Mettre en oeuvre des techniques d'apprentissage actif et permettre au modèle d'IA d'identifier de manière autonome les domaines nécessitant des données supplémentaires.
- Utiliser des techniques de transfer learning en exploitant des modèles pré-entraînés de domaines similaires pour accélérer le développement de l'IA, en se concentrant sur la construction d'un sous-ensemble de modèles d'IA manufacturiers plutôt que d'un seul modèle universel.
Néanmoins, l'IA a de nombreux domaines d'application dans l'industrie manufacturière, notamment la détection d'anomalies, la surveillance à distance des installations, l'automatisation de la production, l'optimisation de la chaîne d'approvisionnement, la prévision de la demande, la gestion de l'énergie, etc.
Les bonnes données doivent être appliquées pour construire des modèles robustes qui automatisent les processus industriels fastidieux. Les données manufacturières peuvent être toute donnée ou information recueillie pendant la fabrication d'un bien ou d'un matériau. Cela peut être des données de production, de qualité, de machine ou de consommation énergétique.
Passez à la vitesse supérieure
Picsellia centralise vos données, vos modèles et vos déploiements dans une seule plateforme. Voyez comment en 30 minutes.
Rejoignez des centaines d'ingenieurs CV qui livrent des modeles plus vite avec Picsellia
Datasets manufacturiers courants
Les données manufacturières peuvent contenir divers types de données et se présenter sous de multiples formats. Les formats tabulaires et les images sont deux des formats les plus courants pour les datasets manufacturiers. Si vous cherchez à construire des solutions d'IA évolutives applicables dans les industries manufacturières, voici quelques datasets publics de qualité que vous pouvez utiliser. Ces datasets impliquent des processus de fabrication ou des entreprises courants.
Visual Anomaly Dataset (VisA)
Manufacturing datasets
source : papperswithcode
VisA contient 12 classes de cartes électroniques et d'instruments. Il y a 10 821 images, dont 1 200 sont anormales et 10 821 ne le sont pas. Les anomalies et les défauts sont indésirables dans les matériaux, en particulier les circuits imprimés et les équipements électroniques, car ils rendent les appareils inutilisables.
Ce dataset manufacturier peut être utilisé pour détecter automatiquement quel équipement fabriqué est défectueux et lequel ne l'est pas. Cela libère les industries de devoir tester manuellement chaque produit qu'elles fabriquent. Le dataset contient des sous-ensembles de PCB, noix de cajou, chewing-gums, macaronis, capsules, etc. C'est un vaste dataset qui peut être utilisé pour divers cas d'usage.
MVTEC Anomaly Dataset (MVTecAD)
Manufacturing datasets
source : mvtec
MVTecAD contient 5 000 images haute résolution qui peuvent être utilisées pour le benchmarking de la détection d'anomalies dans l'inspection industrielle. Ces images sont subdivisées en 15 catégories d'objets et de textures, où chaque catégorie comprend un ensemble d'images d'entraînement sans défaut et un dataset de test contenant des images sans défaut mélangées avec des images défectueuses.
Avec ce type de dataset de test, il sera possible de tester la précision du modèle à identifier les images défectueuses dans une collection d'images. Deux métriques peuvent être utilisées pour évaluer ce modèle de détection d'anomalies entraîné sur MVTecAD : l'AUROC de détection et la segmentation. La méthode de détection produit un seul float par image de test d'entrée, tandis que la méthode de segmentation produit la probabilité d'anomalie pour chaque pixel.
Dataset d'équipements de protection individuelle (EPI)
Manufacturing datasets
Source de l'image
Le dataset PPE contient des images d'équipements de protection individuelle utilisés par les ouvriers d'usine. Pour assurer la sécurité des personnes et des équipements dans l'industrie, les travailleurs doivent porter certains EPI, tels que des lunettes de protection, des combinaisons, etc. Les superviseurs industriels ne seront pas toujours disponibles pour inspecter les travailleurs. Cependant, il est possible d'entraîner un modèle de vision par ordinateur pour détecter si les travailleurs portent ou non leurs EPI. Ce dataset contient 11 978 images, subdivisées en 12 classes uniques. Celles-ci sont :
- goggles
- helmet
- mask
- no-suit
- no_goggles
- no_helmet
- no_mask
- no_shoes
- shoes
- suit
- no_glove
- glove
Données d'images de produits de fonderie pour l'inspection qualité
Manufacturing datasets
Source de l'image
Les données d'images de produits de fonderie contiennent des images de produits avant la coulée. L'objectif de cette collecte de données est de permettre aux data scientists et aux ingénieurs machine learning de construire des modèles capables de détecter les défauts dans les images de produits avant qu'ils ne soient coulés. Les défauts dans les produits sont indésirables, car ils peuvent rendre le produit défectueux ou moins attrayant pour l'utilisateur.
Un défaut de coulée est une irrégularité indésirable dans un processus de coulée de métal. Il existe de nombreux types de défauts de coulée, comme les soufflures, les piqûres, les bavures, les défauts de retrait, les défauts de matériau de moule, les défauts de coulée de métal, les défauts métallurgiques, etc. Le dataset contient 7 348 images en niveaux de gris avec une dimension de 300 par 300. Ces images sont divisées en sous-catégories « Défectueux » et « Ok ».
Dataset de corrosion synthétique
Manufacturing datasets
Source de l'image
Le dataset de corrosion synthétique contient des images de tuyaux corrodés. Les tuyaux corrodés sont indésirables dans les industries manufacturières car ils ont des impacts environnementaux négatifs, causent des problèmes de contrôle qualité et provoquent des pertes de production. Ce dataset peut être utilisé pour entraîner un modèle de vision par ordinateur de détection capable de détecter quand un tuyau est corrodé et de le signaler de manière appropriée. Ce dataset contient 76 images de tuyaux et métaux corrodés qui peuvent être utilisés pour l'entraînement et la validation.
LeakDB (Leakage Diagnosis Benchmark)
LeakDB est un dataset réaliste de fuites pour les réseaux de distribution d'eau. Le dataset est composé d'un grand nombre de scénarios de fuites créés artificiellement mais réalistes sur différents réseaux de distribution d'eau dans des conditions variées. Un algorithme de notation en code MATLAB est fourni pour évaluer les résultats de différents algorithmes.
Les fuites sont indésirables dans les industries car elles font perdre aux entreprises des ressources précieuses. Ce dataset peut être appliqué dans un modèle de vision par ordinateur capable de détecter automatiquement les fuites dans les tuyaux industriels et de les signaler selon les besoins. Le dataset est disponible ici.
Dataset de classification d'images de bouteilles d'eau
Manufacturing datasets
Source de l'image
Le dataset de classification d'images de bouteilles d'eau contient des images de bouteilles partiellement ou entièrement remplies d'eau. Ce dataset peut être utilisé pour entraîner un modèle de vision par ordinateur de contrôle qualité capable de détecter quelles bouteilles ne sont pas pleines dans une usine de production. Les images sont classées en trois classes : niveau d'eau plein, niveau d'eau à moitié et débordement. Ce dataset peut être utilisé pour entraîner un modèle de machine learning qui peut être utilisé pour développer des systèmes automatisés de surveillance et de gestion des niveaux de liquide dans les conteneurs.
Une autre bonne application de ce dataset pourrait être de classer et séparer les bouteilles d'eau en fonction de leur niveau d'eau, ce qui peut aider à rationaliser le processus de fabrication dans les industries.
Essayez Picsellia gratuitement
Lancez-vous avec vos propres données. Aucune carte de crédit requise.
Rejoignez des centaines d'ingenieurs CV qui livrent des modeles plus vite avec Picsellia
Conclusion
Malgré les défis rencontrés, l'industrie manufacturière adopte de plus en plus une culture de partage ouvert des données et s'engage dans un développement collaboratif de l'IA. Les avantages potentiels de la collaboration, l'émergence de plateformes sécurisées de partage de données et la pression croissante pour adopter l'IA ne sont que quelques facteurs motivant cette tendance culturelle émergente.
Divers efforts collaboratifs au sein de l'industrie illustrent cette tendance. L'Industrial Internet Consortium (IIC) promeut mondialement l'utilisation des données et de l'IA dans la fabrication en développant des normes et des bonnes pratiques. Le Manufacturing Leadership Council (MLC), composé de dirigeants manufacturiers, s'engage activement dans des initiatives axées sur le partage de données et la collaboration pour faire avancer l'adoption de l'IA. Des acteurs majeurs comme Siemens et SAP contribuent également au paysage collaboratif.
La trajectoire globale pointe vers un avenir prometteur pour l'IA dans la fabrication. Avec une ouverture accrue et un paysage de données unifié, l'IA devrait favoriser l'émergence de solutions d'IA plus innovantes et puissantes.
Suggestions Picsellia
Vision par ordinateur pour l'industrie
Decouvrez comment Picsellia alimente la detection de defauts et le controle qualite sur les lignes de production.
Voir les solutions industrieCentralisez vos donnees visuelles
Stockez, recherchez et organisez des millions d'images en un seul endroit avec des tags, des metadonnees et la recherche par similarite visuelle.
Explorer le DatalakeRestez informe
Recevez les derniers articles sur la vision par ordinateur, le MLOps et l'IA directement dans votre boite mail.
