Uma equipe de pesquisadores da Universidade de Surrey desenvolveu um método revolucionário para transformar fotografias de cães em modelos 3D detalhados.
Transformando fotografias de cães em modelos 3D
Os pesquisadores procuraram treinar um sistema de inteligência artificial para interpretar e converter imagens 2D de cães em poses 3D.
O material de treinamento? Não são cães reais, mas sim imagens geradas por computador do mundo virtual de GTA V.
Treinamento de modelo com cães CGI
Moira Shooter, uma estudante de pós-graduação envolvida no estudo, compartilhou: “Nosso modelo foi treinado em cães em CGI – mas fomos capazes de usá-lo para criar modelos esqueléticos 3D a partir de fotografias de cães, animais reais. Isso poderia permitir que os biólogos identificassem animais selvagens feridos ou ajudar os artistas a criar animais mais realistas no metaverso.”
Os métodos tradicionais de ensino de IA sobre estruturas 3D envolvem o uso de fotos reais juntamente com dados sobre as posições 3D reais dos objetos, muitas vezes obtidas por meio de tecnologia de captura de movimento.
Criação de um banco de dados de movimentos virtuais de cães
No entanto, quando se trata de aplicar essas técnicas a cães, há muitos movimentos para realizar.
Para construir seu conjunto de dados caninos, os pesquisadores modificaram o código do GTA V para substituir seus personagens humanos por avatares caninos por meio de um processo conhecido como “modding”.
Isto permitiu-lhes produzir 118 vídeos capturando estes cães virtuais realizando diferentes ações – sentar, caminhar, latir e correr – em diferentes condições ambientais.
Usando o modelo DINOv2 AI da Meta
As próximas etapas usaram o modelo DINOv2 AI da Meta por suas fortes habilidades de generalização, refinando-o com DigiDogs para prever com precisão poses 3D a partir de imagens RGB de visualização única.
Os pesquisadores demonstraram que o uso do conjunto de dados DigiDogs para treinamento resultou em poses de cães 3D mais precisas e realistas do que aquelas treinadas em conjuntos de dados do mundo real, graças à variedade de aparências e ações dos cães capturadas.
Resultados e possíveis aplicações
Os modelos treinados no conjunto de dados sintético DigiDogs mostraram maior precisão em comparação com aqueles treinados apenas no conjunto de dados RGBD-Dogs do mundo real.
Os resultados superaram os métodos existentes, fornecendo resultados 3D detalhados e estabelecendo uma nova referência em termos de realismo e precisão para estimativa de poses de cães em 3D a partir de imagens 2D, confirmadas por avaliações qualitativas e quantitativas aprofundadas.
Embora este estudo tenha representado um grande avanço na modelagem animal 3D, a equipe reconhece que ainda há trabalho a ser feito, principalmente para melhorar a forma como o modelo prevê o aspecto de profundidade das imagens (a coordenada z).
Shooter descreveu o impacto potencial de seu trabalho, dizendo: “As poses 3D contêm muito mais informações do que as fotografias 2D. Da ecologia à animação, esta solução inteligente tem muitos usos possíveis.”
O artigo ganhou o prêmio de Melhor Artigo na Conferência de Inverno IEEE/CVF sobre Aplicações de Visão Computacional, mas também promete muitas aplicações, desde a conservação da vida selvagem até a renderização de objetos digitais 3D em aplicações de realidade virtual.
Fonte: dailyai.com





